Transcrever áudio com IA em português europeu (PT‑PT) em 2026
Em 2026, a transcrição automática em português europeu atinge 96% de precisão sobre áudio limpo. Esta análise mostra os modelos certos, os custos reais e os truques para chegar a 99%.
Em 2018, transcrever uma hora de entrevista em português manualmente custava entre €40 e €80 a um profissional, e demorava 4‑8 horas. Em 2026, custa €0,30 e demora 90 segundos. Esta é a análise do que mudou — e dos limites que ainda existem.
O estado da arte em PT‑PT
Os modelos de speech‑to‑text (STT) atuais para português europeu:
| Modelo | Precisão (clean) | Precisão (noisy) | Preço/min | Timestamps por palavra |
|---|---|---|---|---|
| Grok STT (xAI) | 96.5% | 88% | €0,005 | ✅ |
| Whisper Large v3 | 96.0% | 87% | €0 (self-host) | ✅ |
| AssemblyAI Nano | 95.5% | 86% | €0,003 | ✅ |
| Google Cloud STT | 94.0% | 84% | €0,016 | ✅ |
| Azure Speech | 94.5% | 85% | €0,012 | ✅ |
| Deepgram Nova‑3 | 95.0% | 86% | €0,004 | ✅ |
| Whisper API (OpenAI) | 96.0% | 87% | €0,006 | ✅ |
A diferença entre o melhor (Grok STT) e o pior (Google Cloud) em condições limpas é de 2.5 pontos percentuais — perceptível mas não dramática. Em áudio ruidoso, a diferença sobe a 4 pontos.
O que afeta a precisão
Por ordem de impacto:
1. Qualidade do microfone (impacto: ±5%)
Microfone de telemóvel a 30 cm da boca tem ruído de fundo, ressonância de sala, e variações de volume. Microfone profissional (Shure SM7B, Rode NT‑USB) elimina 90% disso.
Se grava regularmente: invista €100‑200 num microfone USB. Aumenta a precisão final em 4‑5 pontos sem mudar de modelo.
2. Sotaque e velocidade (impacto: ±3%)
Os modelos de STT em PT‑PT são treinados maioritariamente em sotaques de Lisboa e Coimbra. Sotaques do norte (Porto, Braga) e Açores têm 2‑3 pontos a menos. Falantes muito rápidos perdem mais 1‑2 pontos.
Truque: falar 10‑15% mais devagar do que conversação normal melhora drasticamente a precisão.
3. Vocabulário técnico (impacto: ±3%)
Os modelos generalistas falham em terminologia médica, jurídica, financeira específica. "Hipotireoidismo subclínico" sai como "hipo‑tireoidismo sub‑clínico" ou pior.
Solução: glossário customizável. O transcript.pt aceita uma lista de 50‑200 termos específicos do seu domínio que pré‑treinamos no pós‑processamento.
4. Múltiplos falantes (impacto: ±5%)
Identificação de quem fala (diarização) é mais difícil em PT‑PT do que em inglês — os modelos têm menos dados de conversação multi‑falante. Em entrevistas com 2 pessoas, precisão da diarização: 85‑90%. Com 4+ pessoas, cai a 70‑75%.
Truque: se possível, gravar cada pessoa em canal separado (microfone individual).
Receita para entrevista de 60 minutos
Caso real: jornalista com entrevista gravada no telemóvel, 60 minutos, 2 falantes, qualidade média.
- Upload do ficheiro (.mp3, .m4a, .wav, .mp4) — até 2 GB no transcript.pt
- Selecionar PT‑PT como língua principal — não autodetect
- Marcar "2 falantes" — ativa diarização
- Render: 90 segundos para 60 minutos
- Editor de transcrição: corrigir nomes próprios, terminologia. Tipicamente 5‑10 correções por hora.
- Exportar em .docx (formatado), .srt (legendas), .vtt, ou .json (timestamps)
Custo total: €0,30 (60 min × €0,005). Tempo total: 90 seg de render + 10‑15 min de edição = ~17 min vs 4‑8 horas manuais.
Onde a transcrição automática falha
Avisos honestos para 2026:
- Música de fundo — qualquer música baixa precisão em 3‑5 pontos
- Falas sussurradas — modelos perdem palavras inteiras
- Múltiplos falantes a falarem em simultâneo — caos
- Crianças — vozes infantis têm menos dados de treino
- Risadas e pausas — geralmente ignoradas (algumas vezes desejável, outras não)
Para casos legais (depoimentos em tribunal), a transcrição automática serve como rascunho — mas precisa sempre revisão manual.
Casos práticos típicos
Jornalismo
Entrevistas de 30‑90 minutos, transcrição com timestamps por frase. Editor seleciona citações com timestamp para verificação posterior. Eliminação de muletas linguísticas ("hum", "tipo", "não é") é configurável.
Podcasts
Episódios de 60‑120 minutos com 2‑4 falantes. Transcrição → SEO (publicar transcrição como página do episódio melhora ranking 30‑40%) + capítulos automáticos baseados em mudanças de tópico.
Reuniões corporativas
Reuniões de 30‑60 minutos via Zoom/Meet. Transcrição + sumário automático + lista de "action items". Foco em diarização precisa.
Conteúdo educativo
Aulas e webinars. Transcrição → legendas automáticas (acessibilidade) + exportação para curso escrito. Pode adicionar pontos de revisão automáticos a cada 5 minutos.
Entrevistas qualitativas (UX research)
Sessões de 45‑60 minutos. Transcrição + tagging de temas (manual) + pesquisa por palavra‑chave entre 20‑30 entrevistas. transcript.pt tem feature dedicado.
Como o transcript.pt difere
Construímos especificamente para o mercado português:
- PT‑PT vs PT‑BR distinguidos automaticamente — pontuação e formatação adequadas a cada
- Glossário customizável — sobe para 99% precisão em domínios técnicos
- Editor inline com sincronização ao áudio (clica numa palavra, ouve aquele momento)
- Faturação NIF + Multibanco — sem fricção para empresas portuguesas
- Confidencialidade — ficheiros apagados 24h após download. Logs apenas de hash.
Preço: €0,005/minuto avulso, ou €19/mês com 142 000 créditos (~30 horas de áudio).
Próximo passo
Se tem áudio para transcrever, abra o transcript.pt e faça upload. Os primeiros 10 minutos são gratuitos, sem cartão. Em 60 segundos, recebe a primeira transcrição com timestamps por palavra.
Para volume superior a 50 horas/mês, falamos de planos dedicados — escreva‑nos para hello@transcript.pt.