SRT ou VTT — de qual arquivo de legenda você precisa?
Abra os dois num editor de texto e você vai ter dificuldade para distingui-los. As diferenças são mínimas, mas uma delas decide se uma página web vai sequer exibir a sua legenda.
Atualizado
Os dois são texto puro com marcas de tempo
Um arquivo SRT é uma lista numerada de blocos. Cada bloco tem um índice, um horário de início e fim como `00:00:01,000 --> 00:00:04,000` e as linhas a exibir. O formato é isso inteiro. A simplicidade explica por que ele aparece em toda parte — players, TVs, programas de edição, plataformas de vídeo.
VTT é a mesma ideia reescrita para a web. Foi padronizado para que navegadores pudessem exibir legendas direto num elemento de vídeo HTML, e abre espaço para coisas que o SRT nunca teve onde guardar.
As diferenças, todas elas
Não são muitas, e todas são mecânicas:
- Um arquivo VTT precisa começar com a linha `WEBVTT`. Se ela faltar, o navegador rejeita o arquivo inteiro — é de longe o motivo mais comum de a legenda simplesmente não aparecer.
- As frações de segundo são separadas por vírgula no SRT e por ponto no VTT.
- O SRT exige os números de bloco. O VTT os trata como rótulos opcionais.
- O VTT pode carregar posição, alinhamento, estilo e identificação de quem fala. O SRT não tem noção de nada disso.
- O elemento `<track>` do vídeo HTML5 aceita apenas VTT. Ele não carrega um SRT.
Então qual você quer
Se o vídeo roda numa página web que você controla, VTT — não há escolha. Para todo o resto, SRT é o arquivo mais seguro: players de desktop, celulares, TVs, programas de edição e todas as plataformas grandes aceitam, e vários deles não aceitam VTT.
Como a conversão é mecânica, não vale sofrer com isso. Nossa ferramenta de legendas escreve os dois arquivos a partir da mesma transcrição, então leve o que o destino pedir.
Como a legenda automática é feita — e como ela falha
Legendas geradas saem de um modelo de reconhecimento de fala. O áudio é decodificado, reamostrado para 16 kHz e entregue ao modelo, que devolve o texto junto com o instante em que cada trecho começou e terminou. Aqui isso acontece dentro da aba, o que significa que o modelo precisa ser baixado antes — 151 MB ou 291 MB conforme sua escolha — então a ferramenta diz o número antes de começar, não depois.
O modo de falha que vale conhecer é que áudio ruim não produz texto um pouco pior: produz um laço. Demos a ele uma gravação de discurso de 1948 e ele devolveu a mesma sílaba repetidamente. Uma gravação moderna limpa no mesmo idioma deu cerca de quarenta palavras com dois erros. Era qualidade de gravação, não dificuldade do idioma — e por ser a falha que mais gente vai encontrar, ela é um aviso permanente na página, não uma nota escondida no FAQ.
Mas o erro mais caro é o seletor de idioma. Aponte um modelo de reconhecimento para o idioma errado e ele não para; produz um disparate fluente e confiante — medimos uma gravação em inglês transcrita como cento e vinte linhas de bobagem em coreano. Se a transcrição parece um texto plausível que não tem nada a ver com o áudio, comece por aí.
Traduzir é outro trabalho
A tradução roda mais um modelo diferente: um multilíngue de 418 milhões de parâmetros que cobre cem idiomas em qualquer direção. É pequeno o bastante para rodar numa aba, e esse tamanho define a qualidade.
A descrição honesta: de vinte linhas, cerca de quinze saem bem e cinco ficam desajeitadas mas compreensíveis. Frases comuns vão bem. Onde ele escorrega é nas expressões idiomáticas — «let's wrap this up» («vamos encerrar») saiu com sentido de «vamos começar» tanto em espanhol quanto em alemão, e isso não é um erro pequeno.
Exclamações muito curtas são o único caso em que ele não apenas escorrega, mas desmorona em repetição. Em vez de entregar isso, a ferramenta detecta o desmoronamento e deixa a linha original sem tradução, para você ver quais linhas precisam de uma pessoa.
Faça agora, sem enviar nada
Posso só renomear um .srt para .vtt?
Não. Vai faltar a linha de cabeçalho `WEBVTT`, e as marcas de tempo usam vírgula onde o VTT espera ponto. O navegador rejeita de cara. A conversão é simples, mas não é uma renomeação.
As legendas ficam gravadas no vídeo?
Não — o arquivo de legenda fica ao lado do vídeo, e o player o desenha. É o arranjo melhor: quem assiste pode desligar, você corrige um erro de digitação sem recodificar, e o mesmo vídeo pode levar vários idiomas.
O texto está fluente mas não tem nada a ver com o áudio.
O idioma está configurado errado. Um modelo de fala a quem se pede o idioma errado não falha — ele produz, com toda a confiança, um texto bem formado naquele idioma. Ajuste o idioma falado e rode de novo.
Vale a leitura
- O que é um arquivo HEIC e por que ele não abre
- PNG, JPG, WebP ou AVIF — qual você deveria usar?
- Por que seu PDF é tão pesado — e o que realmente reduz
- MOV contra MP4 — o que muda de verdade
- Como remover o fundo funciona de verdade — e quando falha
- A IA cria detalhe real ao ampliar uma imagem?
- O que são stems — e dá mesmo para separar uma música pronta?
- Por que meu PDF não abre?
- CSV contra Excel — o que muda de verdade
- Dá para confiar num resumo feito por IA?
- WAV ou MP3: qual você precisa de verdade?
- O que é um códec — e como ele difere do MP4?
- Por que meu vídeo fica deitado?