toolsmith

Sem upload · tudo roda no seu navegador

SRT ou VTT — de qual arquivo de legenda você precisa?

Abra os dois num editor de texto e você vai ter dificuldade para distingui-los. As diferenças são mínimas, mas uma delas decide se uma página web vai sequer exibir a sua legenda.

Atualizado

Os dois são texto puro com marcas de tempo

Um arquivo SRT é uma lista numerada de blocos. Cada bloco tem um índice, um horário de início e fim como `00:00:01,000 --> 00:00:04,000` e as linhas a exibir. O formato é isso inteiro. A simplicidade explica por que ele aparece em toda parte — players, TVs, programas de edição, plataformas de vídeo.

VTT é a mesma ideia reescrita para a web. Foi padronizado para que navegadores pudessem exibir legendas direto num elemento de vídeo HTML, e abre espaço para coisas que o SRT nunca teve onde guardar.

As diferenças, todas elas

Não são muitas, e todas são mecânicas:

  • Um arquivo VTT precisa começar com a linha `WEBVTT`. Se ela faltar, o navegador rejeita o arquivo inteiro — é de longe o motivo mais comum de a legenda simplesmente não aparecer.
  • As frações de segundo são separadas por vírgula no SRT e por ponto no VTT.
  • O SRT exige os números de bloco. O VTT os trata como rótulos opcionais.
  • O VTT pode carregar posição, alinhamento, estilo e identificação de quem fala. O SRT não tem noção de nada disso.
  • O elemento `<track>` do vídeo HTML5 aceita apenas VTT. Ele não carrega um SRT.

Então qual você quer

Se o vídeo roda numa página web que você controla, VTT — não há escolha. Para todo o resto, SRT é o arquivo mais seguro: players de desktop, celulares, TVs, programas de edição e todas as plataformas grandes aceitam, e vários deles não aceitam VTT.

Como a conversão é mecânica, não vale sofrer com isso. Nossa ferramenta de legendas escreve os dois arquivos a partir da mesma transcrição, então leve o que o destino pedir.

Como a legenda automática é feita — e como ela falha

Legendas geradas saem de um modelo de reconhecimento de fala. O áudio é decodificado, reamostrado para 16 kHz e entregue ao modelo, que devolve o texto junto com o instante em que cada trecho começou e terminou. Aqui isso acontece dentro da aba, o que significa que o modelo precisa ser baixado antes — 151 MB ou 291 MB conforme sua escolha — então a ferramenta diz o número antes de começar, não depois.

O modo de falha que vale conhecer é que áudio ruim não produz texto um pouco pior: produz um laço. Demos a ele uma gravação de discurso de 1948 e ele devolveu a mesma sílaba repetidamente. Uma gravação moderna limpa no mesmo idioma deu cerca de quarenta palavras com dois erros. Era qualidade de gravação, não dificuldade do idioma — e por ser a falha que mais gente vai encontrar, ela é um aviso permanente na página, não uma nota escondida no FAQ.

Mas o erro mais caro é o seletor de idioma. Aponte um modelo de reconhecimento para o idioma errado e ele não para; produz um disparate fluente e confiante — medimos uma gravação em inglês transcrita como cento e vinte linhas de bobagem em coreano. Se a transcrição parece um texto plausível que não tem nada a ver com o áudio, comece por aí.

Traduzir é outro trabalho

A tradução roda mais um modelo diferente: um multilíngue de 418 milhões de parâmetros que cobre cem idiomas em qualquer direção. É pequeno o bastante para rodar numa aba, e esse tamanho define a qualidade.

A descrição honesta: de vinte linhas, cerca de quinze saem bem e cinco ficam desajeitadas mas compreensíveis. Frases comuns vão bem. Onde ele escorrega é nas expressões idiomáticas — «let's wrap this up» («vamos encerrar») saiu com sentido de «vamos começar» tanto em espanhol quanto em alemão, e isso não é um erro pequeno.

Exclamações muito curtas são o único caso em que ele não apenas escorrega, mas desmorona em repetição. Em vez de entregar isso, a ferramenta detecta o desmoronamento e deixa a linha original sem tradução, para você ver quais linhas precisam de uma pessoa.

Faça agora, sem enviar nada

Posso só renomear um .srt para .vtt?

Não. Vai faltar a linha de cabeçalho `WEBVTT`, e as marcas de tempo usam vírgula onde o VTT espera ponto. O navegador rejeita de cara. A conversão é simples, mas não é uma renomeação.

As legendas ficam gravadas no vídeo?

Não — o arquivo de legenda fica ao lado do vídeo, e o player o desenha. É o arranjo melhor: quem assiste pode desligar, você corrige um erro de digitação sem recodificar, e o mesmo vídeo pode levar vários idiomas.

O texto está fluente mas não tem nada a ver com o áudio.

O idioma está configurado errado. Um modelo de fala a quem se pede o idioma errado não falha — ele produz, com toda a confiança, um texto bem formado naquele idioma. Ajuste o idioma falado e rode de novo.

Vale a leitura