SRT o VTT — ¿qué archivo de subtítulos necesitas?
Ábrelos en un editor de texto y te costará distinguirlos. Las diferencias son mínimas, pero una de ellas decide si una página web llegará siquiera a mostrar tus subtítulos.
Actualizado
Los dos son texto plano con marcas de tiempo
Un archivo SRT es una lista numerada de bloques. Cada bloque tiene un índice, una hora de inicio y fin del estilo `00:00:01,000 --> 00:00:04,000`, y las líneas que hay que mostrar. Ese es el formato entero. Su sencillez explica que aparezca en todas partes: reproductores, televisores, programas de edición, plataformas de vídeo.
VTT es la misma idea reescrita para la web. Se estandarizó para que los navegadores pudieran mostrar subtítulos directamente en un elemento de vídeo HTML, y añade sitio para cosas que en SRT no lo tenían.
Las diferencias, todas
No son muchas y todas son mecánicas:
- Un archivo VTT tiene que empezar por la línea `WEBVTT`. Si falta, el navegador rechaza el archivo entero: es el motivo más común de que los subtítulos no aparezcan sin decir nada.
- Las fracciones de segundo se separan con coma en SRT y con punto en VTT.
- SRT exige los números de bloque. VTT los trata como etiquetas opcionales.
- VTT puede llevar posición, alineación, estilo e identificación de quien habla. SRT no tiene noción de nada de eso.
- El elemento `<track>` del vídeo HTML5 solo acepta VTT. No cargará un SRT.
Entonces, ¿cuál quieres?
Si el vídeo se reproduce en una página web que controlas, VTT: no hay elección. Para todo lo demás, SRT es el archivo seguro — reproductores de escritorio, móviles, televisores, programas de edición y todas las plataformas grandes lo aceptan, y varios de ellos no aceptan VTT.
Como la conversión es mecánica, no merece la pena agonizar. Nuestra herramienta de subtítulos escribe los dos archivos a partir de la misma transcripción, así que llévate el que pida el destino.
Cómo se generan los subtítulos automáticos y cómo fallan
Los subtítulos generados salen de un modelo de reconocimiento de voz. El audio se decodifica, se remuestrea a 16 kHz y se le pasa al modelo, que devuelve texto junto con el momento de inicio y fin de cada segmento. Aquí eso ocurre dentro de la pestaña, lo que significa que primero hay que descargar el modelo — 151 MB o 291 MB según el que elijas — así que la herramienta dice la cifra antes de empezar, no después.
El modo de fallo que conviene conocer es que un audio malo no da un texto algo peor: da un bucle. Le dimos una grabación de un discurso de 1948 y devolvió la misma sílaba una y otra vez. Una grabación moderna limpia en el mismo idioma dio unas cuarenta palabras con dos errores. Era calidad de grabación, no dificultad del idioma; y como es el fallo con el que más gente se topará, está como aviso permanente en la página y no escondido en unas preguntas frecuentes.
Pero el error que más caro sale es el selector de idioma. Apunta un modelo de reconocimiento al idioma equivocado y no se detendrá: producirá disparates fluidos y seguros de sí mismos — medimos una grabación en inglés transcrita como ciento veinte líneas de galimatías en coreano. Si la transcripción parece texto plausible que no tiene nada que ver con el audio, empieza por ahí.
Traducirlos es otro trabajo distinto
La traducción usa otro modelo más: uno multilingüe de 418 millones de parámetros que maneja cien idiomas en cualquier dirección. Es lo bastante pequeño para correr en una pestaña, y ese tamaño marca la calidad.
La descripción honesta: de veinte líneas, unas quince salen bien y cinco quedan torpes pero se entienden. Las frases normales van bien. Donde resbala es en los modismos — «let's wrap this up» («vamos a ir terminando») salió con el sentido de «vamos a empezar» tanto en español como en alemán, y eso no es un error pequeño.
Las exclamaciones muy cortas son el único caso en el que no resbala sino que se derrumba y repite. En vez de entregar eso, la herramienta detecta el derrumbe y deja la línea original sin traducir, para que veas qué líneas necesitan una persona.
Hazlo ahora, sin subir nada
¿Puedo renombrar un .srt a .vtt y ya está?
No. Le faltará la línea de cabecera `WEBVTT` y sus marcas de tiempo usan comas donde VTT espera puntos. El navegador lo rechazará sin más. La conversión es sencilla, pero no es un cambio de nombre.
¿Los subtítulos quedan incrustados en el vídeo?
No: el archivo de subtítulos va al lado del vídeo y lo dibuja el reproductor. Es la mejor disposición — quien mira puede quitarlos, tú puedes corregir una errata sin recodificar, y el mismo vídeo puede llevar varios idiomas.
El texto es fluido pero no tiene nada que ver con el audio.
El idioma está mal puesto. Un modelo de voz al que se le pide el idioma equivocado no falla: produce con total seguridad un texto bien formado en ese idioma. Ajusta el idioma hablado y vuelve a ejecutarlo.
Vale la pena leer
- Qué es un archivo HEIC y por qué no abre
- PNG, JPG, WebP o AVIF: ¿cuál deberías usar?
- Por qué tu PDF pesa tanto y qué lo reduce de verdad
- MOV frente a MP4: qué cambia de verdad
- Cómo funciona quitar el fondo de verdad — y cuándo falla
- ¿La IA añade detalle real al ampliar una imagen?
- Qué son los stems — ¿y de verdad se puede desmezclar una canción?
- ¿Por qué no se abre mi PDF?
- CSV frente a Excel — qué cambia de verdad
- ¿Se puede fiar uno de un resumen hecho por IA?
- WAV o MP3: ¿cuál necesitas realmente?
- ¿Qué es un códec y en qué se diferencia de MP4?
- ¿Por qué mi vídeo sale de lado?