Hoy buena parte del video se ve sin sonido, al menos en algún momento: durante un trayecto, en una oficina abierta o en la cama junto a alguien que duerme. Los subtítulos dejaron de ser una casilla de cumplimiento hace tiempo. También permiten seguir el contenido a una persona con pérdida auditiva, ayudan a quien no domina el idioma y permiten a quien edita encontrar, seis meses después, la frase que necesita.
La mecánica es breve: pasa el contenido final por voz a texto con GPT Transcribe para generar subtítulos automáticamente, obtén una transcripción con marcas de tiempo, corrige lo necesario, exporta SRT o VTT y revísalo en reproducción antes de publicar. Lo que sigue explica cómo hacer cada paso en el orden que evita repetir trabajo.
Subtítulos descriptivos y subtítulos de traducción
Los dos términos se intercambian con libertad, pero se pensaron para audiencias distintas. Los subtítulos descriptivos incluyen el diálogo y los sonidos relevantes —una puerta que se cierra de golpe, risas fuera de cámara— para quien no puede oír el audio. Los subtítulos de traducción presuponen que puedes oírlo y necesitas las palabras por escrito, a menudo en otro idioma.
En la práctica, la diferencia importa menos que lo que comparten: ambos son texto unido a una sincronización. Una transcripción por sí sola no aparecerá en el segundo adecuado dentro de un reproductor; precisamente por eso SRT y VTT existen como formatos independientes.
La página del W3C sobre subtítulos y transcripciones explica el caso de accesibilidad. El caso operativo es distinto y igual de real: cuando las palabras están sincronizadas, un video se vuelve algo que puedes buscar, citar y del que puedes extraer clips.
Paso 1: usa el archivo final
Genera los subtítulos a partir del montaje final. Si transcribes una edición preliminar, cada recorte posterior desplazará la sincronización de tu archivo de subtítulos; la solución no consiste en ajustarlo, sino en hacerlo de nuevo. Esto afecta sobre todo a los formatos que más se editan: clips cortos, webinars recortados, módulos de cursos y demostraciones de producto.
Decide pronto qué ocurre durante las partes sin habla. Veinte segundos de música de introducción, una tarjeta de título o una toma silenciosa de producto: ¿deben quedar los subtítulos vacíos o debe aparecer algo? Si tu plataforma acepta una transcripción y una pista de subtítulos por separado, publica ambas: una sirve para lectura y búsquedas; la otra, para la reproducción.
Abre el espacio de trabajo de voz a texto de GPT Transcribe, sube el archivo final y establece el idioma que realmente se habla. Si intervienen varias personas, mantén activadas las etiquetas de hablante mientras revisas, incluso si las eliminas de los subtítulos publicados: aceleran mucho la revisión.
Paso 2: revisa la transcripción pensando en subtítulos
Revisar para subtítulos no es lo mismo que revisar una transcripción. Una transcripción puede contener una frase de cuarenta palabras; un subtítulo debe poder leerse durante los dos segundos que permanece en pantalla mientras la imagen sigue avanzando. Por tanto, buscas otras cosas: líneas demasiado largas, puntuación ausente y frases que funcionaban en la sala pero no se entienden sin la imagen.
Los nombres merecen una revisión independiente. Marcas, invitados, funcionalidades de producto, URL y términos técnicos: ahí es donde los errores aparecen en letras de veinte puntos ante los ojos de alguien, y donde los espectadores escriben para avisarte. Corrígelos antes de exportar, no después.
Cuando varias personas hablan con rapidez, decide si las etiquetas ayudan. «Presentador:» e «Invitada:» justifican el espacio que ocupan en una entrevista o mesa redonda. En un clip social de treinta segundos, consumen una línea y no aportan nada.
Paso 3: exporta SRT o VTT
SRT es la opción segura por defecto: lo acepta casi cualquier plataforma o editor. VTT es la opción nativa de la web y admite funciones que usan los reproductores del navegador. La referencia de la API WebVTT de MDN es el lugar adecuado si tu equipo desarrolla su propia reproducción.
¿Aún no sabes cuál elegir? Usa SRT para publicación general y VTT si el video se reproduce en tu propio sitio. Exporta la transcripción en texto plano junto con cualquiera de los dos: alimentará el artículo de resumen, las notas del episodio, la página de documentación y la búsqueda dentro del sitio.
Después, súbelo y mira el video entero. Todo él, o al menos el principio, el medio y el final. La deriva en la sincronización salta a la vista durante la reproducción y es completamente invisible en un editor de texto; es el paso que la gente omite cuando tiene prisa.
Lista de comprobación de legibilidad
Comprueba tres puntos: el primer minuto, algún punto intermedio y el último minuto. Los subtítulos deben aparecer con el habla, desaparecer cuando termina y nunca tapar algo que necesitas ver. Si la plataforma permite a la audiencia cambiar el estilo de los subtítulos, míralos también en un teléfono, además de en un equipo de escritorio.
El ritmo decide si los subtítulos ayudan o se convierten en otra cosa que hay que perseguir. Una persona que habla rápido necesita segmentos más cortos, no segmentos más densos. Mantén la puntuación natural: permite que quien lee comprenda la frase antes de que desaparezca.
Por último, comprueba que el idioma declarado de los subtítulos coincida con los metadatos del video. Es un campo pequeño que determina si la audiencia puede encontrar la pista adecuada y si la plataforma entiende qué está alojando.
Usar subtítulos para SEO y reutilizar contenido
Los subtítulos sirven a la audiencia; la transcripción que hay debajo sirve para todo lo demás. Un webinar se convierte en un artículo de resumen. Un podcast se convierte en notas del episodio. Una demostración se convierte en el primer borrador de una documentación que nadie quería redactar.
Lo que no funciona es pegar una transcripción sin tratar en una página y llamarla artículo. El lenguaje hablado se lee mal en una pantalla, y una pared de discurso sin editar no sirve ni a quien lee ni a un buscador. Úsala como fuente: extrae un esquema, redacta encabezados de verdad y añade los ejemplos que la persona mostró con un gesto pero nunca explicó.
Si buscas un punto de partida, pasa el video por GPT Transcribe, exporta la transcripción, marca las tres secciones que merece la pena conservar y construye el artículo a partir de ellas.
Preguntas frecuentes
¿Puede GPT Transcribe generar archivos SRT?
Sí: transcribe con sincronización, revisa el texto y exporta como SRT. Ese archivo se integra directamente en una plataforma de video o un editor.
¿Debo usar SRT o VTT?
SRT ofrece la mayor compatibilidad entre plataformas; VTT sirve para reproductores web y funciones nativas del navegador. Si no está claro cuál necesitas, exporta ambos y comprueba cuál prefiere tu herramienta de publicación.
¿Los subtítulos ayudan al SEO?
De forma indirecta. Los beneficios de accesibilidad e interacción son directos; el beneficio SEO procede de lo que construyes a partir de la transcripción —una página editada y estructurada—, no del archivo de subtítulos en sí.




