Transcribe audio y video a texto con subtítulos y etiquetas de hablante

¿Buscas gpt-transcribe? Es el nuevo modelo de transcripción de OpenAI: preciso, económico y con salida solo en texto. GPT Transcribe es la herramienta en el navegador que añade lo que falta: subtítulos SRT/VTT, etiquetas de hablante y marcas de tiempo. Sube audio o video, graba en directo o pega un enlace; empieza con cinco minutos gratis y sin configurar una clave de API.

🎬 Subtítulos SRT y VTT🗣️ Separación de hablantes🌍 100 idiomas
Panel de cargaListo

Transcribir audio y video a texto con IA

Iniciar sesión

Entrada de audio

OpenAI WhisperDiarización con WhisperMarcas de tiempo por palabraSRT · VTT · DOCX · JSON · PDF · TXTEntrada de audio y video
El modelo detrás del nombre · julio de 2026

Qué es gpt-transcribe y qué deja fuera

OpenAI lanzó gpt-transcribe el 28 de julio de 2026 como su nuevo modelo recomendado de voz a texto: cuesta $0.0045 por minuto, procesa archivos unas 34 veces más rápido que el tiempo real y, en Common Voice para 22 idiomas, reduce la tasa de error por palabra del 40.37% de whisper-1 al 19.27%. Las pruebas independientes lo sitúan en una tasa del 3.31% en el benchmark de Artificial Analysis, por detrás de ElevenLabs Scribe v2, con un 2.3%, pero claramente por delante de su predecesor gpt-4o-transcribe, con un 4.01%. Admite pistas de palabras clave y varias pistas de idioma a la vez, lo que ayuda con nombres de producto y cambios de idioma. Sin embargo, devuelve texto sin formato: no incluye los archivos de subtítulos, las etiquetas de hablante ni las marcas de tiempo por palabra que requieren muchos flujos de trabajo.

Espacio de trabajo de GPT Transcribe con una grabación subida y su transcripción

Puntos fuertes de gpt-transcribe

Ofrece precisión con audio difícil y contexto ajustable: pistas de palabras clave para nombres de producto y siglas, y varias pistas de idioma para conversaciones que cambian de idioma a mitad de una frase. Las pistas son sugerencias, no instrucciones; una palabra clave solo aparece en la transcripción si está presente en el audio.

Dónde se detiene

No genera SRT o VTT, no ofrece diarización de hablantes, marcas de tiempo por palabra ni un endpoint de traducción. Estas funciones siguen dependiendo de whisper-1 o gpt-4o-transcribe-diarize, por lo que un flujo de subtítulos o entrevistas no puede funcionar solo con gpt-transcribe.

Lo que añade GPT Transcribe

Este sitio cubre esa necesidad desde una pestaña del navegador. La transcripción se ejecuta con OpenAI Whisper y diarización, de modo que una mesa redonda de una hora queda separada por hablante, con marcas de tiempo y lista para descargar como SRT o VTT, sin configurar una clave de API y con cinco minutos gratis para empezar.

Herramienta frente a endpoint

Por qué usar esta herramienta en lugar de llamar a la API

Llamar directamente a un endpoint de transcripción implica configurar una clave, controlar la facturación por minuto, gestionar cargas, consultar los resultados y escribir el código que convierte una respuesta JSON en un archivo de subtítulos. GPT Transcribe ofrece ese flujo ya preparado.

Flujo de GPT Transcribe desde la carga de audio o video hasta la transcripción exportada

Sin integraciones que configurar

No tienes que preparar una clave, vigilar un panel de consumo ni crear un proceso de carga. Inicia sesión y transcribe tu primera grabación en segundos; las cuentas nuevas empiezan con cinco minutos gratis.

Casos de uso de transcripción para reuniones, entrevistas, pódcasts, clases y subtítulos

Subtítulos y hablantes desde el primer momento

Los archivos SRT y VTT quedan listos para añadir a una línea de tiempo de video, y las etiquetas de hablante ya vienen aplicadas. gpt-transcribe no genera ninguno de estos elementos, aunque ambos son esenciales para entrevistas y subtítulos.

Panel de transcripción de GPT Transcribe con opciones de búsqueda, edición y exportación

Seis formatos de exportación, no una sola respuesta

TXT, SRT, VTT, DOCX, JSON y PDF. Una respuesta de API sin procesar ofrece una única estructura y deja todas las conversiones posteriores en tus manos.

Funciones de transcripción con IA

Todo lo necesario para transcribir audio a texto y obtener un resultado útil.

Audio y video en un mismo lugar

MP3, WAV, M4A, FLAC, OGG, MP4, MOV y WebM llegan al mismo lugar: audio a texto y video a texto siguen un único proceso, sin convertir antes una grabación de pantalla.

Graba sin salir de la página

Graba una reunión breve, una llamada con altavoz o una idea que no quieres perder; la transcripción empieza en cuanto detienes la grabación.

Pega un enlace multimedia

Proporciona una URL y GPT Transcribe obtiene el audio, algo útil cuando el archivo es grande o ya está alojado en línea.

100 idiomas con detección automática

Elige el idioma o deja que la herramienta lo detecte. La detección resulta especialmente útil en clips cortos y grabaciones que cambian de idioma.

Busca y corrige en el mismo lugar

Ve a cualquier palabra, corrige una vez un nombre mal reconocido y conserva las marcas de tiempo para que los subtítulos descargados sigan sincronizados con el video.

Seis formatos de exportación

TXT, SRT, VTT, DOCX, JSON y PDF: subtítulos, documentos, archivos y automatizaciones posteriores sin recurrir a otra herramienta.

Comparación de modelos

gpt-transcribe frente a Whisper: qué hace realmente cada uno

OpenAI lanzó gpt-transcribe el 28 de julio de 2026 y ahora lo recomienda para transcripción: en texto sin formato es más económico, bastante más preciso y procesa archivos unas 34 veces más rápido que el tiempo real. Sin embargo, su propia guía de migración enumera cuatro motivos para seguir usando whisper-1, y tres son funciones habituales en los flujos de transcripción.

Funcióngpt-transcribewhisper-1
EstadoModelo predeterminado actual, lanzado el 28 de julio de 2026Modelo anterior, mantenido para marcas de tiempo, subtítulos y traducción
Precio por minuto$0.0045$0.006, aproximadamente un 33% más
Tasa de error por palabra en Common Voice para 22 idiomas19.27%40.37%
Marcas de tiempo por palabra y segmentoNo disponibleDisponible, la única opción alojada por OpenAI, mediante timestamp_granularities[]
Salida SRT y VTT nativaNo disponibleDisponible mediante response_format
Traducción al inglésNo disponibleDisponible en el endpoint /v1/audio/translations
Separación de hablantesRequiere el modelo independiente gpt-4o-transcribe-diarizeTampoco es nativa: requiere una etapa de diarización adicional
Pistas de palabras clave y varios idiomasCompatible; también informa del idioma detectadoSolo admite una pista de idioma del sistema anterior
Eventos de transcripción en streamingCompatible, incluidos los turnos confirmados de RealtimeNo compatible

Los precios y las funciones siguen las páginas de modelos y la guía de migración de OpenAI, revisadas el 30 de julio de 2026. Las tasas de error proceden de la comparación de Common Voice publicada por OpenAI y del benchmark independiente de Artificial Analysis, no de pruebas propias. GPT Transcribe ejecuta OpenAI Whisper con una etapa de diarización independiente, el proceso de varias etapas que OpenAI describe para generar resultados con etiquetas de hablante. Por eso este sitio entrega directamente subtítulos, marcas de tiempo y etiquetas de hablante sin que tengas que combinarlos.

Precios de GPT Transcribe

Cada cuenta comienza con 5 minutos gratis, suficientes para probar una grabación real en GPT Transcribe antes de pagar. La suscripción incluye archivos de hasta 1 GB, etiquetas de hablante, el editor de transcripciones y todos los formatos de exportación; los planes Pro y superiores también incluyen resúmenes y traducción con IA. Si algún mes necesitas más tiempo, puedes comprar paquetes de créditos sin cambiar a un plan mayor.

Starter

$9.90$4.90/mes

Transcripción continua de bajo volumen con la tarifa anual más económica.

Incluye

  • 1,440 minutos de transcripción al año
  • Equivale a 120 minutos al mes
  • Cobro anual único de $58.80
  • Archivos de hasta 1 GB, subidos o grabados en la página
  • Marcas de tiempo y etiquetas por hablante
  • Editor de transcripciones en el navegador
  • Seis formatos de exportación: TXT, SRT, VTT, JSON, PDF, DOCX

Se cobra el año completo; la cifra mostrada es el promedio mensual.

Pro

Mejor relación calidad-precio
$29.90$14.90/mes

El plan elegido por la mayoría de creadores y equipos pequeños. Las funciones de IA consumen créditos del saldo del plan.

Incluye

  • 7,200 minutos de transcripción al año
  • Equivale a 600 minutos al mes
  • Cobro anual único de $178.80
  • Todo lo incluido en Starter
  • Resumen y análisis con IA para cualquier transcripción
  • Preguntas sobre una transcripción mediante chat
  • Traducción a 100+ idiomas
  • Las funciones de IA consumen créditos; una nueva traducción usa los minutos facturados de la transcripción
  • Envío por correo de transcripciones, resúmenes y traducciones

Se cobra el año completo; la cifra mostrada es el promedio mensual.

Max

$49.90$24.90/mes

Para grandes volúmenes de transcripción y flujos de IA, con la mejor tarifa por minuto.

Incluye

  • 36,000 minutos de transcripción al año
  • Equivale a 3,000 minutos al mes
  • Cobro anual único de $298.80
  • Todo lo incluido en Pro
  • El menor costo por minuto para grandes volúmenes
  • Pensado para procesar lotes de una sola vez
  • Resumen, análisis y chat de transcripciones con IA incluidos
  • Las funciones de IA consumen créditos; una nueva traducción usa los minutos facturados de la transcripción
  • Traducción a 100+ idiomas con envío por correo
  • Tu audio se almacena de forma privada

Se cobra el año completo; la cifra mostrada es el promedio mensual.

Preguntas frecuentes

Preguntas frecuentes sobre gpt-transcribe

Precios, precisión, subtítulos, el modelo en tiempo real y la tecnología de este sitio.

Es el modelo de voz a texto recomendado por OpenAI, lanzado el 28 de julio de 2026, y se usa tanto para transcribir archivos completos como para la entrada de Realtime. Acepta audio y contexto de texto opcional, devuelve texto, admite streaming y permite pistas de palabras clave y varios idiomas. Sustituyó a gpt-4o-transcribe, el modelo de marzo de 2025 que OpenAI ya no recomienda para integraciones nuevas.

Haz clic en una pregunta para ver la respuesta completa

Transcribe una grabación con GPT Transcribe

Sube audio o video, graba en directo o pega un enlace. Obtendrás una transcripción con marcas de tiempo y hablantes separados, lista para descargar como SRT, VTT, DOCX, JSON, PDF o TXT; empieza con cinco minutos gratis.

En tiempo realPrivacidad ante todoSin configuración