
Sin integraciones que configurar
No tienes que preparar una clave, vigilar un panel de consumo ni crear un proceso de carga. Inicia sesión y transcribe tu primera grabación en segundos; las cuentas nuevas empiezan con cinco minutos gratis.
¿Buscas gpt-transcribe? Es el nuevo modelo de transcripción de OpenAI: preciso, económico y con salida solo en texto. GPT Transcribe es la herramienta en el navegador que añade lo que falta: subtítulos SRT/VTT, etiquetas de hablante y marcas de tiempo. Sube audio o video, graba en directo o pega un enlace; empieza con cinco minutos gratis y sin configurar una clave de API.
Transcribir audio y video a texto con IA
Entrada de audio
OpenAI lanzó gpt-transcribe el 28 de julio de 2026 como su nuevo modelo recomendado de voz a texto: cuesta $0.0045 por minuto, procesa archivos unas 34 veces más rápido que el tiempo real y, en Common Voice para 22 idiomas, reduce la tasa de error por palabra del 40.37% de whisper-1 al 19.27%. Las pruebas independientes lo sitúan en una tasa del 3.31% en el benchmark de Artificial Analysis, por detrás de ElevenLabs Scribe v2, con un 2.3%, pero claramente por delante de su predecesor gpt-4o-transcribe, con un 4.01%. Admite pistas de palabras clave y varias pistas de idioma a la vez, lo que ayuda con nombres de producto y cambios de idioma. Sin embargo, devuelve texto sin formato: no incluye los archivos de subtítulos, las etiquetas de hablante ni las marcas de tiempo por palabra que requieren muchos flujos de trabajo.

Ofrece precisión con audio difícil y contexto ajustable: pistas de palabras clave para nombres de producto y siglas, y varias pistas de idioma para conversaciones que cambian de idioma a mitad de una frase. Las pistas son sugerencias, no instrucciones; una palabra clave solo aparece en la transcripción si está presente en el audio.
No genera SRT o VTT, no ofrece diarización de hablantes, marcas de tiempo por palabra ni un endpoint de traducción. Estas funciones siguen dependiendo de whisper-1 o gpt-4o-transcribe-diarize, por lo que un flujo de subtítulos o entrevistas no puede funcionar solo con gpt-transcribe.
Este sitio cubre esa necesidad desde una pestaña del navegador. La transcripción se ejecuta con OpenAI Whisper y diarización, de modo que una mesa redonda de una hora queda separada por hablante, con marcas de tiempo y lista para descargar como SRT o VTT, sin configurar una clave de API y con cinco minutos gratis para empezar.
Llamar directamente a un endpoint de transcripción implica configurar una clave, controlar la facturación por minuto, gestionar cargas, consultar los resultados y escribir el código que convierte una respuesta JSON en un archivo de subtítulos. GPT Transcribe ofrece ese flujo ya preparado.

No tienes que preparar una clave, vigilar un panel de consumo ni crear un proceso de carga. Inicia sesión y transcribe tu primera grabación en segundos; las cuentas nuevas empiezan con cinco minutos gratis.

Los archivos SRT y VTT quedan listos para añadir a una línea de tiempo de video, y las etiquetas de hablante ya vienen aplicadas. gpt-transcribe no genera ninguno de estos elementos, aunque ambos son esenciales para entrevistas y subtítulos.

TXT, SRT, VTT, DOCX, JSON y PDF. Una respuesta de API sin procesar ofrece una única estructura y deja todas las conversiones posteriores en tus manos.
Todo lo necesario para transcribir audio a texto y obtener un resultado útil.
MP3, WAV, M4A, FLAC, OGG, MP4, MOV y WebM llegan al mismo lugar: audio a texto y video a texto siguen un único proceso, sin convertir antes una grabación de pantalla.
Graba una reunión breve, una llamada con altavoz o una idea que no quieres perder; la transcripción empieza en cuanto detienes la grabación.
Proporciona una URL y GPT Transcribe obtiene el audio, algo útil cuando el archivo es grande o ya está alojado en línea.
Elige el idioma o deja que la herramienta lo detecte. La detección resulta especialmente útil en clips cortos y grabaciones que cambian de idioma.
Ve a cualquier palabra, corrige una vez un nombre mal reconocido y conserva las marcas de tiempo para que los subtítulos descargados sigan sincronizados con el video.
TXT, SRT, VTT, DOCX, JSON y PDF: subtítulos, documentos, archivos y automatizaciones posteriores sin recurrir a otra herramienta.
OpenAI lanzó gpt-transcribe el 28 de julio de 2026 y ahora lo recomienda para transcripción: en texto sin formato es más económico, bastante más preciso y procesa archivos unas 34 veces más rápido que el tiempo real. Sin embargo, su propia guía de migración enumera cuatro motivos para seguir usando whisper-1, y tres son funciones habituales en los flujos de transcripción.
| Función | gpt-transcribe | whisper-1 |
|---|---|---|
| Estado | Modelo predeterminado actual, lanzado el 28 de julio de 2026 | Modelo anterior, mantenido para marcas de tiempo, subtítulos y traducción |
| Precio por minuto | $0.0045 | $0.006, aproximadamente un 33% más |
| Tasa de error por palabra en Common Voice para 22 idiomas | 19.27% | 40.37% |
| Marcas de tiempo por palabra y segmento | No disponible | Disponible, la única opción alojada por OpenAI, mediante timestamp_granularities[] |
| Salida SRT y VTT nativa | No disponible | Disponible mediante response_format |
| Traducción al inglés | No disponible | Disponible en el endpoint /v1/audio/translations |
| Separación de hablantes | Requiere el modelo independiente gpt-4o-transcribe-diarize | Tampoco es nativa: requiere una etapa de diarización adicional |
| Pistas de palabras clave y varios idiomas | Compatible; también informa del idioma detectado | Solo admite una pista de idioma del sistema anterior |
| Eventos de transcripción en streaming | Compatible, incluidos los turnos confirmados de Realtime | No compatible |
Los precios y las funciones siguen las páginas de modelos y la guía de migración de OpenAI, revisadas el 30 de julio de 2026. Las tasas de error proceden de la comparación de Common Voice publicada por OpenAI y del benchmark independiente de Artificial Analysis, no de pruebas propias. GPT Transcribe ejecuta OpenAI Whisper con una etapa de diarización independiente, el proceso de varias etapas que OpenAI describe para generar resultados con etiquetas de hablante. Por eso este sitio entrega directamente subtítulos, marcas de tiempo y etiquetas de hablante sin que tengas que combinarlos.
Cada cuenta comienza con 5 minutos gratis, suficientes para probar una grabación real en GPT Transcribe antes de pagar. La suscripción incluye archivos de hasta 1 GB, etiquetas de hablante, el editor de transcripciones y todos los formatos de exportación; los planes Pro y superiores también incluyen resúmenes y traducción con IA. Si algún mes necesitas más tiempo, puedes comprar paquetes de créditos sin cambiar a un plan mayor.
Transcripción continua de bajo volumen con la tarifa anual más económica.
Incluye
Se cobra el año completo; la cifra mostrada es el promedio mensual.
El plan elegido por la mayoría de creadores y equipos pequeños. Las funciones de IA consumen créditos del saldo del plan.
Incluye
Se cobra el año completo; la cifra mostrada es el promedio mensual.
Para grandes volúmenes de transcripción y flujos de IA, con la mejor tarifa por minuto.
Incluye
Se cobra el año completo; la cifra mostrada es el promedio mensual.
Precios, precisión, subtítulos, el modelo en tiempo real y la tecnología de este sitio.
Es el modelo de voz a texto recomendado por OpenAI, lanzado el 28 de julio de 2026, y se usa tanto para transcribir archivos completos como para la entrada de Realtime. Acepta audio y contexto de texto opcional, devuelve texto, admite streaming y permite pistas de palabras clave y varios idiomas. Sustituyó a gpt-4o-transcribe, el modelo de marzo de 2025 que OpenAI ya no recomienda para integraciones nuevas.
Haz clic en una pregunta para ver la respuesta completa
Sube audio o video, graba en directo o pega un enlace. Obtendrás una transcripción con marcas de tiempo y hablantes separados, lista para descargar como SRT, VTT, DOCX, JSON, PDF o TXT; empieza con cinco minutos gratis.