OpenAI anunció la disponibilidad de dos nuevos modelos de inteligencia artificial orientados al procesamiento de conversaciones. Se trata de GPT-Live-Transcribe, diseñado para transcribir habla a texto con baja latencia, y GPT-Transcribe, optimizado para trabajar con archivos de audio completos mediante procesamiento por lotes y de forma asincrónica.

Según informó el laboratorio de IA desde su cuenta para desarrolladores en X, ambos modelos incorporan una mejor comprensión del contexto conversacional y buscan ofrecer transcripciones más precisas. Entre sus capacidades se incluyen un mejor reconocimiento de acentos e idiomas, frases breves, números y términos especializados, además de un desempeño optimizado en conversaciones desarrolladas con un nivel elevado de ruido de fondo.

GPT-Live-Transcribe también puede utilizar automáticamente como contexto las transcripciones generadas previamente. OpenAI compartió resultados de rendimiento obtenidos en su prueba de reconocimiento de voz con contexto, denominada Context Aware ASR. En ese análisis, la incorporación de contexto elevó la precisión semántica de GPT-Live-Transcribe del 38,5% al 44,6%, mientras que en GPT-Transcribe el indicador pasó del 41,6% al 45,2%.