Meta presentó Muse Voice Transcribe, un modelo de voz en tiempo real desarrollado por Meta Superintelligence Labs. La herramienta forma parte de la familia Muse Spark y utiliza un enfoque multimodal autorregresivo para convertir conversaciones de audio en texto, incluso cuando intervienen varios participantes.
El sistema procesa el audio en fragmentos de 80 milisegundos, equivalentes a 12,5 Hz, y aplica una técnica denominada retraso adaptativo. Este mecanismo ajusta de forma dinámica la demora que introduce el modelo para anticipar la siguiente palabra, de acuerdo con la complejidad del contenido. Según explicó Meta, el objetivo es alcanzar “un equilibrio óptimo entre velocidad y precisión, medido por el tiempo necesario para la transcripción final”.
Muse Voice Transcribe fue entrenado en más de 70 idiomas, aunque la compañía indicó que 25 fueron ampliamente verificados. Entre ellos figuran el español, el portugués, el alemán, el italiano, el inglés, el chino mandarín y el árabe. Además, el modelo puede diferenciar en tiempo real hasta 20 participantes y asignarles identificadores individuales, como “hablante 1” y “hablante 2”.
La propuesta también admite de manera nativa entradas de audio de larga duración, que pueden superar una hora. Meta señaló que la precisión puede reforzarse mediante información sobre el idioma, palabras clave y contexto.



