Alibaba presentó Qwen3.8-Omni-Flash, un nuevo modelo de inteligencia artificial orientado al procesamiento de múltiples modalidades. Según los datos difundidos por Alibaba Cloud, el sistema supera a Gemini 3.8 Flash, de Google, en distintas tareas vinculadas con la voz y la interacción mediante audio, al tiempo que reduce de forma significativa los costos de uso de su API frente a la generación anterior.

El equipo de Qwen describió el modelo como una evolución de los sistemas que se limitan a comprender información de diferentes formatos. La nueva propuesta está diseñada para planificar tareas, utilizar herramientas y ejecutar flujos de trabajo propios de agentes de inteligencia artificial en escenarios de productividad, de acuerdo con la información proporcionada por la compañía.

Los benchmarks publicados por Alibaba Cloud muestran mejoras en el reconocimiento de voz cuando participan varios interlocutores, con tasas de error que la empresa califica como muy bajas. Además, el modelo obtuvo el mejor resultado entre los sistemas comparados en comprensión musical. En la prueba de detección de sonidos SpotSoundBench, Qwen3.8-Omni-Flash alcanzó 67,2 puntos, frente a los 39,7 registrados por Gemini 3.8 Flash.

La compañía también informó una reducción superior al 98% en los precios asociados al procesamiento de audio y de más del 93% en el apartado audiovisual. En términos generales, el costo de la API habría disminuido más de un 93% respecto de la generación anterior. Estas cifras ubican al lanzamiento en la competencia entre modelos de pesos abiertos y alternativas cerradas desarrolladas por empresas estadounidenses.

De todos modos, Alibaba Cloud señaló que Qwen3.8-Omni-Flash todavía tiene margen de mejora en el razonamiento audiovisual aplicado al video puro, un campo en el que, según la propia compañía, Gemini de Google mantiene el liderazgo.