DeepSeek presentó DeepSeek-V4-Flash-Vision-Exp, un modelo multimodal experimental que incorpora capacidades de visión a su sistema V4-Flash. Según la tabla de resultados difundida por la propia compañía, la nueva versión superó a Opus 4.8, de Anthropic, en tres de las once evaluaciones comparativas analizadas.

La herramienta puede interpretar imágenes y capturas de pantalla, lo que amplía las posibilidades de uso del modelo en tareas que combinan texto y contenido visual. DeepSeek sostuvo, en una publicación en X, que el sistema mantiene las capacidades de texto de V4-Flash, incluidos los agentes, el razonamiento y el conocimiento del mundo, y que representa un avance hacia un desempeño multimodal comparable al de la propuesta de Anthropic.

De acuerdo con los datos compartidos por el laboratorio chino, DeepSeek-V4-Flash-Vision-Exp quedó por encima de Opus 4.8 en las pruebas DeepSWE, Agents' Last Exam y ZeroBench. En las ocho evaluaciones restantes, el modelo se ubicó por detrás. La mayor diferencia se registró en NL2Repo, una prueba centrada en tareas complejas sobre repositorios, donde la brecha fue de doce puntos.

Frente a la versión V4-Flash, limitada al procesamiento de texto, el modelo experimental obtuvo mejores resultados en seis de las siete evaluaciones textuales mencionadas por DeepSeek. La comparación se realiza, sin embargo, entre sistemas con capacidades distintas, ya que V4-Flash no puede procesar imágenes.

DeepSeek también habilitó el nuevo modelo en su plataforma de API y publicó la versión 0.1.1 de su entorno para agentes, que incorpora soporte para esta herramienta. Además, el sistema admite el envío de imágenes para su análisis.