DeepSeek V4 Vision gana 3 de 11 pruebas a Opus 4.8

DeepSeek V4 Vision gana 3 de 11 pruebas a Opus 4.8

DeepSeek V4 Vision gana 3 de 11 pruebas a Opus 4.8, pero no se midió frente a Opus 5.

Por Humberto Toledo el 21 de agosto del 2026 a las 12:15 pm PDT

✨︎ Resumen (TL;DR):

  • DeepSeek abrió el 21 de agosto de 2026 el acceso a DeepSeek-V4-Flash-Vision-Exp, su modelo experimental de agentes con lectura de imágenes y capturas de pantalla.
  • En la tabla de 11 pruebas publicada por la empresa, la variante con visión superó a Claude Opus 4.8 en 3, pero quedó debajo en 8; en NL2Repo la diferencia fue de 12 puntos.
  • La comparación no incluyó a Claude Opus 5, que Anthropic presentó el 24 de julio de 2026 con el mismo precio de $5 por millón de tokens de entrada y $25 de salida que Opus 4.8.

DeepSeek, la empresa de Hangzhou, abrió el viernes 21 de agosto de 2026 el acceso a DeepSeek-V4-Flash-Vision-Exp, su primer modelo de visión de la familia V4 y una versión experimental de su modelo económico de agentes. En las 11 pruebas de agente multimodal que publicó, ganó 3 frente a Claude Opus 4.8 y perdió 8; la tabla no incluyó a Claude Opus 5, presentado por Anthropic el 24 de julio de 2026 al mismo precio que Opus 4.8.

DeepSeek-V4-Flash-Vision-Exp es un modelo experimental de agentes que interpreta imágenes y capturas de pantalla para actuar sobre lo que ve. DeepSeek ya permite llamarlo desde la API con la tarifa de V4-Flash.

Claude barato en China: proxy puede leer tus prompts
Te podría interesar:
Claude barato en China: proxy puede leer tus prompts
Una lancha motora navegando rápidamente por una vía acuática tranquila con un fondo urbano.
Foto: Zhangxiang Fan / Pexels

La tabla de DeepSeek deja tres victorias

DeepSeek afirmó que el desempeño del nuevo modelo queda “cerca de Opus-4.8”. La tabla de 11 resultados que la propia empresa publicó matiza esa afirmación: la variante con visión gana 3 pruebas y pierde 8 frente a Claude Opus 4.8.

Las tres victorias son estrechas:

  • DeepSWE: 1.3 puntos de ventaja.
  • Agents’ Last Exam: 1.6 puntos.
  • ZeroBench: 1.0 punto.

En las ocho pruebas restantes, Opus 4.8 queda arriba. Dos de esas derrotas tienen una diferencia que no se explica por el redondeo. Las brechas más amplias aparecen en NL2Repo, que mide la construcción de repositorios completos a partir de instrucciones en lenguaje natural, y en DSBench-Hard:

  • NL2Repo: 57.7 para DeepSeek frente a 69.7 para Opus 4.8, una diferencia de 12 puntos.
  • DSBench-Hard: 63.6 frente a 71.7.

En otras evaluaciones, la diferencia cae a decimales. Toolathlon-Verified registra 75.9 contra 76.2; Chartography, que evalúa la lectura de gráficas profesionales, marca 64.3 contra 65.0; y Terminal Bench 2.1 termina en 83.9 contra 85.0.

Ese es el rango en el que la descripción “cerca de Opus-4.8” se sostiene. La tabla también muestra un límite compartido: en AutomationBench, los tres modelos incluidos quedan entre 25.1 y 27.2 puntos. Ninguno resuelve todavía ese conjunto de tareas.

La visión explica parte del salto frente a V4-Flash

El anuncio pone el foco en la diferencia frente a V4-Flash en tareas que requieren visión. En ApexBench, el modelo con visión obtiene 36.5 frente a 26.2 del modelo de texto. En Agents’ Last Exam, la relación es 27.3 contra 25.2.

La nota al pie de la tabla aclara que, en esas dos evaluaciones, V4-Flash pasa por alto los elementos multimodales. A ese modelo de texto se le calificó en tareas con imágenes que no podía procesar.

El resultado de la variante con visión no queda invalidado por esa condición, pero sí cambia su lectura: parte del salto mide la ventaja de un sistema que ahora puede ver las imágenes del examen frente a otro que respondía sin acceso a ellas.

DeepSeek también dijo que la variante con visión “iguala” a V4-Flash en texto. Sus propias cifras la colocan por encima en 6 de las 7 pruebas textuales. Las mejoras son de 5.6 puntos en Toolathlon-Verified, 4.9 en DeepSWE y 4.0 en DSBench-Hard.

La excepción es Cybergym, la prueba de seguridad. Ahí el modelo con visión baja a 75.3 desde los 76.7 puntos de V4-Flash.

Opus 5 no aparece, aunque cuesta lo mismo

Claude Opus 4.8 no es un modelo retirado. La página de retiro de modelos lo muestra activo, con soporte pleno y sin una fecha de baja anterior a mayo de 2027. Cinco modelos Opus comparten hoy ese estado.

Anthropic presentó Claude Opus 5 el 24 de julio de 2026 y le fijó el mismo precio que a Opus 4.8: $5 por millón de tokens de entrada y $25 de salida. Por eso, el costo no explica la elección del modelo anterior en la tabla de DeepSeek. La columna de Opus 5 no aparece y nadie ha publicado esa medición.

Modelo Precio por millón de tokens ¿Está en la tabla de DeepSeek?
DeepSeek-V4-Flash-Vision-Exp (21 de agosto de 2026) $0.22 de entrada y $0.66 de salida, fuera de hora pico Sí, en las 11 pruebas
Claude Opus 4.8 $5 de entrada y $25 de salida Sí, en las 11 pruebas
Claude Opus 5 (24 de julio de 2026) $5 de entrada y $25 de salida No aparece

No es la primera vez que DeepSeek usa a Opus 4.8 como referencia. Cuando abrió la beta pública de V4-Flash el 31 de julio de 2026, su tabla ya colocaba al modelo de Anthropic arriba en casi todas las filas y las diferencias eran de pocos puntos.

Todas las cifras del anuncio provienen del laboratorio que vende el modelo. DeepSeek las obtuvo con su propio arnés, en modo mínimo, con temperatura 1.0 y top_p 0.95. La configuración está declarada, pero los resultados siguen siendo del fabricante.

Una imagen cuesta como máximo 384 tokens

Para integrarlo, hay un dato que impacta directamente la factura. Antes de razonar, el servicio redimensiona cada imagen hasta dejarla en un equivalente aproximado de 800 por 800 píxeles. El límite queda en 384 tokens por imagen, sin importar su tamaño original: una foto de 2000 por 2000 y otra de 5000 por 5000 consumen lo mismo.

Esos tokens se cobran junto con los tokens de texto, a la tarifa de entrada. La documentación también fija estos límites:

  • Hasta 600 imágenes por petición, con un cuerpo máximo de 48 MiB.
  • Hasta 8192 píxeles por lado; el límite baja a 4096 cuando la petición lleva 15 imágenes o más.
  • Admite JPEG, PNG, GIF y WebP. El servicio detecta el formato por el contenido del archivo, no por su extensión.
  • Las imágenes solo se aceptan en mensajes del usuario. A diferencia de los otros dos modelos de la familia, esta variante no admite completado FIM.

Las imágenes también pueden enviarse mediante el endpoint compatible con Anthropic que DeepSeek expone en api.deepseek.com/anthropic. Así, el modelo que la empresa presenta como alternativa a Opus puede consumirse con el mismo formato de mensajes que usa Anthropic.

El precio depende de la hora

La tarifa de $0.22 de entrada y $0.66 de salida corresponde a las horas valle. En las horas pico se duplica. Esas franjas son de 01:00 a 04:00 y de 06:00 a 10:00 UTC.

En el centro de México, seis horas detrás de UTC, esos horarios caen de 19:00 a 22:00 y de 00:00 a 04:00, respectivamente.

La prueba que falta es contra Opus 5

La medición que resolvería la comparación es concreta: ejecutar V4-Flash-Vision-Exp contra Opus 5 con el mismo arnés y las mismas condiciones. Nadie la ha publicado. Sin ella, no puede saberse si la cercanía que muestra la tabla frente a Opus 4.8 se mantiene ante el modelo que Anthropic vende hoy.

Lo verificable por ahora es más estrecho: un modelo experimental de DeepSeek queda a pocos puntos de Opus 4.8 en buena parte del conjunto publicado, gana 3 de 11 pruebas, pierde por 12 puntos en NL2Repo y cuesta una fracción durante las horas valle, con $0.22 y $0.66 frente a los $5 y $25 de Opus. La comparación con Claude Opus 5 sigue sin resultados.

Fuentes: 1, 2, 3, 4, 5

+ Temas Relacionados

Más de AI

Feed