DeepSeek V4-Flash supera a V4-Pro y cuesta un tercio

DeepSeek V4-Flash supera a V4-Pro y cuesta un tercio

DeepSeek V4-Flash supera a V4-Pro en nueve benchmarks y reduce el costo de la API a un tercio.

Por Humberto Toledo el 31 de julio del 2026 a las 5:36 pm PDT

✨︎ Resumen (TL;DR):

  • DeepSeek abrió el 31 de julio de 2026 la beta pública de su API oficial con el build DeepSeek-V4-Flash-0731.
  • La tabla de la empresa coloca a V4-Flash en 82.7 puntos de Terminal Bench 2.1, frente a 72.1 de V4-Pro Preview.
  • Flash cobra 0.14 dólares por millón de tokens de entrada sin caché, admite 2,500 llamadas concurrentes y ofrece pesos abiertos bajo licencia MIT.

DeepSeek abrió el viernes 31 de julio de 2026 la beta pública de la API oficial de V4-Flash. En la tabla que la empresa publicó con el build DeepSeek-V4-Flash-0731, el modelo queda por encima de V4-Pro Preview en nueve benchmarks de agentes y programación, aunque ningún laboratorio independiente ha repetido esos resultados. Flash activa 13,000 millones de parámetros y cobra 0.14 dólares por millón de tokens de entrada sin caché, frente a 0.435 de Pro. La llamada deepseek-v4-flash no cambió.

Microsoft lanza Copilot Cowork y evalúa usar DeepSeek V4
Te podría interesar:
Microsoft lanza Copilot Cowork y evalúa usar DeepSeek V4
Fotos de stock gratuitas de 4k, acantilado, acuático
Foto: Kindel Media / Pexels

La beta cambia el modelo detrás del mismo nombre

El anuncio llegó ese viernes y Bloomberg lo fechó a las 6:50 UTC. Para quienes ya programaban contra V4-Flash, no hubo que modificar la integración: al solicitar deepseek-v4-flash, la API entrega la versión nueva.

DeepSeek V4-Flash es un modelo de lenguaje de mezcla de expertos que activa solo una fracción de sus parámetros en cada consulta, admite una ventana de contexto de un millón de tokens y distribuye sus pesos abiertos bajo licencia MIT.

El registro de cambios de DeepSeek describe la actualización así: “capacidades de agente notablemente mejoradas, con resultados que superan por mucho a V4-Pro-Preview”.

La tabla lo coloca arriba en nueve benchmarks

DeepSeek comparó el build nuevo con su propia versión de vista previa y con V4-Pro Preview. Entre los resultados publicados aparecen estas cifras:

  • Terminal Bench 2.1: V4-Flash obtuvo 82.7, frente a 61.8 de la vista previa y 72.1 de V4-Pro Preview. Opus-4.8 aparece con 85.0.
  • DeepSWE: el modelo pasó de 7.3 en la vista previa a 54.4. V4-Pro Preview registró 12.8.
  • Cybergym: subió de 38.7 a 76.7, exactamente el doble.
  • Toolathlon-Verified: alcanzó 70.3, frente a 55.9 de V4-Pro Preview.
  • DSBench-FullStack: avanzó de 37.0 a 68.7.
  • Agents’ Last Exam: marcó 25.2, muy cerca de los 25.7 que la misma tabla atribuye a Opus-4.8.

En las filas donde ambos tienen resultado, V4-Flash también queda por encima de GLM-5.2. Opus-4.8 permanece arriba en casi todas las comparaciones, aunque la diferencia se reduce a unos pocos puntos en 3 de ellas, según la propia ficha de DeepSeek.

La advertencia pesa tanto como las puntuaciones: las nueve cifras provienen de DeepSeek y ningún laboratorio independiente las ha replicado. DSBench-FullStack y DSBench-Hard usan conjuntos de datos internos de la empresa, mientras que el arnés DeepSeek Harness, utilizado para ejecutar las tareas de agentes de código, todavía no está disponible.

OpenAI enfrentó una duda similar esa misma semana al publicar sus resultados de ARC-AGI-3. En ambos casos, la boleta viene del propio desarrollador y aún falta una comprobación externa.

El precio y la concurrencia explican la apuesta

La documentación oficial fija para V4-Flash un precio de 0.14 dólares por millón de tokens de entrada sin caché y 0.28 dólares por millón de tokens de salida. V4-Pro cobra 0.435 y 0.87 dólares, respectivamente. En los dos extremos, Pro cuesta 3.1 veces más.

Cuando la entrada llega en caché, Flash baja a 0.0028 dólares por millón de tokens, una tarifa 50 veces menor que la de entrada sin caché. Ese escenario resulta especialmente relevante para un agente que reenvía el mismo contexto largo en varias llamadas.

La diferencia también aparece en el límite operativo. DeepSeek permite 2,500 llamadas concurrentes a Flash y solo 500 a Pro, es decir, 5 veces más capacidad para el modelo barato.

Los tamaños ayudan a entender la separación entre ambas versiones. V4-Flash suma 284,000 millones de parámetros y activa 13,000 millones en cada consulta. V4-Pro llega a 1.6 billones de parámetros y activa 49,000 millones. Flash representa menos de una quinta parte del total de Pro y activa poco más de una cuarta parte de sus parámetros.

DeepSeek atribuye parte de esa eficiencia a la atención híbrida con compresión agresiva. Según la empresa, el modelo grande de la serie opera con 27% de las operaciones por token y 10% de la memoria caché que V3.2 necesitaba para un contexto de un millón de tokens.

La actualización se queda en la API

TechNode informó a las 07:19 UTC, con base en la documentación oficial, que el cambio no alcanza la aplicación ni el sitio web de DeepSeek. Tampoco modifica la API de V4-Pro. Solo cambió el modelo que se entrega detrás de deepseek-v4-flash.

La actualización conserva la arquitectura, el tamaño y el precio del modelo, pero incorpora un entrenamiento posterior distinto. La API de DeepSeek acepta formatos de OpenAI y Anthropic desde la misma dirección base. El nuevo build suma soporte nativo para Responses API y adaptación a Codex.

La documentación también señala que Claude Code, GitHub Copilot y OpenCode pueden usar DeepSeek como modelo de fondo sin modificar una línea de código. Para una integración en producción, el cambio pudo ocurrir automáticamente al conservar el nombre de la llamada.

Los identificadores anteriores deepseek-chat y deepseek-reasoner quedaron retirados el 24 de julio de 2026. La beta de V4-Flash llegó exactamente una semana después. Nikkei Asia ubicó el lanzamiento dentro de la guerra de precios que atraviesa el sector.

El salto en Cybergym exige una lectura cuidadosa

El avance más pronunciado de la tabla aparece en Cybergym, una prueba que mide qué tan bien un modelo encuentra y explota fallas de seguridad. V4-Flash pasó de 38.7 a 76.7 después de un solo ciclo de entrenamiento posterior.

La cifra apareció el mismo día que otro reporte relacionado con el uso ofensivo de modelos. BleepingComputer informó el 31 de julio, a las 13:35, sobre un hallazgo de Unit 42, el equipo de inteligencia de amenazas de Palo Alto Networks.

Según el reporte, un actor de habla china que opera bajo los alias “knaithe” y “KnYuan” usaba DeepSeek como motor de razonamiento del agente de código abierto Hermes para atacar servidores expuestos con intervención humana mínima.

Los investigadores encontraron el caso por un descuido: el agente levantó por accidente un servidor web desde su directorio personal y dejó a la vista llaves de API, scripts de exploit, listas de objetivos e historial de sesiones.

En una sesión recuperada de mayo de 2026, el operador dio una instrucción inicial y Hermes continuó el trabajo. El agente rastreó instancias vulnerables de Langflow, descartó un objetivo cuando no pudo explotarlo, revisó repositorios públicos de exploits, eligió la plataforma n8n, que tenía más de 647,000 instancias expuestas, y probó una cadena de 2 vulnerabilidades.

El agente no comprometió ningún servidor porque los formularios que necesitaba exigían autenticación. Aun así, Unit 42 escribió que el flujo de trabajo “confirma una capacidad ofensiva autónoma de punta a punta”, ya que el sistema comprimió en minutos un análisis de objetivos que a una persona le habría tomado cientos de horas.

El caso no conecta directamente con la puntuación de 76.7. Unit 42 no especificó qué versión de DeepSeek usaba el atacante y la sesión documentada ocurrió antes del build publicado el viernes. El mismo actor tenía configurados Qwen, GLM, Kimi, MiniMax, Claude Code y Codex, pero casi no los utilizaba. Escogió DeepSeek.

Qué obtiene una integración por el precio

Para un equipo pequeño en México, España o cualquier país de América Latina, un millón de tokens de salida cuesta 0.28 dólares, es decir, 28 centavos. La ventana de contexto llega a un millón de tokens y la salida máxima es de 384,000 tokens. Además, los pesos pueden descargarse para ejecutar el modelo en hardware propio si el proyecto lo requiere.

La beta deja una decisión concreta. V4-Flash combina una tarifa menor, más concurrencia y resultados declarados por DeepSeek que superan a V4-Pro Preview. Pero sus 82.7 puntos en Terminal Bench 2.1 y sus 76.7 en Cybergym siguen sin una réplica independiente, y el arnés usado para las pruebas todavía no se libera. Para una integración de bajo costo, la API ya está disponible; para convertir esa tabla en una referencia definitiva, falta la verificación externa.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed