DeepSeek cambia V4-Pro por V4.1-Flash y empata con Opus 5

DeepSeek cambia V4-Pro por V4.1-Flash y empata con Opus 5

DeepSeek sustituirá V4-Pro por V4.1-Flash, con menor tarifa y empate con Opus 5 según sus pruebas.

Por Humberto Toledo el 10 de septiembre del 2026 a las 5:45 pm PDT

✨︎ Resumen (TL;DR):

  • DeepSeek lanzó V4.1-Flash el 10 de septiembre de 2026; desde el 14 de septiembre, su API atenderá las peticiones de V4-Pro con este modelo y aplicará una tarifa menor.
  • El modelo tiene 552,000 millones de parámetros, activa 8,000 millones al leer y 16,000 millones al escribir, y usa una caché de 890 bytes por token.
  • En las pruebas de DeepSeek, logra 74.2 en DeepSWE v1.1 frente a 74.0 de Claude Opus 5, pero queda por debajo en Terminal-Bench 4.0 y Humanity’s Last Exam.

DeepSeek lanzó V4.1-Flash el jueves 10 de septiembre de 2026 y anunció que reemplazará V4-Pro en su API el lunes 14. El modelo de pesos abiertos tiene 552,000 millones de parámetros, contexto de 1,000,000 de tokens y comprensión nativa de imágenes; la empresa afirma que supera a su modelo insignia en tareas de agentes y cobrará menos por usarlo.

Together AI suma modelo de Alibaba que supera a OpenAI
Te podría interesar:
Together AI suma modelo de Alibaba que supera a OpenAI
Fondo abstracto con un patrón ondulado verde y perspectiva y textura decrecientes.
Foto: Steve A Johnson / Pexels

Una arquitectura que lee con 8,000 millones

DeepSeek presenta V4.1-Flash como el modelo más pequeño de una nueva familia arquitectónica pensada para crecer hacia modelos mayores. La empresa llama a esta propuesta Causal Encoder-Decoder.

Causal Encoder-Decoder es una arquitectura de Transformer que separa el procesamiento entre un codificador causal y un decodificador. El decodificador construye su caché con lo que el codificador ya calculó, en lugar de derivarla de cada una de sus propias capas.

La ficha de Hugging Face describe un Transformer de 40 capas, dividido en un codificador causal de 20 capas y un decodificador de otras 20. Esa división produce una asimetría concreta: V4.1-Flash activa 8,000 millones de parámetros para leer y 16,000 millones para escribir.

El diseño apunta a los agentes, que procesan entradas nuevas cada vez que llaman a una herramienta. Según The Decoder, que revisó el informe técnico, DeepSeek calcula que esta estructura casi reduce a la mitad el cómputo necesario para procesar la entrada.

La caché ocupa una cuarta parte de V4-Flash

La caché KV es la memoria donde el modelo guarda lo que ya procesó de un contexto para no recalcularlo en cada paso. En un agente que trabaja durante muchas etapas, crece rápido y presiona la memoria de las GPU, los SSD y el ancho de banda, lo que encarece el despliegue.

V4.1-Flash deja esa caché en 890 bytes por token, aproximadamente una cuarta parte de la que usa V4-Flash. DeepSeek apoya el ahorro en una caché principal en formato FP4; la parte que guarda de forma persistente en SSD baja a cerca de un octavo.

Frente a DeepSeek-V1, la empresa calcula una reducción de 437 veces. También vincula ese ahorro con la factura, porque los cargos por aciertos de caché suelen pesar mucho en el costo de un agente.

Entrenamiento desde cero y licencia MIT

DeepSeek entrenó desde cero V4.1-Flash y su codificador de visión con un corpus de 45 billones de tokens de texto e imágenes. Durante el posentrenamiento no cambió los algoritmos; atribuye la mejora a la síntesis a gran escala de tareas y entornos para agentes.

El esfuerzo de razonamiento se regula con un valor continuo de 1 a 100. El repositorio de Hugging Face muestra los pesos bajo licencia MIT.

DeepSWE empata con Opus 5, según la tabla de DeepSeek

DeepSeek publicó los resultados el 10 de septiembre de 2026, con el esfuerzo de razonamiento al máximo. La tabla reúne siete pruebas, compara V4.1-Flash con V4-Pro y Claude Opus 5, de Anthropic, y usa una escala en la que una puntuación más alta es mejor. TNW advierte que ninguna cifra cuenta con verificación independiente.

Prueba V4.1-Flash V4-Pro Claude Opus 5
DeepSWE v1.1 74.2 62.7 74.0
Terminal-Bench 2.1 90.6 87.9 89.1
Terminal-Bench 4.0 31.2 12.4 51.8
ProgramBench 20.3 15.5 37.0
AutomationBench 54.8 43.2 50.3
GPQA Diamond 90.9 92.4 93.4
Humanity’s Last Exam, sin herramientas 36.8 (39.1 solo texto) 42.7 (solo texto) 56.3

En DeepSWE v1.1, una prueba de ingeniería de software, V4.1-Flash marca 74.2 y queda en un empate práctico con Opus 5, que registra 74.0. GPT-5.6 Sol, de OpenAI, alcanza 73.0.

El resultado también depende del arnés, el software que conecta el modelo con la terminal y sus herramientas. DeepSeek usó mini-SWE, la configuración oficial de la prueba; con Claude Code, el mismo modelo baja a 69.8, y con Codex, a 65.6.

Opus 5 queda por debajo de V4.1-Flash en Terminal-Bench 2.1, con 89.1 frente a 90.6, y en AutomationBench, con 50.3 frente a 54.8. El retrato cambia en las versiones posteriores de Terminal-Bench.

En Terminal-Bench 3.0, V4.1-Flash obtiene 30.0, frente a 43.3 de Opus 5 y 34.4 de GPT-5.6 Sol. En la versión 4.0 registra 31.2, contra 51.8 de Opus 5 y 39.9 de GPT-5.6 Sol.

En ProgramBench, otra prueba de programación, V4.1-Flash se queda en 20.3 frente a 37.0 de Opus 5. En Humanity’s Last Exam, un examen de preguntas de nivel experto, logra 36.8 sin herramientas frente a 56.3 del modelo de Anthropic.

V4-Pro gana en preguntas expertas

Frente a V4-Pro, el modelo al que reemplazará, V4.1-Flash gana las 12 pruebas de agentes que tienen una cifra para ambos. El salto más amplio de la tabla aparece en Terminal-Bench 4.0, donde pasa de 12.4 a 31.2.

En las preguntas de nivel experto ocurre lo contrario. V4.1-Flash obtiene 90.9 en GPQA Diamond frente a 92.4 de V4-Pro, y registra 39.1 contra 42.7 en la parte de solo texto de Humanity’s Last Exam.

La diferencia también aparece en los modelos base, antes del posentrenamiento. En SimpleQA-Verified, que mide conocimiento factual, V4.1-Flash marca 42.3 frente a 55.2 de V4-Pro.

The Decoder encontró otras salvedades en el informe técnico. El máximo esfuerzo de razonamiento mejora los resultados, pero produce aproximadamente 2.5 veces más tokens de salida.

Durante el entrenamiento, los agentes intentaron a veces engañar a su sistema de recompensas, tumbaron por accidente el entorno de pruebas, aprovecharon vulnerabilidades recién divulgadas y borraron archivos críticos del sistema.

El informe también reconoce una distancia medible frente a los mejores sistemas cerrados al leer imágenes complejas. La tabla de Chartography con herramientas refleja esa brecha: V4.1-Flash obtiene 78.9 frente a 84.0 de Opus 5.

La tarifa baja, pero no vuelve a la de antes de agosto

Los precios nuevos rigen desde las 04:00 UTC del 10 de septiembre de 2026. Fuera del horario pico, DeepSeek cobra lo siguiente:

Tipo de token Precio fuera de horario pico
Entrada con acierto de caché $0.003 por millón de tokens
Entrada sin acierto de caché $0.15 por millón de tokens
Salida $0.60 por millón de tokens

En horario pico, DeepSeek cobra el doble. La empresa define ese periodo de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes.

En Ciudad de México, esos horarios corresponden a las noches de domingo a jueves, de 19:00 a 22:00, y a las madrugadas de lunes a viernes, de 00:00 a 04:00. En Madrid, con el horario de verano, abarcan de lunes a viernes, de 03:00 a 06:00 y de 08:00 a 12:00.

Frente a las tarifas que V4-Flash estrenó el 16 de agosto de 2026 con el esquema de horas pico, la entrada sin caché fuera de pico baja de $0.22 a $0.15, casi 32%. La salida pasa de $0.66 a $0.60, cerca de 9%.

Antes del 16 de agosto, V4-Flash cobraba una tarifa plana de $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida. Por eso, incluso fuera de pico, la entrada actual queda un centavo por encima y la salida cuesta más del doble.

La API cambia qué modelo responde

Con el lanzamiento, DeepSeek retiró V4-Flash y su variante experimental con visión. La API todavía acepta sus nombres, pero atiende esas peticiones con V4.1-Flash y aplica la tarifa Flash. DeepSeek pide cambiar el nombre del modelo a deepseek-flash.

El relevo de V4-Pro llegará a las 04:00 UTC del lunes 14 de septiembre de 2026, equivalentes a las 22:00 del domingo 13 de septiembre en Ciudad de México. Desde ese momento, V4.1-Flash atenderá las peticiones dirigidas a deepseek-v4-pro.

Fuera de horario pico, la entrada sin caché pasará de $0.66 a $0.15 por millón de tokens y la salida de $1.98 a $0.60.

Tipo de cobro V4-Pro antes V4.1-Flash después
Entrada sin caché $0.66 $0.15
Salida $1.98 $0.60

Los recortes representan 77% en la entrada y 70% en la salida. La sustitución se mantendrá hasta que llegue V4.1-Pro, un modelo para el que DeepSeek no ha dado fecha.

La factura bajará, pero el modelo cambiará: V4.1-Flash gana en agentes y cede en las preguntas de nivel experto que V4-Pro resolvía mejor.

El lanzamiento presiona a rivales chinos

El jueves del lanzamiento, las acciones de MiniMax y Z.ai, dos rivales chinos, cayeron más de 8% en Hong Kong, según Bloomberg. Alibaba, que también se está volcando a la inteligencia artificial, cedió más de 2% en la misma plaza.

Bloomberg situó el lanzamiento dentro de la guerra de precios entre los modelos abiertos chinos y los de Estados Unidos, justo cuando Anthropic y OpenAI preparan su salida a bolsa. Artificial Analysis llama a este fenómeno una “zona de muerte” de DeepSeek: un competidor debe ganarles en precio a DeepSeek y a sus pares chinos o superarlos con claridad en capacidad.

DeepSeek también comenzó a preparar su propia salida a bolsa en el STAR Market de Shanghái, según Reuters. El lanzamiento ocurrió dos días después de que la NSA, el FBI y CISA señalaran a DeepSeek, MiniMax, Z.ai y otras tres empresas chinas por supuestas campañas de destilación a escala industrial contra modelos estadounidenses.

China respondió el miércoles que esas acusaciones carecen de fundamento, según AFP.

El primer efecto se notará en las facturas. Desde el lunes, todo el tráfico de V4-Pro en la API de DeepSeek pasará a un modelo más pequeño y barato, cuyas cifras de rendimiento por ahora solo ha publicado su propio fabricante. El ahorro viene con un intercambio concreto: V4.1-Flash mejora las pruebas de agentes frente a V4-Pro, pero cede en preguntas expertas y queda lejos de Opus 5 en Terminal-Bench 4.0. La fecha de V4.1-Pro sigue sin anunciarse.

Fuentes: 1, 2, 3, 4, 5, 6, 7

+ Temas Relacionados

Más de AI

Feed