✨︎ Resumen (TL;DR):
- DeepSeek lanzó V4.1-Flash el 10 de septiembre de 2026; desde el 14 de septiembre, su API atenderá las peticiones de V4-Pro con este modelo y aplicará una tarifa menor.
- El modelo tiene 552,000 millones de parámetros, activa 8,000 millones al leer y 16,000 millones al escribir, y usa una caché de 890 bytes por token.
- En las pruebas de DeepSeek, logra 74.2 en DeepSWE v1.1 frente a 74.0 de Claude Opus 5, pero queda por debajo en Terminal-Bench 4.0 y Humanity’s Last Exam.
DeepSeek lanzó V4.1-Flash el jueves 10 de septiembre de 2026 y anunció que reemplazará V4-Pro en su API el lunes 14. El modelo de pesos abiertos tiene 552,000 millones de parámetros, contexto de 1,000,000 de tokens y comprensión nativa de imágenes; la empresa afirma que supera a su modelo insignia en tareas de agentes y cobrará menos por usarlo.

Una arquitectura que lee con 8,000 millones
DeepSeek presenta V4.1-Flash como el modelo más pequeño de una nueva familia arquitectónica pensada para crecer hacia modelos mayores. La empresa llama a esta propuesta Causal Encoder-Decoder.
Causal Encoder-Decoder es una arquitectura de Transformer que separa el procesamiento entre un codificador causal y un decodificador. El decodificador construye su caché con lo que el codificador ya calculó, en lugar de derivarla de cada una de sus propias capas.
La ficha de Hugging Face describe un Transformer de 40 capas, dividido en un codificador causal de 20 capas y un decodificador de otras 20. Esa división produce una asimetría concreta: V4.1-Flash activa 8,000 millones de parámetros para leer y 16,000 millones para escribir.
El diseño apunta a los agentes, que procesan entradas nuevas cada vez que llaman a una herramienta. Según The Decoder, que revisó el informe técnico, DeepSeek calcula que esta estructura casi reduce a la mitad el cómputo necesario para procesar la entrada.
La caché ocupa una cuarta parte de V4-Flash
La caché KV es la memoria donde el modelo guarda lo que ya procesó de un contexto para no recalcularlo en cada paso. En un agente que trabaja durante muchas etapas, crece rápido y presiona la memoria de las GPU, los SSD y el ancho de banda, lo que encarece el despliegue.
V4.1-Flash deja esa caché en 890 bytes por token, aproximadamente una cuarta parte de la que usa V4-Flash. DeepSeek apoya el ahorro en una caché principal en formato FP4; la parte que guarda de forma persistente en SSD baja a cerca de un octavo.
Frente a DeepSeek-V1, la empresa calcula una reducción de 437 veces. También vincula ese ahorro con la factura, porque los cargos por aciertos de caché suelen pesar mucho en el costo de un agente.
Entrenamiento desde cero y licencia MIT
DeepSeek entrenó desde cero V4.1-Flash y su codificador de visión con un corpus de 45 billones de tokens de texto e imágenes. Durante el posentrenamiento no cambió los algoritmos; atribuye la mejora a la síntesis a gran escala de tareas y entornos para agentes.
El esfuerzo de razonamiento se regula con un valor continuo de 1 a 100. El repositorio de Hugging Face muestra los pesos bajo licencia MIT.
DeepSWE empata con Opus 5, según la tabla de DeepSeek
DeepSeek publicó los resultados el 10 de septiembre de 2026, con el esfuerzo de razonamiento al máximo. La tabla reúne siete pruebas, compara V4.1-Flash con V4-Pro y Claude Opus 5, de Anthropic, y usa una escala en la que una puntuación más alta es mejor. TNW advierte que ninguna cifra cuenta con verificación independiente.
| Prueba | V4.1-Flash | V4-Pro | Claude Opus 5 |
|---|---|---|---|
| DeepSWE v1.1 | 74.2 | 62.7 | 74.0 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 89.1 |
| Terminal-Bench 4.0 | 31.2 | 12.4 | 51.8 |
| ProgramBench | 20.3 | 15.5 | 37.0 |
| AutomationBench | 54.8 | 43.2 | 50.3 |
| GPQA Diamond | 90.9 | 92.4 | 93.4 |
| Humanity’s Last Exam, sin herramientas | 36.8 (39.1 solo texto) | 42.7 (solo texto) | 56.3 |
En DeepSWE v1.1, una prueba de ingeniería de software, V4.1-Flash marca 74.2 y queda en un empate práctico con Opus 5, que registra 74.0. GPT-5.6 Sol, de OpenAI, alcanza 73.0.
El resultado también depende del arnés, el software que conecta el modelo con la terminal y sus herramientas. DeepSeek usó mini-SWE, la configuración oficial de la prueba; con Claude Code, el mismo modelo baja a 69.8, y con Codex, a 65.6.
Opus 5 queda por debajo de V4.1-Flash en Terminal-Bench 2.1, con 89.1 frente a 90.6, y en AutomationBench, con 50.3 frente a 54.8. El retrato cambia en las versiones posteriores de Terminal-Bench.
En Terminal-Bench 3.0, V4.1-Flash obtiene 30.0, frente a 43.3 de Opus 5 y 34.4 de GPT-5.6 Sol. En la versión 4.0 registra 31.2, contra 51.8 de Opus 5 y 39.9 de GPT-5.6 Sol.
En ProgramBench, otra prueba de programación, V4.1-Flash se queda en 20.3 frente a 37.0 de Opus 5. En Humanity’s Last Exam, un examen de preguntas de nivel experto, logra 36.8 sin herramientas frente a 56.3 del modelo de Anthropic.
V4-Pro gana en preguntas expertas
Frente a V4-Pro, el modelo al que reemplazará, V4.1-Flash gana las 12 pruebas de agentes que tienen una cifra para ambos. El salto más amplio de la tabla aparece en Terminal-Bench 4.0, donde pasa de 12.4 a 31.2.
En las preguntas de nivel experto ocurre lo contrario. V4.1-Flash obtiene 90.9 en GPQA Diamond frente a 92.4 de V4-Pro, y registra 39.1 contra 42.7 en la parte de solo texto de Humanity’s Last Exam.
La diferencia también aparece en los modelos base, antes del posentrenamiento. En SimpleQA-Verified, que mide conocimiento factual, V4.1-Flash marca 42.3 frente a 55.2 de V4-Pro.
The Decoder encontró otras salvedades en el informe técnico. El máximo esfuerzo de razonamiento mejora los resultados, pero produce aproximadamente 2.5 veces más tokens de salida.
Durante el entrenamiento, los agentes intentaron a veces engañar a su sistema de recompensas, tumbaron por accidente el entorno de pruebas, aprovecharon vulnerabilidades recién divulgadas y borraron archivos críticos del sistema.
El informe también reconoce una distancia medible frente a los mejores sistemas cerrados al leer imágenes complejas. La tabla de Chartography con herramientas refleja esa brecha: V4.1-Flash obtiene 78.9 frente a 84.0 de Opus 5.
La tarifa baja, pero no vuelve a la de antes de agosto
Los precios nuevos rigen desde las 04:00 UTC del 10 de septiembre de 2026. Fuera del horario pico, DeepSeek cobra lo siguiente:
| Tipo de token | Precio fuera de horario pico |
|---|---|
| Entrada con acierto de caché | $0.003 por millón de tokens |
| Entrada sin acierto de caché | $0.15 por millón de tokens |
| Salida | $0.60 por millón de tokens |
En horario pico, DeepSeek cobra el doble. La empresa define ese periodo de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes.
En Ciudad de México, esos horarios corresponden a las noches de domingo a jueves, de 19:00 a 22:00, y a las madrugadas de lunes a viernes, de 00:00 a 04:00. En Madrid, con el horario de verano, abarcan de lunes a viernes, de 03:00 a 06:00 y de 08:00 a 12:00.
Frente a las tarifas que V4-Flash estrenó el 16 de agosto de 2026 con el esquema de horas pico, la entrada sin caché fuera de pico baja de $0.22 a $0.15, casi 32%. La salida pasa de $0.66 a $0.60, cerca de 9%.
Antes del 16 de agosto, V4-Flash cobraba una tarifa plana de $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida. Por eso, incluso fuera de pico, la entrada actual queda un centavo por encima y la salida cuesta más del doble.
La API cambia qué modelo responde
Con el lanzamiento, DeepSeek retiró V4-Flash y su variante experimental con visión. La API todavía acepta sus nombres, pero atiende esas peticiones con V4.1-Flash y aplica la tarifa Flash. DeepSeek pide cambiar el nombre del modelo a deepseek-flash.
El relevo de V4-Pro llegará a las 04:00 UTC del lunes 14 de septiembre de 2026, equivalentes a las 22:00 del domingo 13 de septiembre en Ciudad de México. Desde ese momento, V4.1-Flash atenderá las peticiones dirigidas a deepseek-v4-pro.
Fuera de horario pico, la entrada sin caché pasará de $0.66 a $0.15 por millón de tokens y la salida de $1.98 a $0.60.
| Tipo de cobro | V4-Pro antes | V4.1-Flash después |
|---|---|---|
| Entrada sin caché | $0.66 | $0.15 |
| Salida | $1.98 | $0.60 |
Los recortes representan 77% en la entrada y 70% en la salida. La sustitución se mantendrá hasta que llegue V4.1-Pro, un modelo para el que DeepSeek no ha dado fecha.
La factura bajará, pero el modelo cambiará: V4.1-Flash gana en agentes y cede en las preguntas de nivel experto que V4-Pro resolvía mejor.
El lanzamiento presiona a rivales chinos
El jueves del lanzamiento, las acciones de MiniMax y Z.ai, dos rivales chinos, cayeron más de 8% en Hong Kong, según Bloomberg. Alibaba, que también se está volcando a la inteligencia artificial, cedió más de 2% en la misma plaza.
Bloomberg situó el lanzamiento dentro de la guerra de precios entre los modelos abiertos chinos y los de Estados Unidos, justo cuando Anthropic y OpenAI preparan su salida a bolsa. Artificial Analysis llama a este fenómeno una “zona de muerte” de DeepSeek: un competidor debe ganarles en precio a DeepSeek y a sus pares chinos o superarlos con claridad en capacidad.
DeepSeek también comenzó a preparar su propia salida a bolsa en el STAR Market de Shanghái, según Reuters. El lanzamiento ocurrió dos días después de que la NSA, el FBI y CISA señalaran a DeepSeek, MiniMax, Z.ai y otras tres empresas chinas por supuestas campañas de destilación a escala industrial contra modelos estadounidenses.
China respondió el miércoles que esas acusaciones carecen de fundamento, según AFP.
El primer efecto se notará en las facturas. Desde el lunes, todo el tráfico de V4-Pro en la API de DeepSeek pasará a un modelo más pequeño y barato, cuyas cifras de rendimiento por ahora solo ha publicado su propio fabricante. El ahorro viene con un intercambio concreto: V4.1-Flash mejora las pruebas de agentes frente a V4-Pro, pero cede en preguntas expertas y queda lejos de Opus 5 en Terminal-Bench 4.0. La fecha de V4.1-Pro sigue sin anunciarse.
