✨︎ Resumen (TL;DR):
- Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026 como modelo estable para programación de largo recorrido, agentes autónomos y flujos empresariales de varios pasos.
- El modelo admite hasta 1,048,576 tokens de entrada y genera hasta 65,536 tokens, con niveles de esfuerzo bajo, medio y alto.
- El precio introductorio de $0.75 por millón de tokens de entrada y $3.75 por millón de salida termina el 31 de diciembre de 2026; el esfuerzo alto puede elevar el consumo.
Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026 como su modelo estable para programación de largo recorrido, agentes autónomos y flujos de trabajo empresariales con varios pasos. La versión permite aumentar el esfuerzo de razonamiento para resolver tareas difíciles, mientras conserva hasta el 31 de diciembre de 2026 un precio introductorio de $0.75 por millón de tokens de entrada y $3.75 por millón de salida, con el riesgo de usar más tokens y tardar más.
Gemini 3.8 Flash es un modelo de IA que puede dedicar más pasos de razonamiento y usar herramientas de manera iterativa para resolver tareas complejas.

Google pone el modelo estable a disposición
Gemini 3.8 Flash llegó menos de tres semanas después de Gemini 3.7 Flash y se convirtió en el tercer lanzamiento de Flash de Google en seis semanas. La compañía lo describe como su modelo de trabajo más inteligente y afirma que supera a 3.7 Flash en ingeniería de software, tareas agénticas y razonamiento complejo.
La diferencia central está en el trabajo adicional que puede hacer el modelo. Google afirma que Gemini 3.8 Flash puede “trabajar más” mediante razonamiento adicional y llamadas iterativas a herramientas. Ese proceso puede aumentar el consumo de tokens y el tiempo de respuesta.
Los desarrolladores pueden usarlo en Google AI Studio, Gemini API, Google Antigravity, Android Studio y Stitch. Para empresas, Google lo ofrece en Gemini Enterprise. Los usuarios de Google AI Pro y Ultra pueden encontrarlo en la aplicación Gemini, AI Mode y Sheets.
En la API, el identificador estable es gemini-3.8-flash. El lanzamiento también coincide con el nombre clave Skimaki, utilizado en un reporte previo que describía pruebas internas frente a Claude Opus. Con la disponibilidad general, ya existen ficha técnica, precio y canales de acceso públicos.
Más razonamiento para tareas largas
Gemini 3.8 Flash se basa en Gemini 3.7 Flash, según la ficha de modelo de Google DeepMind. Su capacidad de contexto alcanza 1,048,576 tokens de entrada y puede generar hasta 65,536 tokens.
El modelo acepta texto, imágenes, audio, video y PDF. También puede conectarse con funciones, búsqueda, contexto de URL, ejecución de código y uso de computadora. Algunas de esas capacidades todavía están en vista previa.
Los desarrolladores pueden elegir entre esfuerzo bajo, medio y alto para equilibrar calidad, latencia y costo.
- Esfuerzo alto: Gemini 3.8 Flash puede encadenar más pasos de razonamiento, usar herramientas de manera repetida y revisar sus propios resultados antes de responder.
- Prioridad de eficiencia: Google recomienda usar niveles de esfuerzo más bajos o Gemini 3.7 Flash cuando el objetivo principal sea reducir el uso de recursos.
Ese diseño apunta a problemas que no se resuelven con una sola respuesta. El modelo puede entender una base de código grande, modificar varios archivos, ejecutar pruebas, interpretar errores y repetir el ciclo hasta acercarse a una solución funcional.
La solicitud de mayor esfuerzo puede generar más tokens de salida aunque el precio unitario sea el mismo. Por eso, el costo real depende de la cantidad de pasos que complete el modelo y de las herramientas que utilice durante el proceso.
Google reporta avances en código y trabajo profesional
En las gráficas publicadas junto con el lanzamiento, Google reportó estos resultados:
- Vals Finance Agent v2: 61.4%, frente a 59.0% de Gemini 3.7 Flash.
- Harvey Legal Agent Benchmark: 10.0%, frente a 8.8% de Gemini 3.7 Flash.
- HLE-Verified: 54.9%, frente a 53.6% de la versión anterior.
Google también afirma que Gemini 3.8 Flash supera a modelos de frontera más grandes en DeepSWE v1.1, una evaluación de ingeniería de software autónoma, por una fracción del costo de esos modelos.
Son métricas reportadas por la propia compañía y corresponden a conjuntos de pruebas concretos. No demuestran una ventaja universal en cualquier repositorio, lenguaje, agente o flujo de trabajo.
Los equipos que evalúen el modelo tendrán que comparar el porcentaje de tareas completadas, los tokens consumidos, la latencia y la cantidad de reintentos. Resolver más pasos en una sola ejecución puede resultar conveniente, pero solo si el beneficio compensa el uso adicional.
El precio introductorio termina el 31 de diciembre
Gemini 3.8 Flash conserva hasta el 31 de diciembre de 2026 el precio de lanzamiento de 3.7 Flash:
- Entrada: $0.75 por millón de tokens.
- Salida: $3.75 por millón de tokens.
A partir del 1 de enero de 2027, Google prevé cobrar $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.
El precio bajo corresponde al modelo, pero no garantiza que cada tarea tenga un costo bajo. Las sesiones con razonamiento de mayor esfuerzo pueden usar más tokens. El uso de herramientas, los reintentos y los contextos extensos también influyen en el total.
La comparación con un modelo más caro debe hacerse por tarea resuelta, no solo por el precio de un millón de tokens.
La ficha técnica también expone límites
La ficha técnica de Gemini 3.8 Flash mantiene advertencias habituales para un sistema generativo. El modelo puede producir información incorrecta, presentar lentitud o timeouts y no interpretar de forma confiable todos los contextos extensos.
Su fecha de corte de conocimiento es marzo de 2026. Google advierte que algunos dominios pueden tener una cobertura limitada hasta enero de 2025.
La evaluación de seguridad registró un retroceso ligero en seguridad multilingüe frente a Gemini 3.7 Flash: 5.4 puntos porcentuales en la métrica automatizada, donde una cifra menor es mejor. Google aclara que mejoró la metodología de evaluación, así que las cifras no se pueden comparar directamente con todas las fichas anteriores.
Las pruebas humanas de red teaming no detectaron preocupaciones graves nuevas. Aun así, la ficha técnica describe la resistencia a jailbreaks como un área en evolución.
Flash Cyber tiene acceso restringido
Junto con el modelo general, Google presentó Gemini 3.8 Flash Cyber. Esta variante busca detectar vulnerabilidades y ayudar a crear parches, y se ofrece mediante el programa Fairwind a gobiernos, empresas de infraestructura crítica, mantenedores de software y otros socios de confianza.
Google presenta Flash Cyber como un sistema separado, con controles más estrictos y acceso limitado. La compañía reporta resultados de frontera en detección de vulnerabilidades y afirma que la variante ayudó a encontrar un problema crítico en Google Cloud en menos de dos horas.
Esas afirmaciones corresponden a Google y sus socios. Describen resultados del programa, no una garantía de seguridad para cualquier aplicación que use Gemini 3.8 Flash.
Para desarrolladores y empresas, la decisión no termina en el precio unitario. Tendrán que medir cuántas tareas completas consigue el modelo, cuánto tarda y cuántos tokens consume. El nivel alto tendrá sentido si resolver más pasos en una sola ejecución compensa ese uso adicional, especialmente ante el cambio de tarifa previsto para el 1 de enero de 2027.