✨︎ Resumen (TL;DR):
- Google respondió a un reporte de Bloomberg que atribuye a empleados dudas sobre el desempeño de Argon en ciertas tareas de código.
- Google atribuye a Argon una puntuación de 77.9% en DeepSWE v1.1; en Vending-Bench 2 aparece tercero con 13,718.16 dólares simulados.
- Su acceso inicial sigue limitado a defensores de ciberseguridad y probadores de confianza; Google no ha fijado una fecha para ampliarlo.
Google defendió el rendimiento de Gemini 4 Argon en programación después de que un reporte de Bloomberg atribuyera a empleados de la compañía dudas sobre su desempeño en ciertas tareas de código. 9to5Google recogió la respuesta el 1 de octubre de 2026, mientras el modelo mantiene un acceso inicial limitado.
La cobertura resume testimonios de Bloomberg sobre dificultades en tareas de código pese a las puntuaciones anunciadas. También recoge una postura favorable: un empleado considera que Argon está al nivel de los modelos más avanzados.
En un comunicado del 30 de septiembre, Google afirmó que sus ingenieros ya utilizan Argon para corregir errores, migrar bases de código y diseñar algoritmos.

El 77.9% responde una pregunta específica
DeepSWE v1.1 es una evaluación de ingeniería de software que mide tareas prolongadas. Google atribuye a Argon una puntuación de 77.9% en esa prueba. El resultado corresponde a un conjunto definido de tareas, por lo que no describe cada situación de uso.
Para contrastar esa cifra con las reservas atribuidas a empleados, haría falta conocer las tareas concretas y las condiciones en que aparecieron las dificultades. La prueba y esos reportes no miden necesariamente los mismos escenarios.
Vending-Bench 2 mide un negocio simulado
Vending-Bench 2 es una evaluación de negocio simulado que mide cómo un agente gestiona una máquina expendedora durante un año simulado. La clasificación de Andon Labs, consultada el 1 de octubre, coloca a Argon en tercer lugar con un saldo medio de 13,718.16 dólares simulados. Por encima quedan:
- GPT-6 Astra: 15,514.70 dólares simulados.
- GPT-6 Sol: 14,427.85 dólares simulados.
La tabla presenta promedios de varias ejecuciones. El agente comienza con 500 dólares y administra una máquina expendedora durante un año simulado. Compra mercancía, fija precios y gestiona inventario.
El entorno incluye proveedores que pueden intentar aprovecharse del agente, retrasos de entregas y clientes que solicitan reembolsos. La puntuación se calcula a partir del saldo final.
Vending-Bench 2 mide la gestión de ese negocio simulado. Sus resultados no resuelven las dudas sobre programación ni permiten convertir el saldo final en una previsión de ingresos empresariales.
El acceso todavía limita la comparación
Google mantiene el acceso inicial para defensores de ciberseguridad y probadores de confianza. Esta disponibilidad limitada condiciona quién puede contrastar el rendimiento de Argon en sus propios proyectos.
La empresa prevé ampliar la distribución empezando por clientes de pago de la API y suscriptores de Google AI Ultra, pero su anuncio no fija una fecha.
