✨︎ Resumen (TL;DR):
- OpenAI detalló el funcionamiento de su harness de agentes para Codex y ChatGPT Work, reduciendo costos operativos.
- GPT-5.6 Sol lidera el índice de codificación consumiendo un 54% menos tokens de salida que su rival más cercano.
- El sistema aplica tres reglas de diseño que cualquier desarrollador puede copiar sin importar su presupuesto.
OpenAI detalló las tripas de su harness de agentes, la capa de software que orquesta a Codex y ChatGPT Work, revelando tres decisiones de diseño clave para frenar el gasto descontrolado de tokens en las empresas.
El harness de agentes es una capa de software que conecta al modelo de inteligencia artificial con las herramientas del usuario para armar peticiones, administrar el contexto y mantener al agente enfocado en su tarea.
Joe Gershenson, responsable de ingeniería de harness en la compañía, explicó en entrevista que esta herramienta “es la forma en que el modelo interactúa con el mundo y cómo logramos expresar las capacidades del modelo”.

Tres reglas sencillas para frenar el gasto de tokens
A inicios de año, el despegue de los agentes autónomos generó pánico en las empresas, con facturas mensuales que alcanzaron los 20,000 dólares debido al consumo desmedido de cómputo en bruto.
“Es lo número uno que nos preguntan: ¿cómo frenamos el costo sin dejar de invertir en IA?”, comentó Ali Ghodsi, director ejecutivo de Databricks.
Para solucionarlo, los ingenieros de OpenAI diseñaron un arnés en Rust basado en tres principios técnicos que cualquier equipo de desarrollo puede clonar:
- Descubrimiento diferido: Las herramientas y funciones personalizadas solo se cargan en el contexto cuando el modelo las necesita, evitando saturar la memoria de trabajo.
- Tope de salida: El sistema limita la respuesta de cada herramienta a un máximo de 10,000 tokens por defecto.
- Historial append-only: Toda la información nueva se añade al final de la conversación en un orden fijo, lo que permite aprovechar un descuento del 90% en la lectura de caché.
Además, el sistema migró de enviar el historial completo en cada turno a usar una conexión por WebSocket, procesando el prompt completo solo al inicio. Esto recortó hasta un 40% de tiempo en tareas largas con más de 20 llamadas a herramientas.
El truco detrás de los benchmarks de eficiencia
La alta eficiencia tiene un impacto real en las evaluaciones. El modelo GPT-5.6 Sol con razonamiento máximo lidera el Artificial Analysis Coding Agent Index con 80 puntos, superando por 2.8 puntos a Claude Fable 5, pero utilizando un 54% menos de tokens de salida.
Sin embargo, el ahorro de tokens se midió corriendo el modelo dentro del propio harness de OpenAI. En pruebas de capacidad bruta como SWE-Bench Pro, Sol obtiene un 64.6% frente al 80% de Claude Fable 5, lo que demuestra que la ventaja de OpenAI radica en la eficiencia de su arquitectura y no solo en el cerebro de su IA.
La API de GPT-5.6 Sol cuesta 5 dólares por millón de tokens de entrada y 30 dólares por millón de salida, pero su diseño de historial acumulativo busca maximizar el ahorro mediante la lectura de caché.
Un experimento independiente de XDA demostró la importancia de esta capa: al usar a Claude Code con un orquestador externo para manejar a Codex, el consumo de tokens se disparó a más de 9 millones de tokens, ocho veces más de lo necesario.
Para los programadores, la mayor ventaja de este anuncio es que el código del harness de Codex es público en GitHub, lo que permite a cualquier empresa copiar estas optimizaciones directamente para bajar sus costos en el siguiente estado de cuenta.
