✨︎ Resumen (TL;DR):
- Inherent reporta que Faraday, un agente de 27,000 millones de parámetros, quedó por encima de Claude Opus 4.8 y GPT-5.5 en 73% de las tareas de aprendizaje automático y 60% de las de ciencia.
- El agente decide qué probar, pero delega el código en GPT-5.5 Codex, cuyo tamaño Inherent calcula en al menos dos órdenes de magnitud por encima del suyo.
- Un juez automático construido por Inherent coincidió con expertos en 63% de los casos disputados, sin significancia estadística (
p=0.109).
Inherent afirma que Faraday, un agente de inteligencia artificial de 27,000 millones de parámetros, reconstruyó figuras de artículos científicos mejor que Claude Opus 4.8 y GPT-5.5 en 73% de las tareas de aprendizaje automático y 60% de las de ciencia. La comparación tiene una condición decisiva: Faraday usa GPT-5.5 Codex para escribir el código. Por eso, los porcentajes miden sobre todo la capa que decide qué hacer y da instrucciones a una herramienta mucho más grande, no un reemplazo directo de esos modelos.
Inherent publicó el resultado el 14 de agosto de 2026. El laboratorio tiene sede en Londres y lo fundaron exintegrantes de Google DeepMind. Inherent subió a arXiv el preprint de 47 páginas el 13 de agosto; el documento todavía no pasa por revisión por pares. El 22 de agosto, Edward Hughes, cofundador y director científico de Inherent, explicó el trabajo en entrevista con TechCrunch.
Faraday es un agente de inteligencia artificial que planea el experimento, decide qué vale la pena probar y delega la escritura del código en GPT-5.5 Codex, la herramienta de OpenAI. Inherent entrenó a Faraday a partir de Qwen3.6-27B, un modelo de pesos abiertos.
Inherent presenta a Faraday como una capa de intuición científica sobre agentes de programación que ya existen. El artículo calcula que el modelo subordinado es al menos dos órdenes de magnitud más grande que Faraday. También cita un trabajo externo que le estima unos 5 billones de parámetros, frente a los 27,000 millones del agente.

Replica mide la reconstrucción de figuras científicas
Inherent llamó Replica a la prueba. El conjunto reúne 310 tareas extraídas de 100 artículos de aprendizaje automático e IA aplicada a la ciencia que aparecieron entre 1990 y 2026.
Cada tarea omite una figura de resultados del paper y pide al agente que la reconstruya en una hora, con un séptimo de una GPU H200. Cuando el experimento original no cabe en ese presupuesto, Faraday debe entregar la versión reducida más fiel que pueda.
En las tareas de aprendizaje automático, que Faraday había visto durante el entrenamiento, Inherent reportó que el agente quedó por encima de Claude Opus 4.8 y GPT-5.5 en 73% de los casos. En las tareas de ciencia, que Faraday no había visto durante el entrenamiento, quedó por encima en 60%.
La ventaja promedio en el conjunto de prueba fue de 6% frente a Claude y 8% frente a GPT-5.5 Codex. Los dos modelos de referencia corrieron en sus propios entornos, Claude Code y Codex, con el esfuerzo de razonamiento al máximo.
Hughes defendió el tipo de tarea en su entrevista con TechCrunch: replicar resultados ajenos es el entrenamiento estándar de cualquier científico. Añadió: “Muchos estudiantes de doctorado empiezan justamente haciendo esto”.
El juez automático puso la vara
Una figura replicada no ofrece una respuesta que una persona pueda verificar por sí sola, así que Inherent diseñó la vara de medición. Primero, Claude Opus 4.7 genera una rúbrica específica para cada tarea sin ver la figura original. Después, un juez basado en GPT-5.5 Codex dispone de 10 minutos, el contenedor completo del agente y el gráfico real del paper.
El juez puntúa cinco dimensiones:
- Parecido visual.
- Respaldo de la afirmación científica.
- Implementación real del experimento descrito en el artículo.
- Uso del presupuesto de cómputo.
- Integridad, es decir, si el agente hizo trampa.
Para comparar al juez con evaluadores humanos, Inherent reclutó a doctorandos y doctores de universidades de investigación. Les pagó 150 libras por tarea y reunió 117 rankings de 20 participantes.
El resultado principal fue menos contundente que los porcentajes más altos del segundo estudio. En las comparaciones donde el juez con rúbrica y un juez de control se contradecían, los expertos respaldaron al primero en 63% de los casos. La cifra superó al azar, pero no alcanzó significancia estadística (p=0.109).
La correlación de Kendall entre el juez y los humanos alcanzó 0.19, en una escala donde 1 significa un orden idéntico. Entre dos ejecuciones del mismo juez llegó a 0.66, mientras que entre dos humanos fue de 0.30.
El segundo estudio produjo los porcentajes más altos, pero tuvo un alcance más limitado. Inherent mostró a los expertos únicamente los casos donde el juez ya había colocado a Faraday al menos 0.2 puntos arriba de sus dos rivales, en una escala de 0 a 1.
En esa selección, los expertos prefirieron a Faraday sobre Claude en 80% de los rankings y sobre Codex en 88%. Ese filtro no permite concluir que un humano lo preferiría en promedio.
El preprint admite conflictos y fallas
En su declaración de ética, el equipo reconoce que autores del propio paper, o personas que conocen, escribieron algunos artículos del corpus. También señala que parte del material provino de instituciones cuyos modelos comerciales utilizó durante la investigación.
El equipo también reconoce que Faraday falló al replicar varios trabajos que considera sólidos. El documento aclara que esas fallas no implican problemas con la investigación original.
Inherent pidió la opinión de los autores de 4 artículos replicados. Los comentarios incluyeron elogios a partes concretas del resultado y al ingenio del agente para diseñar una tarea reducida, pero también reparos: el problema elegido probablemente era demasiado fácil, la redacción tenía pasajes pobres y el código incluía cálculos innecesariamente enredados.
La comparación no enfrenta a los modelos actuales
La comparación enfrenta a Claude Opus 4.8 y GPT-5.5, no a los modelos que Anthropic y OpenAI tenían al frente en ese momento. El mismo artículo, sin embargo, usa Claude Opus 5 para etiquetar los momentos de descubrimiento dentro de las ejecuciones de Faraday.
El caso tampoco es aislado. DeepSeek presentó su modelo con visión comparándolo con Opus 4.8 y no con Opus 5.
La capa de decisión queda en el centro
Inherent entrenó a Faraday con GPT-5.4 mini como herramienta. Cuando sustituyó esa herramienta por GPT-5.5 sin volver a entrenar al agente, las puntuaciones de Faraday subieron.
El dato apunta a que decidir qué experimento correr y con qué presupuesto puede ser una capacidad separable del modelo que escribe el código. El cambio de herramienta también sugiere que esa capacidad mejora cuando mejora el agente de abajo.
La comprobación pendiente es concreta: un equipo ajeno a Inherent tendría que ejecutar Replica y publicar sus propios números. Hasta entonces, la comparación describe el rendimiento de Faraday coordinando a GPT-5.5 Codex, no el de un agente de 27B trabajando sin ese apoyo.
