✨︎ Resumen (TL;DR):
- Investigadores de Stanford publicaron Paper2Agent en Nature el 16 de septiembre de 2026.
- El sistema convirtió 74 de 100 papers de biología computacional en agentes ejecutables y validó 593 de 599 herramientas.
- Otros 26 papers quedaron fuera porque su código, datos o entornos no pudieron reconstruirse de forma completa.
Investigadores de Stanford publicaron Paper2Agent en Nature el 16 de septiembre de 2026. El sistema convierte un paper científico, su código público, sus datos y sus materiales complementarios en un agente de IA. En una prueba con 100 papers de biología computacional, 74 generaron agentes ejecutables y 26 quedaron fuera por problemas con el código, los datos o los entornos. Paper2Agent no vuelve operativo cualquier PDF: necesita una investigación cuyo trabajo técnico pueda reconstruirse y comprobarse.
El proyecto ya circulaba como preprint desde el 8 de septiembre de 2025. La novedad del 16 de septiembre de 2026 es su publicación revisada por pares en Nature, no la primera aparición de la idea.

No es un chatbot que resume el paper
Paper2Agent analiza el manuscrito y los materiales que lo acompañan para construir un servidor MCP. MCP (Model Context Protocol) es una interfaz estandarizada que permite a un agente conversacional acceder a herramientas y recursos externos.
El sistema localiza el repositorio del estudio, prepara un entorno de ejecución, extrae las funciones del método y las empaqueta como herramientas reutilizables. También incorpora el texto, los suplementos, los datos disponibles y prompts que ordenan los pasos del flujo de trabajo.
En los casos de estudio, el equipo conectó esos servidores a Claude Code con Sonnet 4. La diferencia frente a cargar un PDF en un chat está en la comprobación: Paper2Agent prueba las herramientas contra salidas de referencia del código original.
El proceso verifica archivos generados, resultados numéricos y figuras. Si una función no supera las pruebas, el sistema la excluye. El proyecto ofrece públicamente su código bajo licencia MIT.
La reproducibilidad decide qué papers se convierten
En la prueba a escala, el sistema procesó 100 papers de biología computacional sin limpieza manual y convirtió 74 de 100 en agentes ejecutables. Paper2Agent propuso 599 herramientas y 593 pasaron la validación automática.
Los otros 26 no pudieron convertirse de forma completa. Las causas incluyeron:
- Repositorios sin código ejecutable.
- Datos o artefactos de modelo ausentes.
- Dependencias difíciles de recuperar.
- Scripts que no podían generalizarse.
El estudio plantea que esa fricción puede servir como una señal práctica de reproducibilidad. Un paper puede explicar un método con claridad, pero no basta si sus materiales no permiten reconstruirlo.
Ejecutar mejor no valida una conclusión científica
En 300 preguntas derivadas de tutoriales, Paper2Agent registró 91.2% de precisión, frente a 80.3% de Claude Code con acceso directo al repositorio, según el estudio. El costo medio fue de US$0.20 y el tiempo de 1.6 minutos por consulta. Claude Code registró US$0.38 y 4.3 minutos.
Estas pruebas miden sobre todo qué tan fielmente el agente ejecuta un método y reproduce respuestas de referencia. Los autores advierten que, en análisis abiertos, coincidir con una única respuesta no demuestra por sí mismo la validez científica de una interpretación.
Los servidores también necesitan mantenimiento cuando cambian dependencias, APIs o repositorios. Además, pueden heredar problemas de seguridad, licencias o atribución del código que exponen.
GPR137 aparece como una hipótesis de psoriasis
Para mostrar cómo podrían colaborar varios agentes, el equipo conectó 3 papers convertidos en herramientas y analizó datos ya publicados sobre un locus asociado con psoriasis. Paper2Agent priorizó a GPR137 como gen candidato, pero un investigador humano eligió una de las 10 estrategias de validación propuestas por el agente.
La correlación que respaldó esa hipótesis apareció bajo condiciones de estimulación, no en reposo. El caso no equivale a descubrir una causa confirmada de la enfermedad ni a validar una terapia.
La demostración muestra cómo un agente puede integrar métodos y datos previos para proponer una línea de investigación que todavía requiere juicio humano.
Paper2Agent ofrece una forma de reutilizar investigación computacional con menos fricción, pero también pone a prueba la calidad técnica de cada paper. Para que la conversión produzca un agente confiable, la publicación debe conservar código, datos y flujos de trabajo que otros puedan ejecutar y revisar. Los 26 casos que quedaron fuera muestran dónde empieza ese límite: antes de la conversación con el agente, en los materiales que permiten reconstruir el método.