Claude Opus 5 iguala 96.4% de pureza, pero con otra cuenta

Claude Opus 5 iguala 96.4% de pureza, pero con otra cuenta

Claude Opus 5 procesó datos químicos crudos, pero su 96.4% de pureza no usa la misma cuenta que el laboratorio.

Por Humberto Toledo el 19 de agosto del 2026 a las 8:13 am PDT

✨︎ Resumen (TL;DR):

  • Claude Opus 5 procesó archivos crudos de resonancia magnética nuclear y cromatografía líquida acoplada a masas en 23 y 19 minutos, sin el software del fabricante ni un operador.
  • Anthropic comparó una pureza de 96.4% con el 96.33% del laboratorio, aunque cada cifra usa un conjunto distinto de picos.
  • Al repetir el cálculo del laboratorio con las áreas de Claude, el resultado fue 98.8%; el compuesto principal y su tiempo de retención sí coinciden.

Anthropic probó Claude Opus 5, el modelo más capaz que ofrece de forma general, con archivos crudos de resonancia magnética nuclear y cromatografía líquida acoplada a masas de un laboratorio de química. Los procesó en 23 y 19 minutos, con una instrucción de una a tres frases y sin el software del fabricante ni un operador. El modelo reportó 96.4% de pureza frente a 96.33% del laboratorio, pero las cifras se calcularon con conjuntos de picos distintos, así que el empate no funciona como verificación cruzada.

Anthropic publicó el resultado el 18 de agosto de 2026, junto con una campaña de diseño de proteínas. La prueba aborda una tarea rutinaria de un químico de síntesis: demostrar qué molécula fabricó y qué tan pura salió.

La resonancia magnética nuclear es una técnica de análisis que permite revisar señales y conteos de hidrógenos en una muestra. La cromatografía líquida acoplada a masas es una técnica de análisis que produce cromatogramas y datos de masa para revisar la pureza. Interpretar estos archivos toma, en promedio, entre media hora y una hora por muestra.

Removedores de Claude solo borran metadatos
Te podría interesar:
Removedores de Claude solo borran metadatos
Una vista en primer plano de una mano tocando un piano con luz cálida, capturando la emoción musical.
Foto: cottonbro studio / Pexels

El porcentaje cambia cuando cambia la selección de picos

El anuncio de Anthropic puso lado a lado 96.4% de pureza para Claude y 96.33% para el laboratorio. El informe técnico enlazado en esa misma publicación introduce el detalle que modifica la lectura: las cifras no salen del mismo cálculo.

El laboratorio obtuvo 96.33% con siete picos a partir del minuto 3.46. Claude, en cambio, calculó 96.4% con los tres picos que detectó desde el minuto cero, incluido el pico de volumen muerto.

Cuando se rehace la cuenta del laboratorio usando las áreas que Claude obtuvo, la pureza sube a 98.8%. La razón está en cinco picos menores del reporte, equivalentes a 2.1% del área en su tabla, que apenas aparecen en la traza reconstruida por el modelo.

El compuesto principal y su tiempo de retención sí coinciden en ambos reportes. Lo que no coincide es el conjunto de picos, por lo que el empate numérico no funciona como una verificación cruzada.

En resonancia magnética nuclear, Claude entregó una tabla con 18 señales y el conteo de hidrógenos de cada una. La lectura coincidió con la del operador dentro de 0.08 hidrógenos, pero solo en las regiones que podían emparejarse.

El operador tenía cuatro regiones débiles de entre 0.1 y 0.2 hidrógenos que no encontraron equivalente en la tabla del modelo. La coincidencia, por tanto, aplica a las señales comparables, no a todas las regiones que aparecieron en la lectura humana.

Claude leyó un binario sin manual público

El reto principal no estuvo en la química, sino en la ingeniería inversa. Los dos instrumentos guardan sus archivos crudos en formatos propietarios, diseñados para abrirse en el software del fabricante o en programas especializados.

El archivo binario del cromatógrafo es un contenedor de datos sin documentación pública que Claude tuvo que interpretar para localizar la información de masas y del detector. El modelo no encontró un lector para ese archivo ni en su catálogo de herramientas ni en el repositorio público de paquetes de Python.

Claude reconoció el tipo de contenedor, localizó los datos entre 281 flujos internos y dedujo cómo estaban codificados. Antes de analizar nada, sumó las intensidades de los iones que había decodificado.

La suma reprodujo exactamente, al entero, el cromatograma total que el instrumento había guardado por su cuenta para 2,664 barridos. Esa comprobación validó la lectura del archivo antes de que el modelo la usara en el análisis.

Tras validar la lectura, Claude entregó:

  • Cromatogramas y espectros de masas y de ultravioleta.
  • Una tabla de pureza.
  • Una masa nominal de 504 daltons.
  • Un lector reutilizable para archivos de ese tipo.

También enumeró sus limitaciones, incluida la del instrumento que reporta la masa solo como número entero.

Una prueba con agua pesada terminó en autocorrección

Al revisar cuatro señales anchas sin acoplamiento resoluble, Claude propuso añadir agua pesada a la muestra. Ese intercambio de hidrógenos haría que sus picos se encogieran o desaparecieran, una comprobación estándar para esa lectura.

El laboratorio había realizado exactamente ese experimento por su cuenta, tres días después de la primera medición. Ese archivo fue el siguiente que recibió el modelo.

La primera comparación de Claude traía un titular equivocado: afirmaba que las cuatro señales habían desaparecido. Su auditor interno detectó que esa afirmación contradecía la tabla de comparación, rehízo el cálculo sobre las regiones comunes de ambos espectros y corrigió la lectura.

El resultado final fue más acotado: se limpiaron dos regiones, no cuatro, una lectura que coincide con la del operador humano.

El ahorro está en procesar varias muestras

Anthropic destaca los tiempos, pero el denominador cambia la comparación. Claude recibió una instrucción de una a tres frases y tardó 23 minutos con un archivo y 19 minutos con el otro, sin software del fabricante ni operador.

El procesamiento manual del operador dentro del software del fabricante tomó 1 minuto y 49 segundos para el primer espectro. Los cuatro días correspondieron al reporte terminado, porque el laboratorio analiza una molécula a la vez y entre medias entra otro trabajo.

La prueba no sugiere que Claude procese más rápido que un operador entrenado frente a su pantalla. Sugiere que puede correr muchas muestras en paralelo sin que nadie abra el software.

Anthropic invita a probarlo con archivos propios en Claude Science, así que cualquier laboratorio con datos a la mano puede verificar la afirmación. La revisión tendrá que mirar más allá del 96.4%: también deberá comparar el formato leído y el conjunto de picos usado para obtener la pureza.

Fuentes: 1, 2, 3

+ Temas Relacionados

Más de AI

Feed