Alibaba abre RADAR: su AUC superó al de 23 de 26 radiólogos

Alibaba abre RADAR: su AUC superó al de 23 de 26 radiólogos

Alibaba abre RADAR, IA para tomografías: AUC 0.913 y 10.0% más sensibilidad.

Por Humberto Toledo el 20 de septiembre del 2026 a las 3:42 am PDT

✨︎ Resumen (TL;DR):

  • Alibaba publicó el código de RADAR, un modelo de visión-lenguaje para analizar tomografías computarizadas abdominales con contraste.
  • El sistema logró un AUC medio de 0.913 en casi 40,000 estudios, con 146 hallazgos distribuidos en 18 estructuras anatómicas.
  • Con RADAR como apoyo, los especialistas elevaron 10.0% la sensibilidad diagnóstica y redujeron 30.7% el tiempo de lectura por caso; la especificidad pasó de 98.8% a 98.2%.

Alibaba publicó el código de RADAR, un modelo de visión-lenguaje desarrollado por su academia DAMO para analizar tomografías computarizadas abdominales con contraste. En casi 40,000 estudios, logró un AUC medio de 0.913 en 146 hallazgos de 18 estructuras anatómicas; en una prueba con 26 radiólogos, solo 3 superaron el AUC de RADAR al trabajar sin asistencia. Con RADAR como apoyo, la sensibilidad diagnóstica subió 10.0% y el tiempo de lectura por caso bajó 30.7%, pero el resultado no prueba que pueda sustituir a un radiólogo ni mejorar por sí solo los resultados de los pacientes.

Anthropic acusa a Alibaba del mayor ataque contra Claude
Te podría interesar:
Anthropic acusa a Alibaba del mayor ataque contra Claude
Una pista de aeropuerto amplia con aviones y hangares bajo un cielo despejado.
Foto: Allen Boguslavsky / Pexels

Cómo aprendió RADAR

RADAR es un modelo de visión-lenguaje que analiza tomografías computarizadas abdominales con contraste y relaciona regiones de la imagen con los hallazgos descritos en los reportes radiológicos. Alibaba lo desarrolló en su academia DAMO y lo entrenó con más de 400,000 exámenes de tomografía abdominal con contraste y 15 millones de pares de imagen y texto orientados por anatomía.

En vez de crear anotaciones manuales para cada enfermedad, el método aprovecha los reportes clínicos que ya acompañaban a los estudios. El sistema vincula regiones concretas de la imagen con las descripciones correspondientes del informe. De ese modo, relaciona las características locales del hígado, el páncreas, los riñones y otras estructuras con los hallazgos del radiólogo, en vez de tratar toda la tomografía y todo el reporte como un único bloque.

Science publicó el trabajo el 17 de septiembre. El estudio describe a RADAR como un modelo generalista para tomografías abdominales con contraste.

146 hallazgos no son 146 tipos de cáncer

El estudio evaluó RADAR en casi 40,000 exámenes y midió 146 hallazgos clínicamente relevantes distribuidos en 18 estructuras anatómicas. La cobertura incluye enfermedades y signos de imagen relacionados con cáncer.

El número 146 corresponde a hallazgos, no a tipos de cáncer. Por eso, no equivale a una lista de 146 cánceres distintos ni a una prueba independiente para cada tipo de tumor.

RADAR obtuvo un AUC medio de 0.913. El AUC, o área bajo la curva ROC, mide qué tan bien un sistema separa casos positivos y negativos cuando cambia el umbral de decisión. No significa que RADAR haya acertado el 91.3% de los diagnósticos ni sustituye métricas clínicas como sensibilidad, especificidad, falsos positivos y falsos negativos.

La comparación mide apoyo, no autonomía

Participaron 26 radiólogos de 14 instituciones. La muestra incluyó especialistas sénior y júnior de hospitales con distinto perfil. En la sesión sin asistencia, solo 3 radiólogos obtuvieron un AUC superior al de RADAR. La comparación específica dejó al modelo por encima de 23 de 26 participantes en desempeño promedio.

Ese dato no significa que la IA haya reemplazado a 23 médicos, ganado cada caso individual o podido emitir diagnósticos autónomos en cualquier tomografía. La cifra resume una comparación de AUC, no una sustitución clínica.

En una segunda sesión, realizada al menos un mes después y con los estudios presentados en orden aleatorio, los radiólogos trabajaron con la ayuda de RADAR. La sensibilidad diagnóstica general aumentó 10.0% y el tiempo promedio de lectura por caso cayó 30.7%.

La especificidad bajó ligeramente de 98.8% a 98.2%. La variación muestra el intercambio entre detectar más anomalías y generar más resultados positivos que después deben revisarse.

El beneficio fue especialmente visible entre los radiólogos júnior: su desempeño llegó a igualar o superar al de especialistas sénior en esa evaluación. El resultado respalda un papel de segunda lectura o apoyo durante la elaboración del reporte, no la eliminación de la supervisión médica.

Qué aporta el código abierto

El repositorio de GitHub incluye código para entrenamiento, inferencia y preprocesamiento, además de instrucciones para evaluar el sistema con el conjunto externo MERLIN. La ficha de RADAR en Hugging Face ofrece los pesos preentrenados.

El código usa la licencia Apache 2.0 y los pesos, CC BY-NC-SA 4.0. El lanzamiento no establece una única licencia comercial para todos los componentes y no equivale, por sí mismo, a una autorización para uso clínico.

La validación clínica sigue pendiente

El trabajo incluyó evaluaciones multicéntricas y distintos escenarios clínicos, pero los investigadores señalaron que todavía hacen falta estudios prospectivos en más regiones, equipos y poblaciones antes de una implementación clínica. La disponibilidad del código y los pesos permite que otros grupos examinen el modelo y prueben su rendimiento con datos independientes.

Eso no reemplaza la validación local ni demuestra que el sistema mejore los resultados de los pacientes en la práctica cotidiana. RADAR está diseñado para tomografías abdominales con contraste; la evidencia presentada no extiende automáticamente sus resultados a resonancias, radiografías, otras partes del cuerpo o protocolos diferentes.

Su aporte más concreto por ahora es combinar una cobertura amplia de hallazgos con un lanzamiento que permite inspeccionar y reproducir parte del trabajo. El siguiente paso es probar su desempeño de forma prospectiva en más regiones, equipos y poblaciones. Hasta entonces, los datos respaldan una herramienta de apoyo o segunda lectura, no diagnósticos autónomos.

Fuentes: 1, 2, 3, 4, 5

+ Temas Relacionados

Más de AI

Feed