✨︎ Resumen (TL;DR):
- OpenAI publicó MentalHealthBench el 23 de septiembre de 2026, con 1,215 conversaciones simuladas y 5,262 criterios de evaluación, más de 5,000 en total.
- GPT-6 Astra obtuvo 57.3%, pero GPT-5.6 Sol, también de OpenAI, calificó las respuestas contra los criterios.
- Claude Opus 5.5 fue el mejor con adolescentes, con 57.0%; las respuestas redactadas por clínicos promediaron 38.5% y el conjunto puede repetirse con otro calificador.
OpenAI publicó el 23 de septiembre de 2026 MentalHealthBench, un examen abierto que mide cómo responden los modelos de IA en 1,215 conversaciones simuladas sobre salud mental, desde el estrés cotidiano hasta las emergencias. Su GPT-6 Astra quedó primero con 57.3%, mientras las respuestas redactadas por clínicos promediaron 38.5%; además, GPT-5.6 Sol, otro modelo de OpenAI, calificó cada respuesta.
MentalHealthBench es un examen abierto que mide cómo responden los modelos de IA en conversaciones simuladas de salud mental. Sus criterios fueron redactados por más de 80 psicólogos y psiquiatras de 22 países.
El conjunto distribuye los casos en tres niveles. El 53.5% describe situaciones cotidianas con carga emocional, el 18.2% presenta síntomas serios sin llegar a una emergencia y el 28.3% plantea emergencias que exigen apoyo inmediato en el mundo real.
OpenAI aclara que esta combinación busca poner a prueba a los modelos y no representa la frecuencia real de esos temas en ChatGPT.

La prueba no se limita a las crisis
Las evaluaciones previas se concentraban principalmente en crisis y en una pregunta binaria: si el modelo evitaba o no una respuesta prohibida. MentalHealthBench intenta evaluar conductas más específicas, como preguntar lo necesario o no dar por hecho lo que siente la persona.
Entre los temas con más casos aparecen:
- Relaciones de pareja: 255 conversaciones.
- Suicidio y autolesión: 159 conversaciones.
- Fe y creencias: 128 conversaciones.
- Psicosis o alteraciones de la realidad: 115 conversaciones.
Cada conversación pasó por 3 especialistas. 2 redactaron por separado, sin ver el trabajo del otro, los criterios para evaluar la respuesta. A cada criterio le asignaron un peso de -10 a +10: los valores positivos premiaban conductas útiles, como preguntar lo necesario, y los negativos castigaban errores, como asumir lo que siente el usuario.
Un tercer especialista adjudicó las diferencias. Solo se conservaron los criterios respaldados por al menos 2 especialistas y sin objeciones del tercero. El proceso terminó con 5,262 criterios.
Para el público hispanohablante hay un dato relevante. Entre los idiomas distintos del inglés, el español tiene la mayor presencia, con 105 conversaciones. Le siguen 54 conversaciones en hindi.
El 21.2% de los casos simula a adolescentes de 13 a 17 años. OpenAI señala que esos escenarios solo los revisaron clínicos con experiencia reciente en pacientes menores de edad.
“La salud mental existe en un continuo, desde el bienestar pleno hasta el estrés cotidiano y la crisis aguda”, dijo Arthur Evans, director ejecutivo de la American Psychological Association.
GPT-6 Astra encabeza la tabla, con un calificador de OpenAI
Los modelos de OpenAI ocupan los primeros lugares de la tabla general publicada. El dato metodológico que acompaña esos resultados es que GPT-5.6 Sol, otro modelo de la empresa operando en modo de razonamiento alto, calificó cada respuesta frente a los criterios redactados por los especialistas.
Los humanos escribieron las reglas. Una IA de la misma empresa que encabeza la clasificación determinó si cada respuesta las cumplía.
El paper de OpenAI, publicado el 23 de septiembre de 2026, reporta estos puntajes seleccionados como porcentaje del máximo posible:
| Modelo | General | Emergencias | Perfil adolescente |
|---|---|---|---|
| GPT-6 Astra (OpenAI) | 57.3% | 58.3% | 55.9% |
| GPT-6 Sol (OpenAI) | 53.9% | 55.1% | 52.7% |
| Claude Opus 5.5 (Anthropic) | 52.4% | 53.9% | 57.0% |
| Muse Spark 1.3 (Meta) | 48.6% | 54.3% | 53.6% |
| Grok 4.7 (xAI) | 41.3% | 41.5% | 40.5% |
| Gemini 3.8 Flash (Google) | 35.5% | 37.9% | 36.2% |
| GPT-4o (OpenAI, versión de marzo de 2025) | 32.1% | 24.1% | 35.4% |
El orden cambia según la categoría. Claude Opus 5.5 fue el mejor con adolescentes, con 57.0%. El documento también destaca el desempeño de Opus y Sonnet en el eje de autonomía del usuario.
Opus 5.5 obtuvo 73% de los puntos positivos posibles, frente a 69% de GPT-6 Astra. Sin embargo, acumuló penalizaciones equivalentes a 33%, mientras Astra registró 19%.
Muse Spark 1.3, de Meta, lideró las 70 conversaciones en las que el modelo recibió antecedentes del usuario, como la muerte reciente de un familiar.
La diferencia con una versión anterior de OpenAI también aparece en las emergencias. GPT-4o, en su versión de marzo de 2025, obtuvo 24.1%, la cifra más baja de todos los modelos evaluados en esa categoría.
La referencia humana obtuvo 38.5%
OpenAI pidió a un cuarto clínico, ajeno a la redacción de los criterios, que escribiera la respuesta ideal para cada conversación sin usar herramientas de IA. Sus respuestas promediaron 38.5%, por debajo de 12 de los 17 modelos evaluados.
Según el paper, los clínicos recibieron menos penalizaciones que los modelos, pero también sumaron menos puntos positivos. Tendieron a responder con una sola pregunta o una frase simple, como lo harían frente a un paciente en una consulta presencial.
Para respaldar esa explicación, el documento comparó cada puntaje con la extensión promedio de las respuestas. Cuando OpenAI entregó a GPT-6 Astra los criterios antes de responder, sus respuestas promediaron 99%.
OpenAI también comparó a los especialistas con 44 adultos de 16 países que usan IA para recibir apoyo emocional. La coincidencia fue de apenas 25.7% del peso de sus criterios, aunque las contradicciones directas representaron solo 1%.
Los 44 adultos valoraron más los pasos prácticos y el tono. Los clínicos dieron más peso a reunir contexto e interpretar con cautela las situaciones ambiguas. Los participantes solo revisaron conversaciones no agudas para evitar su exposición a material angustiante.
La prueba evalúa un turno, no el diálogo completo
MentalHealthBench califica una sola respuesta: la que aparece después del último mensaje de cada conversación. El paper reconoce que una prueba de varios turnos exigiría simular cómo evoluciona el diálogo y redactar criterios que fueran a la vez específicos y generales, una tarea demasiado pesada para los especialistas.
El mismo 23 de septiembre de 2026, The Washington Post reportó otro estudio según el cual, en conversaciones más largas con usuarios adolescentes, algunos chatbots populares todavía pueden cometer errores potencialmente peligrosos, como ofrecer un diagnóstico sobre la salud mental del joven.
OpenAI insiste en que ChatGPT no sustituye la terapia ni la atención profesional. El paper plantea MentalHealthBench como una herramienta de diagnóstico auditable, no como una tabla de posiciones definitiva.
El conjunto de datos se puede descargar. OpenAI pide no republicar los ejemplos en texto plano para evitar que contaminen el entrenamiento de futuros modelos.
Cualquier laboratorio puede repetir la prueba con un calificador que no sea de OpenAI y comprobar si la tabla se sostiene.
