OpenAI ha anunciado hoy que ChatGPT refuerza sus respuestas sobre salud con GPT-5.5 Instant, uno de los terrenos más sensibles en los que se usa el chatbot.
Según la compañía, en sus pruebas internas las respuestas del sistema obtuvieron mejores valoraciones que las escritas por médicos en precisión, claridad y nivel de detalle. También afirma que, en los dos últimos meses, la tasa de error en afirmaciones relacionadas con la salud bajó un 71%.
La meta es simple: que ChatGPT se equivoque menos y responda mejor cuando de verdad importa. OpenAI dice que esta actualización afina la detección de situaciones en las que podría hacer falta atención urgente, le permite pedir contexto relevante antes de contestar y expone con más claridad la incertidumbre médica cuando no existe una respuesta fácil.
Ese contexto ayuda a entender por qué OpenAI está apretando tanto en este frente.
La empresa sostiene que más de 230 millones de personas usan ChatGPT cada semana para hacer preguntas sobre salud. De ahí que, según explica, se haya apoyado en una red de más de 260 médicos de 60 países, que revisaron más de 700.000 respuestas del modelo.
Lo más llamativo sigue siendo la comparación directa con profesionales sanitarios. OpenAI asegura que, en sus evaluaciones internas, GPT-5.5 Instant superó las respuestas de médicos en exactitud, claridad y exhaustividad, aunque no hay que perder de vista que esas cifras salen de la propia empresa.
Sí aparece, al menos, una señal externa que va en esa misma línea: según una prueba independiente con 18 indicaciones médicas, GPT-5.5 Instant recortó en un 54,5% las afirmaciones inventadas frente a GPT-5.3 Instant. No es una validación amplia, ni mucho menos, pero en términos generales sí encaja con la idea de una menor tendencia a alucinar datos médicos.
Aun con esa mejora, las advertencias siguen siendo muy serias. Los expertos recuerdan que estas herramientas pueden servir para la educación del paciente, como orientación inicial o como apoyo al trabajo clínico, pero todavía pueden fallar, provocar malentendidos en quien consulta o retrasar una atención necesaria.
Y ese riesgo no es hipotético: según un estudio sobre una versión anterior, el sistema infravaloró la gravedad de más de la mitad de los casos de emergencia que se le plantearon. En la práctica, eso puede acabar traduciéndose en una atención tardía o inadecuada.
Especialistas en medicina y ética insisten, además, en varios puntos: supervisión humana, transparencia sobre cómo se evalúan las respuestas, protección de la privacidad, reducción de sesgos y uso de estas herramientas como apoyo, no como reemplazo del médico.
A día de hoy, sigue sin saberse del todo hasta qué punto estas mejoras se sostienen fuera de los laboratorios de OpenAI. La confianza real, por tanto, dependerá menos de los anuncios y más de las pruebas externas.