La inteligencia artificial (IA) continúa mostrando avances sin precedentes en sus capacidades y razonamiento, aunque estos progresos también han venido acompañados de un fenómeno inquietante: el aumento de las tasas de alucinación en algunos modelos.
En particular, los modelos más recientes de OpenAI, como el o3 y el o4-mini, han registrado tasas de alucinación significativamente altas, lo que contrasta marcadamente con los desarrollos de competidores como Google, cuyos modelos Gemini mantienen tasas inferiores al 1%.
Una prueba muestra que el modelo o3 de OpenAI tiene una tasa de alucinaciones del 6,8%
El benchmark ‘Hallucination Leaderboard’, actualizado recientemente, revela que algunos de los modelos más avanzados no solo han logrado una baja tasa de alucinaciones, sino que contradicen la idea de que a mayor avance tecnológico, mayores sean estos índices.
Por ejemplo, modelos como Google Gemini-2.0-Flash-001 y Vectara Mockingbird-2-Echo han demostrado tasas de alucinación de 0,7% y 0,9%, respectivamente, mientras que el modelo o3 de OpenAI presenta una tasa alarmante del 6,8% según el profesor Ethan Mollick de Wharton.
Esta situación plantea un dilema en la innovación de la IA: los modelos que poseen mayores capacidades de razonamiento son, irónicamente, los que enfrentan dificultades significativas en fiabilidad y precisión.
A pesar de que OpenAI ha sido pionera en la creación de tecnologías de IA sofisticadas, el desafío persiste en equilibrar el rendimiento con la exactitud. Mientras las empresas compiten por alcanzar una inteligencia artificial general (AGI), esta carrera ha conducido a desarrollos más poderosos, aunque la fiabilidad sigue siendo un componente crítico aún por resolver.
OpenAI es consciente de estos problemas y trabaja en corregir las elevadas tasas de alucinación en sus sistemas. Este reconocimiento podría ser clave para asegurar que los avances en capacidades no comprometan la calidad de sus modelos en el futuro, enfatizando así la importancia de la fiabilidad en la evolución de la IA generativa.