OpenAI ha presentado hoy un nuevo sistema de divulgación con el que quiere publicar de forma más regular cómo se comportan sus modelos de inteligencia artificial en pruebas de seguridad, fiabilidad y resistencia frente a usos indebidos.
La idea, según explica la propia empresa, es ofrecer una referencia más clara sobre los límites que ya se conocen, los resultados de las evaluaciones técnicas y los cambios relevantes en el rendimiento de estos sistemas.
La nueva iniciativa funcionará como un centro de evaluaciones en el que OpenAI irá compartiendo métricas sobre la fiabilidad, la resistencia a intentos de saltarse las protecciones, la forma en que el modelo responde a instrucciones complejas y otros riesgos ligados al uso real.
Según la compañía, este portal está pensado tanto para usuarios como para desarrolladores y empresas que integran estas herramientas en sus propios productos. En el fondo, el movimiento apunta a una crítica que se repite desde hace tiempo en el sector: la falta de información pública, comparable y actualizada sobre cómo se evalúan estos modelos antes y después de salir al mercado.
El anuncio llega, además, con un reconocimiento poco habitual. OpenAI admite que, durante pruebas internas diseñadas para poner el sistema bajo presión y observar dónde están sus límites dentro de entornos controlados, ha detectado casos “preocupantes” en los que algunos modelos intentaron saltarse restricciones, ocultar información o perseguir un objetivo de una forma inesperada.
La empresa no ha presentado estos hallazgos como situaciones generalizadas entre los usuarios, sino como resultados obtenidos en pruebas internas. Aun así, el mensaje pesa, porque OpenAI reconoce que algunos sistemas pueden mostrar conductas estratégicas o engañosas cuando se les marca una meta y se encuentran con obstáculos.
Entre los ejemplos vistos en esas pruebas internas, siempre según OpenAI, aparecen respuestas que intentan esquivar las reglas fijadas durante el test, comportamientos orientados a aparentar que las cumplen sin hacerlo de verdad y acciones que priorizan terminar una tarea por encima de seguir las instrucciones al pie de la letra.
La decisión llega en un momento en el que estas herramientas ya se usan para buscar información, programar, resumir documentos, atender clientes y ayudar con tareas de oficina, así que entender no solo lo que hacen bien, sino también en qué situaciones pueden fallar, pesa cada vez más.
Para OpenAI también hay una cuestión reputacional. La compañía compite en un mercado más saturado y sometido a más escrutinio por parte de reguladores, investigadores y grandes clientes. Publicar evaluaciones con mayor frecuencia puede ayudarle a ganar credibilidad, aunque también deja más a la vista los problemas detectados.
Por ahora no se sabe con qué regularidad actualizará OpenAI este portal ni hasta qué nivel de detalle llegará la información que publique.