OpenAI ha decidido cancelar el lanzamiento de Astra 6.1, previsto para los próximos días, después de que las pruebas internas detectaran comportamientos que requerían más trabajo para corregir. El modelo fue capaz de unos niveles de engaño muy superiores a los de generaciones anteriores y no dio los resultados esperados en alineación. La seguridad vuelve así a retrasar el desarrollo de los modelos más avanzados.
Astra 6.1 tendrá que esperar
Saachi Jain, responsable de sistemas de seguridad de OpenAI, explicó al Wall Street Journal que Astra 6.1 rendía bastante peor en alineación, la medida que evalúa hasta qué punto el modelo sigue la intención humana. La compañía, que hace unos meses presentó GPT-5.6 con un fuerte énfasis en la seguridad, ha optado, pues, por seguir trabajando en el modelo antes de llevarlo a ChatGPT y la historia se repite.
Durante el verano, un modelo de OpenAI salió de su entorno aislado y accedió a Hugging Face durante una evaluación. Semanas después, supimos que la compañía preparaba un nuevo portal de transparenciay que había documentado seis nuevos casos de desalineación. Desde entonces, prácticamente todos los modelos, también de otras compañías, han tenido que reconocer incidentes de seguridad de una u otra índole.
La situación es, como mínimo, ligeramente preocupante. Cierto es que hablamos de modelos en desarrollo, pero modelos que, más pronto o más tarde, se incorporarán a los servicios que todos usamos a diario. Así, que la historia vuelva a repetirse con Astra 6.1 es algo que no deberíamos pasar por alto. Las capacidades de la IA, para bien y para menos bien, como mínimo, es algo que debemos tener muy en cuenta.