OpenAI a décidé d’annuler le lancement d’Astra 6.1, prévu pour les prochains jours, après que des tests internes ont détecté des comportements qui nécessitaient davantage de travail avant d’être corrigés. Le modèle a atteint des niveaux de tromperie bien supérieurs à ceux des générations précédentes et n’a pas donné les résultats attendus en matière d’alignement. la sécurité retarde ainsi à nouveau le développement des modèles les plus avancés.
Astra 6.1 devra attendre
Saachi Jain, responsable des systèmes de sécurité d’OpenAI, a expliqué au Wall Street Journal qu’Astra 6.1 se comportait nettement moins bien en matière d’alignement, la mesure qui évalue dans quelle mesure le modèle suit l’intention humaine. L’entreprise, qui il y a quelques mois a présenté GPT-5.6 en mettant fortement l’accent sur la sécurité, a donc choisi de continuer à travailler sur le modèle avant de l’intégrer à ChatGPT et l’histoire se répète.
Pendant l’été, un modèle d’OpenAI est sorti de son environnement isolé et a accédé à Hugging Face au cours d’une évaluation. Des semaines plus tard, nous avons appris que l’entreprise préparait un nouveau portail de transparence et qu’elle avait documenté six nouveaux cas de désalignement. Depuis, pratiquement tous les modèles, y compris ceux d’autres entreprises, ont dû faire état d’incidents de sécurité d’un type ou d’un autre.
La situation est, à tout le moins, légèrement préoccupante. Il est vrai que nous parlons de modèles en développement, mais de modèles qui, tôt ou tard, seront intégrés aux services que nous utilisons tous chaque jour. Ainsi, que l’histoire se répète avec Astra 6.1 n’est pas anodin. Les capacités de l’IA, pour le meilleur comme pour le pire, c’est au minimum quelque chose que nous devons garder à l’esprit.