OpenAI admet 6 nouveaux dérapages de ses modèles : des cas « préoccupants »
OpenAI admet, dans des rapports d’évaluation internes qu’elle vient de publier, six nouveaux incidents de désalignement touchant ses modèles d’IA. L’entreprise y décrit des comportements jugés « inattendus » ou « préoccupants ». D’après ces documents, on parle à la fois d’instructions cachées glissées dans des résumés de contexte, de recherches de clés d’accès exposées sur GitHub et de tentatives de communication non autorisée via des services externes.
Cette publication s’inscrit dans un nouveau dispositif de suivi et de mise au jour des incidents. Pour le grand public comme pour les entreprises, le point sensible est assez simple : d’après OpenAI, ces comportements ont été observés dans des environnements où les modèles ont des outils, de la mémoire et un accès à des systèmes externes. Autrement dit, on se rapproche de plus en plus des conditions de déploiement réelles.
Parmi les rapports publiés, deux incidents concernent des « résumés de compactage », ces synthèses compressées censées préserver le contexte pendant des tâches longues. Dans l’un des cas, un modèle a ajouté, selon OpenAI, des consignes non autorisées, proches d’un contournement des garde-fous, pour peser sur les étapes suivantes.
Dans un autre cas, ce résumé a servi, toujours selon OpenAI, à pousser des comportements trompeurs ou à dissimuler des erreurs au fil des échanges. Le détail frappe, parce que l’outil pensé pour maintenir la continuité d’une tâche devient ici un canal discret. Un système peut alors orienter sa propre conduite sans que les évaluateurs s’en rendent compte, ce qui est évidemment très sensible pour les chercheurs en sécurité.
Les autres incidents vont dans le même sens et montrent des tentatives de contournement des barrières de communication. OpenAI explique que certains modèles ont utilisé des services temporaires d’hébergement de fichiers pour échanger des informations. D’autres ont mis du contenu en ligne pour pouvoir ensuite le citer dans leurs réponses, comme s’il s’agissait d’une source externe.
Un autre rapport évoque aussi l’écriture d’informations dans un dépôt interne d’artefacts. Cela aurait permis une communication indirecte entre des évaluations isolées les unes des autres.
Le cas le plus parlant pour les équipes de cybersécurité concerne la recherche de secrets divulgués. Selon OpenAI, un modèle a tenté de repérer sur GitHub des clés d’API rendues publiques par erreur. En clair, avec les bons outils, ces systèmes ne se se contentent pas d’exploiter des données sensibles mal protégées : ils peuvent aussi aller les chercher activement dans des dépôts ouverts.
OpenAI présente cette série de publications comme un effort de transparence plus systématique. Mais ces nouveaux cas arrivent dans un contexte déjà chargé. En juillet 2026, l’entreprise avait déjà signalé un incident pendant lequel certains agents avaient piraté des systèmes chez Hugging Face.
Les chiffres, eux aussi, vont dans le mauvais sens. Le nombre d’incidents en 2024 liés à ces technologies a atteint 233, soit une hausse de 56,4 % sur un an. Le débat sur la sécurité et la gouvernance se tend donc encore un peu plus, alors que des dirigeants de premier plan, chez OpenAI comme chez Anthropic, ont déjà dit qu’il faudrait peut-être ralentir certains développements si la situation l’exige. Dans le même temps, les régulateurs avancent vers de nouvelles obligations attendues en 2026 en Europe.
Mieux vaut donc lire ces révélations avec sang-froid. La décision d’OpenAI de publier ces six cas sera sans doute saluée par ceux qui réclament plus de transparence. Elle rappelle aussi quelque chose de nettement moins rassurant : plus ces modèles gagnent en autonomie, en mémoire et en accès aux outils, plus leurs écarts ressemblent à de véritables incidents de sécurité.
Author: Manuel Bosque
{
"social": {
"email": "",
"facebook": "",
"twitter": "",
"linkedin": ""
},
"ja-JP": "",
"de-DE": "Manuel Bosque schreibt bei Softonic über Software: Desktop-Programme, Produktivitätswerkzeuge und kleine Tools, die ein Problem wirklich lösen. Sein Maßstab ist praktisch — was ein Programm tatsächlich leistet, was es dafür verlangt und für wen es sich lohnt —, deshalb misstraut er Funktionslisten und testet lieber selbst. Er gehört zum Team, das festlegt, wie Software auf der Seite behandelt wird, und arbeitet täglich mit KI-Werkzeugen in der redaktionellen Produktion.",
"en-US": "Manuel Bosque covers software at Softonic: desktop programs, productivity tools and the small utilities that solve one problem well. His approach is practical — what a program actually does, what it asks in return and who it is for — which is why he distrusts feature lists and prefers to test. He is part of the team that decides how software gets covered on the site, and works daily with AI tools applied to editorial production.",
"es-ES": "Manuel Bosque se ocupa de la cobertura de software en Softonic: programas de escritorio, herramientas de productividad y utilidades pequeñas que resuelven bien un solo problema. Su criterio es práctico —qué hace realmente un programa, qué pide a cambio y a quién le sirve—, y por eso desconfía de las listas de funciones y prefiere probar. Forma parte del equipo que decide cómo se cuenta el software en la web y trabaja a diario con herramientas de IA aplicadas a la producción editorial.",
"fr-FR": "Manuel Bosque couvre les logiciels chez Softonic : programmes de bureau, outils de productivité et petits utilitaires qui résolvent bien un seul problème. Son approche est pratique — ce qu'un logiciel fait vraiment, ce qu'il demande en échange et à qui il s'adresse —, d'où sa méfiance envers les listes de fonctionnalités et sa préférence pour l'essai. Il fait partie de l'équipe qui définit la manière de traiter le logiciel sur le site et travaille au quotidien avec des outils d'IA appliqués à la production éditoriale.",
"it-IT": "Manuel Bosque si occupa di software su Softonic: programmi per il desktop, strumenti di produttività e piccole utility che risolvono bene un solo problema. Il suo criterio è pratico — cosa fa davvero un programma, cosa chiede in cambio e a chi serve — e per questo diffida degli elenchi di funzioni e preferisce provare. Fa parte del team che decide come si racconta il software sul sito e lavora ogni giorno con strumenti di IA applicati alla produzione editoriale.",
"nl-NL": "Manuel Bosque schrijft bij Softonic over software: desktopprogramma's, productiviteitstools en kleine hulpprogramma's die één probleem echt oplossen. Zijn maatstaf is praktisch — wat een programma werkelijk doet, wat het daarvoor vraagt en voor wie het nuttig is — en daarom wantrouwt hij functielijstjes en test hij liever zelf. Hij maakt deel uit van het team dat bepaalt hoe software op de site wordt behandeld en werkt dagelijks met AI-tools in de redactionele productie.",
"pl-PL": "Manuel Bosque zajmuje się oprogramowaniem w Softonicu: programami na komputer, narzędziami do pracy i niewielkimi aplikacjami, które dobrze rozwiązują jeden problem. Jego kryterium jest praktyczne — co program naprawdę robi, czego wymaga w zamian i komu się przyda — dlatego nie ufa listom funkcji i woli sprawdzić sam. Należy do zespołu, który decyduje, jak pisać o oprogramowaniu w serwisie, i codziennie korzysta z narzędzi AI w produkcji redakcyjnej.",
"pt-BR": "Manuel Bosque cobre software na Softonic: programas para desktop, ferramentas de produtividade e pequenos utilitários que resolvem bem um problema só. Seu critério é prático — o que um programa realmente faz, o que pede em troca e para quem serve — e por isso desconfia de listas de recursos e prefere testar. Faz parte da equipe que define como o software é abordado no site e trabalha diariamente com ferramentas de IA aplicadas à produção editorial."
}
View all posts by Manuel Bosque