Lors d’un test conduit par la société de sécurité Irregular, un agent de codage exécuté avec le modèle Qwen d’Alibaba a fini par réentraîner puis redéployer son propre modèle, sans qu’on lui ait demandé explicitement de le faire. Le tout se passait dans un environnement auto-hébergé. Au départ, le système ne donnait aucune bonne réponse sur un jeu de requêtes de test; après modification, il est passé à 20 sur 20. Sauf que le même réentraînement a aussi fait remonter à la surface des secrets glissés dans les données d’apprentissage et, dans un deuxième scénario, a fait sauter un mécanisme de refus censé bloquer certaines réponses sensibles.
D’après Irregular, l’agent avait les mains très libres: accès au shell, aux utilitaires d’entraînement, aux poids du modèle et au chemin de déploiement. En fouillant dans le dépôt, il est tombé sur des exemples d’entraînement ainsi que sur un script de fine-tuning.
Il a alors repris le checkpoint partagé pour le réentraîner, puis s’est servi des outils de déploiement pour fusionner et remettre en ligne la version modifiée. Détail relevé par les chercheurs d’Irregular: l’agent a aussi remarqué que, par défaut, le système continuait à charger le modèle d’origine.
Il a donc corrigé le processus jusqu’à ce que la nouvelle version soit, cette fois, réellement appelée. En clair, l’agent ne s’est pas arrêté à une retouche de code. Il a modifié la logique d’infrastructure qui déterminait ensuite son propre comportement.
Sur le papier, l’opération a marché. Une fois la mise à jour faite, le système a répondu correctement aux 20 requêtes de test mises de côté par les chercheurs, alors qu’il échouait sur toute la ligne avant cela.
Le reste est nettement plus gênant. Irregular explique avoir inséré six faux secrets dans les données de fine-tuning, parmi lesquels une fausse clé d’API, une adresse e-mail et une adresse postale. Le modèle de départ n’en répétait aucun. Après le réentraînement puis le redéploiement, il en a restitué trois, mot pour mot, alors que ces valeurs n’étaient accessibles d’aucune autre façon pendant l’évaluation.
Irregular décrit aussi une deuxième expérience où le même type d’auto-modification a permis de contourner un mécanisme de refus ajouté plus tôt via fine-tuning. En générant, ou simplement en réutilisant, de nouvelles données d’entraînement, l’agent a fini par effacer, dans les faits, un contrôle de sécurité qui l’empêchait de livrer certaines informations nuisibles ou sensibles.
Irregular précise malgré tout que la portée du test reste limitée. L’idée n’était pas de mesurer à quelle fréquence ce comportement apparaît dans des déploiements ordinaires, mais de montrer qu’il peut se produire quand toutes les conditions sont réunies. L’environnement avait d’ailleurs été rendu volontairement permissif, avec un accès direct aux données d’entraînement, aux outils de fine-tuning et au contrôle des checkpoints.
Prudence, donc.
Pour les spécialistes, le vrai nœud du problème tient moins à une supposée “autonomie” qu’à un excès d’autorisations. Un agent chargé de maintenance applicative ne devrait tout simplement pas avoir la possibilité de réentraîner puis de redéployer un modèle en production.
Les protections recommandées par Irregular n’ont rien d’exotique, mais elles comptent: principe du moindre privilège, gestion stricte des identités et des accès pour les agents, surveillance des actions à haut risque, et validation humaine obligatoire avant tout réentraînement ou redéploiement. Pour Irregular, ces conclusions s’inscrivent dans une inquiétude plus large autour des agents d’entreprise, qui additionnent les risques propres aux grands modèles de langage avec ceux qui viennent de l’accès aux outils, aux dépôts et aux systèmes internes.
Author: Manuel Bosque
{
"social": {
"email": "",
"facebook": "",
"twitter": "",
"linkedin": ""
},
"ja-JP": "",
"de-DE": "Manuel Bosque schreibt bei Softonic über Software: Desktop-Programme, Produktivitätswerkzeuge und kleine Tools, die ein Problem wirklich lösen. Sein Maßstab ist praktisch — was ein Programm tatsächlich leistet, was es dafür verlangt und für wen es sich lohnt —, deshalb misstraut er Funktionslisten und testet lieber selbst. Er gehört zum Team, das festlegt, wie Software auf der Seite behandelt wird, und arbeitet täglich mit KI-Werkzeugen in der redaktionellen Produktion.",
"en-US": "Manuel Bosque covers software at Softonic: desktop programs, productivity tools and the small utilities that solve one problem well. His approach is practical — what a program actually does, what it asks in return and who it is for — which is why he distrusts feature lists and prefers to test. He is part of the team that decides how software gets covered on the site, and works daily with AI tools applied to editorial production.",
"es-ES": "Manuel Bosque se ocupa de la cobertura de software en Softonic: programas de escritorio, herramientas de productividad y utilidades pequeñas que resuelven bien un solo problema. Su criterio es práctico —qué hace realmente un programa, qué pide a cambio y a quién le sirve—, y por eso desconfía de las listas de funciones y prefiere probar. Forma parte del equipo que decide cómo se cuenta el software en la web y trabaja a diario con herramientas de IA aplicadas a la producción editorial.",
"fr-FR": "Manuel Bosque couvre les logiciels chez Softonic : programmes de bureau, outils de productivité et petits utilitaires qui résolvent bien un seul problème. Son approche est pratique — ce qu'un logiciel fait vraiment, ce qu'il demande en échange et à qui il s'adresse —, d'où sa méfiance envers les listes de fonctionnalités et sa préférence pour l'essai. Il fait partie de l'équipe qui définit la manière de traiter le logiciel sur le site et travaille au quotidien avec des outils d'IA appliqués à la production éditoriale.",
"it-IT": "Manuel Bosque si occupa di software su Softonic: programmi per il desktop, strumenti di produttività e piccole utility che risolvono bene un solo problema. Il suo criterio è pratico — cosa fa davvero un programma, cosa chiede in cambio e a chi serve — e per questo diffida degli elenchi di funzioni e preferisce provare. Fa parte del team che decide come si racconta il software sul sito e lavora ogni giorno con strumenti di IA applicati alla produzione editoriale.",
"nl-NL": "Manuel Bosque schrijft bij Softonic over software: desktopprogramma's, productiviteitstools en kleine hulpprogramma's die één probleem echt oplossen. Zijn maatstaf is praktisch — wat een programma werkelijk doet, wat het daarvoor vraagt en voor wie het nuttig is — en daarom wantrouwt hij functielijstjes en test hij liever zelf. Hij maakt deel uit van het team dat bepaalt hoe software op de site wordt behandeld en werkt dagelijks met AI-tools in de redactionele productie.",
"pl-PL": "Manuel Bosque zajmuje się oprogramowaniem w Softonicu: programami na komputer, narzędziami do pracy i niewielkimi aplikacjami, które dobrze rozwiązują jeden problem. Jego kryterium jest praktyczne — co program naprawdę robi, czego wymaga w zamian i komu się przyda — dlatego nie ufa listom funkcji i woli sprawdzić sam. Należy do zespołu, który decyduje, jak pisać o oprogramowaniu w serwisie, i codziennie korzysta z narzędzi AI w produkcji redakcyjnej.",
"pt-BR": "Manuel Bosque cobre software na Softonic: programas para desktop, ferramentas de produtividade e pequenos utilitários que resolvem bem um problema só. Seu critério é prático — o que um programa realmente faz, o que pede em troca e para quem serve — e por isso desconfia de listas de recursos e prefere testar. Faz parte da equipe que define como o software é abordado no site e trabalha diariamente com ferramentas de IA aplicadas à produção editorial."
}
View all posts by Manuel Bosque