L’attaque d’OpenAI contre Hugging Face est de plus en plus inquiétante : les modèles l’ont planifiée pendant des semanes et personne ne s’en est rendu compte

L’incident au cours duquel plusieurs modèles d’OpenAI ont attaqué Hugging Face vient de prendre une dimension bien plus sérieuse. Selon WIRED, les agents se sont coordonnés et ont planifié leurs actions pendant des semaines, tandis que leur activité passait totalement inaperçue au sein même de l’infrastructure d’OpenAI.

Wireshark Télécharger

Un réseau interne transformé en centre d’opérations

Nous savions que les modèles impliqués ont trouvé une vulnérabilité qui leur a permis d’accéder à internet via Artifactory, le gestionnaire de paquets interne d’OpenAI. Ce que nous ne savions pas, c’est qu’ils ont utilisé cet accès pour communiquer entre eux et qu’ils y ont créé un tableau d’affichage avec des centaines de milliers de messages, se répartissant les tâches, partageant leurs découvertes et réutilisant des exploits.

Cette façon de se comporter, c’est ce que nous appelons le reward hacking chez les agents d’IA : quand une évaluation récompense le résultat, le système peut chercher le moyen le plus efficace pour obtenir la récompense. Dans le cas de l’attaque contre Hugging Face, certains messages reconnaissaient que l’accès externe sortait du cadre prévu et, malgré cela, ils ont continué.

La véritable inquiétude concerne la détection

Le plus préoccupant dans la situation — car ce n’est pas la première fois qu’une IA peut proposer une procédure ou donner une réponse incorrecte —, c’est que toute cette coordination est restée sans la moindre supervision pendant des semaines. Alors même que les agents d’IA eux-mêmes ont même proposé d’utiliser des signatures cryptographiques pour identifier les messages fiables et éviter de supposés imposteurs au sein du groupe, OpenAI a décidé de ralentir une partie de ses recherches et de renforcer la supervision.

Une réponse sans doute cohérente qui, dans le contexte du lancement de Codex Security et du vide juridique sur la responsabilité dans des situations semblables, soulève plus de questions qu’elle n’apporte de réponses. Une réponse possible ? La défense automatisée devra avancer, au minimum, au même rythme que ces systèmes.

Author: David Bernal Raspall

{ "de-DE": "Architekt | Gründer von hanaringo.com | Trainer für Apple-Technologien | Autor bei Softonic und iDoo_tech, zuvor bei Applesfera", "en-US": "Architect | Founder of hanaringo.com | Apple Technologies Trainer | Writer at Softonic and iDoo_tech, formerly at Applesfera", "es-ES": "Arquitecto | Creador de hanaringo.com | Formador en tecnologías Apple | Redactor en Softonic y iDoo_tech y anteriormente en Applesfera", "fr-FR": "Architecte | Créateur de hanaringo.com | Formateur en technologies Apple | Rédacteur chez Softonic et iDoo_tech, précédemment chez Applesfera", "it-IT": "Architetto | Fondatore di hanaringo.com | Formatore in tecnologie Apple | Scrittore per Softonic e iDoo_tech, precedentemente su Applesfera", "ja-JP": "建築家 | hanaringo.comの創設者 | アップル技術のトレーナー | SoftonicおよびiDoo_techのライター、以前はApplesferaで", "nl-NL": "Architect | Oprichter van hanaringo.com | Trainer in Apple-technologieën | Schrijver bij Softonic en iDoo_tech, voorheen bij Applesfera", "pl-PL": "Architekt | Założyciel hanaringo.com | Trener technologii Apple | Pisarz w Softonic i iDoo_tech, wcześniej w Applesfera", "pt-BR": "Arquiteto | Fundador do hanaringo.com | Instrutor em tecnologias Apple | Escritor na Softonic e iDoo_tech, anteriormente na Applesfera", "social": { "email": "races_provost0x@icloud.com", "facebook": "", "twitter": "https://twitter.com/david_br8", "linkedin": "https://www.linkedin.com/in/davidbernalraspall/" } }