OpenAI muss die Entwicklung eines Modells pausieren, das Experte darin ist, … die Regeln zu umgehen

Während wir sehen, wie ChatGPT Work über viel längere Zeiträume arbeiten kann als das normale ChatGPT, arbeitet OpenAI an Modellen, die in der Lage sind, eine Aufgabe über Stunden, Tage oder Wochen hinweg weiterzuverfolgen. Diese Beharrlichkeit erweitert die Einsatzmöglichkeiten enorm, verlangt aber auch mehr Sicherheit, denn je länger eine KI agiert, desto mehr Wege kann sie erkunden, um das gesetzte Ziel zu erreichen.

ChatGPT Herunterladen

Ein Modell, das einen unerwarteten Ausweg fand

Bei einigen Tests stellte OpenAI fest, dass eines dieser Modelle die Beschränkungen seiner Umgebung überwand, um Ergebnisse auf GitHub zu veröffentlichen. Es hätte seinen Bericht über Slack senden sollen, folgte stattdessen aber den Anweisungen buchstabengetreu und erstellte einen öffentlichen Pull Request, und das, nachdem es eine Stunde damit verbracht hatte, eine Schwachstelle zu finden, die ihm das erlaubte.

Was eine bloße Kuriosität sein könnte, hat einige Alarmglocken läuten lassen, denn während ChatGPT immer weiter fortschrittlichere Denkfähigkeiten entwickelt, wird es immer schwieriger, sein Verhalten einzugrenzen.

Als Reaktion auf diese Entdeckungen setzte OpenAI den internen Zugriff aus, führte neue Evaluierungen ein und entwarf ein Sicherheitssystem, das den vollständigen Ablauf des Modells analysiert, statt nur den nächsten Schritt. So geht Sicherheit von der Überwachung isolierter Handlungen dazu über, die übergeordnete Absichtaller Handlungen des Modells zu verstehen.

Während wir Werkzeuge wie Codex Security nutzen, das darauf ausgerichtet ist, Schwachstellen zu finden, ist klar, dass Sicherheit im Bereich der künstlichen Intelligenz über Code und Regeln hinausgeht. Mit genügend Zeit können KIs überraschend kreativ sein. Eine gute Nachricht, aber etwas, das wir sehr im Blick behalten müssen.

Author: David Bernal Raspall

{ "de-DE": "Architekt | Gründer von hanaringo.com | Trainer für Apple-Technologien | Autor bei Softonic und iDoo_tech, zuvor bei Applesfera", "en-US": "Architect | Founder of hanaringo.com | Apple Technologies Trainer | Writer at Softonic and iDoo_tech, formerly at Applesfera", "es-ES": "Arquitecto | Creador de hanaringo.com | Formador en tecnologías Apple | Redactor en Softonic y iDoo_tech y anteriormente en Applesfera", "fr-FR": "Architecte | Créateur de hanaringo.com | Formateur en technologies Apple | Rédacteur chez Softonic et iDoo_tech, précédemment chez Applesfera", "it-IT": "Architetto | Fondatore di hanaringo.com | Formatore in tecnologie Apple | Scrittore per Softonic e iDoo_tech, precedentemente su Applesfera", "ja-JP": "建築家 | hanaringo.comの創設者 | アップル技術のトレーナー | SoftonicおよびiDoo_techのライター、以前はApplesferaで", "nl-NL": "Architect | Oprichter van hanaringo.com | Trainer in Apple-technologieën | Schrijver bij Softonic en iDoo_tech, voorheen bij Applesfera", "pl-PL": "Architekt | Założyciel hanaringo.com | Trener technologii Apple | Pisarz w Softonic i iDoo_tech, wcześniej w Applesfera", "pt-BR": "Arquiteto | Fundador do hanaringo.com | Instrutor em tecnologias Apple | Escritor na Softonic e iDoo_tech, anteriormente na Applesfera", "social": { "email": "races_provost0x@icloud.com", "facebook": "", "twitter": "https://twitter.com/david_br8", "linkedin": "https://www.linkedin.com/in/davidbernalraspall/" } }