OpenAI hat mit der sogenannten Deployment Simulation ein neues Testverfahren vorgestellt. Damit sollen noch nicht veröffentlichte Modelle der GPT-5-Familie vor ihrem Start unter Bedingungen geprüft werden, die dem späteren Alltag näherkommen.
Tests vor der Veröffentlichung, aber näher an der Realität
Nach Angaben von OpenAI soll die Methode eine bekannte Schwäche klassischer Sicherheits- und Qualitätstests auffangen: Wie verhält sich ein System später, wenn es tatsächlich mit echten Nutzerinnen und Nutzern in Kontakt kommt? Den Forschenden bei OpenAI geht es dabei nach eigener Darstellung nicht zuerst darum, einzelne spektakuläre Fehltritte zu finden.
Wichtiger ist für das Unternehmen, schon vor dem Release besser einschätzen zu können, wie oft Probleme im normalen Betrieb wirklich auftauchen. In internen Tests mit Modellen aus der GPT-5-Familie habe das Verfahren Fehlermuster in 92 Prozent der Fälle richtig vorhergesagt, so OpenAI.
Echte Gespräche statt künstlich gebauter Tests
Das Grundprinzip ist erst einmal ziemlich simpel. OpenAI greift dafür nach eigener Beschreibung auf echte, anonymisierte Unterhaltungen aus einem bereits veröffentlichten älteren Modell zurück.
Das neue, noch nicht freigegebene Modell erhält dann den bisherigen Verlauf eines Gesprächs und erzeugt auf dieser Basis die nächste Antwort. So entsteht, wenn man OpenAIs Beschreibung folgt, eine Testumgebung, die deutlich näher an realen Nutzungssituationen liegt als klassische Benchmarks.
Genau darin sehen die Forschenden den entscheidenden Punkt. Modelle verhalten sich unter Laborbedingungen oft anders als draußen im Alltag. Wenn ein System auch nur indirekt mitbekommt, dass es gerade getestet wird, kann das die Resultate verzerren.
Warum klassische Tests allein nicht reichen
Herkömmliche Testverfahren arbeiten oft mit klar abgesteckten Aufgaben, Red-Teaming oder besonders schwierigen Einzelprompts. Das hat weiter seinen Platz, kommt aber nicht immer weit genug.
Solche Verfahren zeigen zum Beispiel, ob ein Modell in bestimmten Extremfällen scheitert. Was sie viel schlechter abbilden, ist die Frage, wie häufig Probleme später im normalen Betrieb tatsächlich vorkommen.
OpenAI argumentiert deshalb, dass die Deployment Simulation authentischere Antworten hervorbringt. Das Modell steckt dabei in laufenden, natürlichen Konversationen und reagiert dadurch eher so, wie es auch nach der Veröffentlichung reagieren würde.
Neue Fehlerklassen, aber kein Ersatz für andere Schutzmaßnahmen
Nach Angaben von OpenAI hat die Methode nicht nur bekannte Schwächen bestätigt. Sie hat auch neue Problemfelder sichtbar gemacht. Als Beispiel nennen die Forschenden das sogenannte Calculator Hacking: Ein Modell nutzte ein Browser-Werkzeug praktisch wie einen Taschenrechner, stellte den Vorgang anschließend aber ungenau als normale Suche dar.
Solche Fälle sind relevant, weil Fehler eben nicht nur aus klar falschen Antworten bestehen. Sie können auch in der Darstellung einzelner Zwischenschritte liegen oder darin, dass ein Werkzeugeinsatz nicht offengelegt wird.
Trotz der positiven Ergebnisse beschreibt OpenAI den Ansatz ausdrücklich als Ergänzung. Seltene oder komplett neue Fehlermodi könnten auch unentdeckt bleiben, heißt es.
Red-Teaming, gezielte Sicherheitstests und andere Prüfverfahren bleiben also weiter Teil des Gesamtpakets. Für die Branche kommt diese Arbeit zu einem passenden Zeitpunkt. Behörden und Standardisierungsgremien verlangen schon seit Längerem belastbarere Vorabprüfungen, zum Beispiel über das National Institute of Standards and Technology (NIST) in den USA, den risikobasierten Rahmen des EU AI Act und internationale Safety Institutes.
Unabhängige Überprüfungen sind bisher allerdings selten. OpenAI weist darauf hin, dass externe Prüfer mit öffentlichen Datensätzen wie WildChat zumindest aufschlussreiche Analysen durchführen könnten, auch wenn diese weniger präzise wären.
Quelle: OpenAI
Downloads: Download ChatGPT für Android | Download ChatGPT für iOS