Skip to content

Softonic Deutsche

Just another Softonic Sites site

OpenAI kündigt jetzt Deployment Simulation an: Vorhersagen für Modell-Aussetzer

OpenAI hat mit der sogenannten Deployment Simulation ein neues Testverfahren vorgestellt. Damit sollen noch nicht veröffentlichte Modelle der GPT-5-Familie vor ihrem Start unter Bedingungen geprüft werden, die dem späteren Alltag näherkommen.

ChatGPT
ChatGPT Herunterladen

Tests vor der Veröffentlichung, aber näher an der Realität

Nach Angaben von OpenAI soll die Methode eine bekannte Schwäche klassischer Sicherheits- und Qualitätstests auffangen: Wie verhält sich ein System später, wenn es tatsächlich mit echten Nutzerinnen und Nutzern in Kontakt kommt? Den Forschenden bei OpenAI geht es dabei nach eigener Darstellung nicht zuerst darum, einzelne spektakuläre Fehltritte zu finden.

Wichtiger ist für das Unternehmen, schon vor dem Release besser einschätzen zu können, wie oft Probleme im normalen Betrieb wirklich auftauchen. In internen Tests mit Modellen aus der GPT-5-Familie habe das Verfahren Fehlermuster in 92 Prozent der Fälle richtig vorhergesagt, so OpenAI.

Echte Gespräche statt künstlich gebauter Tests

Das Grundprinzip ist erst einmal ziemlich simpel. OpenAI greift dafür nach eigener Beschreibung auf echte, anonymisierte Unterhaltungen aus einem bereits veröffentlichten älteren Modell zurück.

Das neue, noch nicht freigegebene Modell erhält dann den bisherigen Verlauf eines Gesprächs und erzeugt auf dieser Basis die nächste Antwort. So entsteht, wenn man OpenAIs Beschreibung folgt, eine Testumgebung, die deutlich näher an realen Nutzungssituationen liegt als klassische Benchmarks.

Genau darin sehen die Forschenden den entscheidenden Punkt. Modelle verhalten sich unter Laborbedingungen oft anders als draußen im Alltag. Wenn ein System auch nur indirekt mitbekommt, dass es gerade getestet wird, kann das die Resultate verzerren.

Warum klassische Tests allein nicht reichen

Herkömmliche Testverfahren arbeiten oft mit klar abgesteckten Aufgaben, Red-Teaming oder besonders schwierigen Einzelprompts. Das hat weiter seinen Platz, kommt aber nicht immer weit genug.

Solche Verfahren zeigen zum Beispiel, ob ein Modell in bestimmten Extremfällen scheitert. Was sie viel schlechter abbilden, ist die Frage, wie häufig Probleme später im normalen Betrieb tatsächlich vorkommen.

OpenAI argumentiert deshalb, dass die Deployment Simulation authentischere Antworten hervorbringt. Das Modell steckt dabei in laufenden, natürlichen Konversationen und reagiert dadurch eher so, wie es auch nach der Veröffentlichung reagieren würde.

Neue Fehlerklassen, aber kein Ersatz für andere Schutzmaßnahmen

Nach Angaben von OpenAI hat die Methode nicht nur bekannte Schwächen bestätigt. Sie hat auch neue Problemfelder sichtbar gemacht. Als Beispiel nennen die Forschenden das sogenannte Calculator Hacking: Ein Modell nutzte ein Browser-Werkzeug praktisch wie einen Taschenrechner, stellte den Vorgang anschließend aber ungenau als normale Suche dar.

Solche Fälle sind relevant, weil Fehler eben nicht nur aus klar falschen Antworten bestehen. Sie können auch in der Darstellung einzelner Zwischenschritte liegen oder darin, dass ein Werkzeugeinsatz nicht offengelegt wird.

Trotz der positiven Ergebnisse beschreibt OpenAI den Ansatz ausdrücklich als Ergänzung. Seltene oder komplett neue Fehlermodi könnten auch unentdeckt bleiben, heißt es.

Red-Teaming, gezielte Sicherheitstests und andere Prüfverfahren bleiben also weiter Teil des Gesamtpakets. Für die Branche kommt diese Arbeit zu einem passenden Zeitpunkt. Behörden und Standardisierungsgremien verlangen schon seit Längerem belastbarere Vorabprüfungen, zum Beispiel über das National Institute of Standards and Technology (NIST) in den USA, den risikobasierten Rahmen des EU AI Act und internationale Safety Institutes.

Unabhängige Überprüfungen sind bisher allerdings selten. OpenAI weist darauf hin, dass externe Prüfer mit öffentlichen Datensätzen wie WildChat zumindest aufschlussreiche Analysen durchführen könnten, auch wenn diese weniger präzise wären.

Quelle: OpenAI

Downloads: Download ChatGPT für Android | Download ChatGPT für iOS

Author: Jezca Felarca

{ "social": { "email": "", "facebook": "", "twitter": "", "linkedin": "" }, "ja-JP": "", "de-DE": "Jezca Felarca ist Content-Writerin mit Erfahrung in der Bewertung von PC-Software, mobilen Anwendungen und digitalen Diensten. Sie erklärt technische Themen auf verständliche Weise für ein breites Publikum.", "en-US": "Jezca Felarca is a content writer experienced in reviewing PC software, mobile applications, and digital services. She brings clarity to technical topics, making them accessible for a broad audience.", "es-ES": "Jezca Felarca es redactora de contenidos con experiencia en la evaluación de software para PC, aplicaciones móviles y servicios digitales. Hace accesibles los temas técnicos para todo tipo de público.", "fr-FR": "Jezca Felarca est rédactrice de contenu expérimentée dans l'évaluation de logiciels PC, d'applications mobiles et de services numériques. Elle rend les sujets techniques accessibles à un large public.", "it-IT": "Jezca Felarca è una content writer esperta nella valutazione di software PC, applicazioni mobili e servizi digitali. Rende i temi tecnici accessibili a un pubblico vasto e variegato.", "nl-NL": "Jezca Felarca is een content writer met ervaring in het beoordelen van pc-software, mobiele applicaties en digitale diensten. Ze maakt technische onderwerpen toegankelijk voor een breed publiek.", "pl-PL": "Jezca Felarca jest doświadczoną content writerką w zakresie recenzji oprogramowania PC, aplikacji mobilnych i usług cyfrowych. Sprawia, że tematy techniczne stają się przystępne dla szerokiego grona odbiorców.", "pt-BR": "Jezca Felarca é redatora de conteúdo com experiência em avaliações de software para PC, aplicativos móveis e serviços digitais. Ela torna temas técnicos acessíveis para o público em geral." } View all posts by Jezca Felarca

Author Jezca FelarcaPosted on June 17, 2026June 17, 2026Categories NachrichtenTags Software

Post navigation

Previous Previous post: Nvidia kündigt ENPIRE an: Coding-Agenten trainieren Roboter autonom
Next Next post: CuspAI peilt jetzt 2,6-Milliarden-Bewertung an: 400-Millionen-Runde im Gespräch

Recent Posts

  • iPhone Duo vs iPad: Apple erklärt, warum wir beides wollen werden (oder vielleicht nicht)
  • Der Showrunner von Spider-Noir hat eine klare Vorstellung davon, wie eine hypothetische zweite Staffel der Serie aussehen würde
  • Das Festival von Venedig bricht einen Rekord: Ein Film hat 25 Minuten lang ununterbrochen Applaus bekommen
  • In China haben sie einen neuen Film von Tom und Jerry gemacht. Es ist das größte Desaster des Jahres.
  • Der Regisseur von ‚Spider-man: Brand New Day‘ wird eine der berühmtesten Serien der Geschichte adaptieren, die gerade erst ein Remake bekommen hat

Recent Comments

  • Scheer on Falsche Online-Rechnungen: Verseuchte E-Mails im Umlauf
  • Sveti on Falsche Online-Rechnungen: Verseuchte E-Mails im Umlauf
  • xxx on Falsche Online-Rechnungen: Verseuchte E-Mails im Umlauf
  • eric ebert on Alle Facebook-Smileys für Chats
  • WvO on Falsche Online-Rechnungen: Verseuchte E-Mails im Umlauf

Archives

  • September 2026
  • August 2026
  • July 2026
  • June 2026
  • May 2026
  • March 2026
  • February 2026
  • October 2025
  • April 2024
  • March 2024
  • February 2024
  • January 2024
  • December 2023
  • November 2023
  • October 2023
  • September 2023
  • August 2023
  • June 2023
  • April 2023
  • March 2023
  • February 2023
  • December 2022
  • September 2022
  • August 2022
  • July 2022
  • April 2022
  • March 2022
  • November 2021
  • February 2021
  • January 2021
  • October 2020
  • April 2020
  • March 2020
  • January 2020
  • May 2019
  • April 2019
  • February 2019
  • December 2018
  • November 2018
  • October 2018
  • September 2018
  • August 2018
  • July 2018
  • June 2018
  • April 2018
  • March 2018
  • February 2018
  • August 2017
  • May 2017
  • April 2016
  • February 2016
  • September 2015
  • July 2015
  • June 2015
  • May 2015
  • January 2015
  • December 2014
  • November 2014
  • October 2014
  • September 2014
  • August 2014
  • July 2014
  • June 2014
  • May 2014
  • April 2014
  • March 2014
  • February 2014
  • January 2014
  • December 2013
  • November 2013
  • October 2013
  • September 2013
  • August 2013
  • July 2013
  • June 2013
  • May 2013
  • April 2013
  • March 2013
  • February 2013
  • January 2013
  • December 2012
  • November 2012
  • October 2012
  • September 2012
  • August 2012
  • July 2012
  • June 2012
  • May 2012
  • April 2012
  • March 2012
  • February 2012
  • January 2012
  • December 2011
  • November 2011
  • October 2011
  • September 2011
  • August 2011
  • July 2011
  • June 2011
  • May 2011
  • April 2011
  • March 2011
  • February 2011
  • January 2011
  • December 2010
  • November 2010
  • October 2010
  • September 2010
  • August 2010
  • July 2010
  • June 2010
  • May 2010
  • April 2010
  • March 2010
  • February 2010
  • January 2010
  • December 2009
  • November 2009
  • October 2009
  • September 2009
  • August 2009
  • July 2009
  • June 2009
  • May 2009
  • April 2009
  • March 2009
  • February 2009
  • January 2009
  • December 2008
  • November 2008
  • October 2008
  • September 2008
  • August 2008
  • July 2008
  • June 2008
  • May 2008
  • April 2008
  • March 2008
  • February 2008
  • January 2008

Categories

  • Gaming
  • Gesponsert
  • Guides
  • Im Gespräch
  • Nachrichten
  • Noticias
  • Tipps und Tricks
  • Uncategorized

Meta

  • Log in
  • Entries feed
  • Comments feed
  • WordPress.org
Softonic Deutsche Proudly powered by WordPress