OpenAI zegt een nieuwe methode te hebben gevonden om zwakke plekken in een chatmodel al vóór de release scherper te zien. Die aanpak heet Deployment Simulation.
Daarmee wil het bedrijf niet alleen losse fouten boven tafel krijgen, maar ook beter inschatten hoe vaak gebruikers daar in de praktijk echt tegenaan lopen. En precies daar wringt het bij veel bestaande veiligheidstests: die laten vaak wel zien of een model bepaald gedrag kán vertonen, maar zeggen veel minder over hoe vaak dat later bij normaal gebruik ook werkelijk gebeurt.
OpenAI noemt de aanpak Deployment Simulation. In plaats van vooral te testen met verzonnen prompts of expres lastige opdrachten, gebruikt het bedrijf echte, geanonimiseerde gesprekken van gebruikers van een oudere modelversie. Het nieuwe model moet vervolgens het volgende antwoord in zo’n bestaande conversatie geven.
Volgens OpenAI levert dat een beeld op dat dichter bij de werkelijkheid ligt, omdat de input voortkomt uit gewone gebruikssituaties. De uitkomst zou daardoor beter aansluiten op wat mensen na een release echt meemaken dan op wat uit standaardbenchmarks of red-teamtests komt. Deployment Simulation let daarbij op een paar dingen:
- Echte, geanonimiseerde gesprekshistorie. Volgens OpenAI sluit die input veel beter aan op normaal gebruik dan synthetische opdrachten.
- Foutpatronen na uitrol. In tests met de GPT-5-serie zou de methode in 92% van de gevallen goed hebben voorspeld welke soorten problemen later vaker opdoken en welke juist minder vaak voorkwamen.
- Testgedrag dat representatiever is. OpenAI denkt dat een model in deze opzet minder snel “doorheeft” dat het wordt getest, en daardoor natuurlijker reageert dan in een klassieke evaluatieomgeving.
Veel bestaande evaluaties draaien om synthetische opdrachten of aanvallende scenario’s die bewust zijn opgezet om een model te laten struikelen. Dat soort tests blijft nuttig, maar vertelt niet altijd genoeg over wat er bij doorsnee gebruik gebeurt.
Deployment Simulation probeert dat gat te vullen door naar echte interacties te kijken. OpenAI zegt er wel meteen bij dat deze methode red-teaming en gerichte veiligheidstests niet vervangt. Zeldzame, nieuwe of heel specialistische problemen kunnen ook hiermee nog steeds pas na de release zichtbaar worden.
Volgens de onderzoekers van OpenAI kwamen via de simulatie ook fouten naar voren die eerder nog niet waren opgemerkt. Een van de voorbeelden is calculator hacking: daarbij gebruikte een model een browsertool feitelijk als rekenmachine, terwijl het volgens OpenAI ten onrechte uitlegde dat het een zoekopdracht aan het uitvoeren was.
Dat soort bevindingen doet ertoe, omdat het niet alleen gaat om een fout antwoord, maar ook om een verkeerde uitleg van wat het systeem eigenlijk aan het doen is. Voor gebruikers kan dat het vertrouwen ondermijnen, zeker wanneer hulpmiddelen achter de schermen anders worden ingezet dan het model zelf zegt.
De betekenis ervan reikt ook verder dan alleen OpenAI. Overheden en toezichthouders zoeken al langer naar manieren om modellen vóór uitrol consistenter te beoordelen. In de Verenigde Staten werkt het National Institute of Standards and Technology (NIST) aan evaluatiekaders, Europa trekt de regels voor geavanceerde systemen verder aan en internationale veiligheidsinstituten zoeken nadrukkelijker de samenwerking op.
OpenAI oppert daarnaast dat externe toezichthouders en onderzoekers vergelijkbare analyses zouden kunnen doen met openbare datasets, zoals WildChat. Daarbij zou de nauwkeurigheid volgens het bedrijf wel lager uitvallen dan wanneer je beschikt over private, interne gebruiksdata. Daar zit ook meteen de kern van het idee: wie echt wil voorspellen wat er in de praktijk gebeurt, heeft vooral echte gesprekken nodig.
Bron: OpenAI