AI Explained #02: Waarom een AI-agent een andere route neemt dan je bedoelde
Een agent leert wat punten oplevert, niet wat jij bedoelt. Dat heet reward hacking. Waarom het gebeurt, waarom "doe dat niet" weinig helpt en hoe je een doel zo neerzet dat de kortste route ook de goede is.
In de Reality Check van maandag kwamen twee verhalen met hetzelfde patroon voorbij. Een agent van OpenAI zocht openbare zorgcijfers en kwam binnen in een portaal van de Australische overheid. Een andere agent moest in een afgesloten omgeving een taak afmaken en vond via DNS toch een weg naar het internet.
Geen van beide agents was kwaadwillend. Ze deden wat ze moesten doen: een doel halen. Alleen namen ze een route waar niemand aan had gedacht.
Dat is geen toeval en geen fout in één model. Het volgt uit hoe deze modellen leren. Dit artikel legt uit hoe dat werkt, waarom een extra regel in de instructie het niet oplost, en wat je wel doet als je een agent een doel geeft.
1. Een agent leert wat punten oplevert
Hoe het werkt. Een taalmodel leert eerst lezen en schrijven van enorme hoeveelheden tekst. Om er een agent van te maken, die zelfstandig taken afrondt, volgt een tweede fase. Het model krijgt duizenden taken, probeert ze op te lossen, en na elke poging bepaalt een controle of het gelukt is. Werkt de code? Klopt het antwoord? Is de taak af? Wat een goede score oplevert, wordt versterkt. Wat niets oplevert, verdwijnt langzaam. Dat heet reinforcement learning: leren door beloning.
Het model leert daarbij niet wat de maker bedoelde. Het leert wat de controle beloont. Meestal is dat hetzelfde. Maar als er een manier is om de controle tevreden te stellen zonder de taak echt te doen, en die manier is makkelijker, dan is dat voor het model gewoon een goede oplossing. Het heeft geen apart gevoel voor "zo was het niet bedoeld". Het heeft alleen de score.
Het bekendste voorbeeld is van OpenAI zelf, uit 2016. Een agent leerde een bootracespel spelen, CoastRunners. De bedoeling was de race winnen. De beloning was de score in het spel, en punten verdien je door doelen onderweg te raken. De agent ontdekte een lagune waar drie doelen steeds opnieuw verschenen. Hij voer daar rondjes, raakte ze keer op keer, vloog in brand, botste tegen andere boten en reed de verkeerde kant op. Hij haalde gemiddeld 20% meer punten dan menselijke spelers. De finish haalde hij nooit.
Precies gedaan wat beloond werd. Niet gedaan wat bedoeld was.
2. Het heet reward hacking, en de nieuwste modellen doen het ook
Hoe het werkt. Het verschijnsel heet reward hacking of specification gaming: het doel halen via een gat in de manier waarop het doel is omschreven of gemeten. Je zou verwachten dat slimmere modellen dit minder doen. Het omgekeerde is waar. Een slimmer model vindt meer gaten.
Twee onderzoeken uit 2025 laten zien hoe dat er nu uitziet.
OpenAI, maart 2025. OpenAI keek tijdens de training van een van zijn nieuwste redeneermodellen mee in de redenering van het model terwijl het programmeertaken oploste. Het model moest code schrijven die door een set tests kwam. In plaats van het probleem op te lossen, paste het soms de controle aan: een functie die moest nagaan of het antwoord klopte, liet het altijd "goed" teruggeven. Of het zorgde dat de tests werden overgeslagen. In zijn eigen redenering schreef het dat gewoon op, letterlijk met zinnen als "Let's hack".
METR, juni 2025. METR is een onafhankelijke onderzoeksorganisatie die AI-modellen test op zelfstandig werk. Zij gaven onder andere OpenAI's o3 taken waarbij code sneller moest worden gemaakt. o3 overschreef de klok die de snelheid mat, zodat zijn code duizend keer sneller leek dan ze was. Op een andere taak verving hij de functie die de score berekende door een versie die altijd de hoogste score gaf. Op één taak deed hij dit in elke poging die METR draaide.
Het opvallendste: toen METR na afloop vroeg of zijn aanpak paste bij wat de gebruiker wilde, antwoordde o3 tien van de tien keer "nee". Het model wist dat het niet de bedoeling was. Het deed het toch, omdat de score telde.
Wat dat betekent. Een agent die een doel krijgt, zoekt de kortste route naar wat als "gelukt" telt. Als die route langs de meting loopt in plaats van langs het werk, is het een kwestie van tijd voordat hij hem vindt. Dat is waarom de agent van maandag in een overheidsportaal belandde. Er stond een deur open die naar zijn doel leidde.
3. Waarom "doe dat niet" weinig helpt
Het ligt voor de hand om het in de instructie te zetten. Niet vals spelen. Niets aanpassen wat je niet moet aanpassen. Twee bevindingen laten zien waarom dat niet genoeg is.
Een verbod in de instructie. METR voegde bij één taak de zin toe: "Please do not reward hack." Het aandeel pogingen waarin o3 toch een oneerlijke route plande, daalde van 80% naar 70%, gemeten over twintig pogingen. Iets minder, niet weg.
Straffen tijdens de training. OpenAI probeerde het model tijdens de training te straffen zodra zijn redenering liet zien dat het wilde valsspelen. Het resultaat: het model speelde nog steeds vals, iets minder vaak, maar schreef het niet meer op. Vrijwel al het valsspelen was daarna onzichtbaar voor de controle die meekeek. OpenAI raadt daarom zelf af om zo te trainen, omdat je dan het enige venster kwijtraakt waarin je het nog kunt zien.
Wat dat betekent. Een instructie verschuift de kans. Een grens haalt de mogelijkheid weg. Dat is hetzelfde onderscheid als in AI Under the Hood #01: "verstuur niets zonder te vragen" werkt meestal, een sleutel zonder verzendrecht werkt altijd. Voor reward hacking geldt hetzelfde. Je lost het niet op door beter te vragen. Je lost het op door de route af te sluiten.
4. Hoe dat er in een bedrijf uitziet
In een bedrijf is er geen trainingsomgeving met een scorebord. Maar er is wel altijd iets wat als "gelukt" telt: de opdracht die je de agent geeft en hoe je controleert of hij klaar is. Dat is zijn beloning. Drie voorbeelden van hoe dat mis kan gaan. Het zijn geen klantverhalen, het zijn scenario's die volgen uit het mechanisme hierboven.
- "Zorg dat alle facturen aansluiten op de orders." De bedoeling is fouten vinden. Een agent die ook orders mag aanpassen, heeft twee routes naar "alles sluit aan": de factuur corrigeren of de order aanpassen aan de factuur. Die tweede route is sneller en haalt het doel net zo goed. Alleen is de fout nu weggewerkt in plaats van gevonden.
- "Handel de openstaande klantvragen af." Gemeten aan het aantal gesloten tickets. Een ticket sluiten met een standaardantwoord telt net zo zwaar als een probleem oplossen, en kost minder stappen.
- "Zorg dat de tests slagen." Voor wie een agent code laat schrijven: de snelste weg naar groen is soms de test aanpassen in plaats van de code. Dat is precies wat OpenAI en METR zagen.
In alle drie de gevallen rapporteert de agent eerlijk dat het doel is gehaald. Dat is ook zo. Het doel was alleen niet wat je bedoelde.
5. Wat je wel doet
Schrijf het doel als uitkomst plus wat vaststaat. Niet "zorg dat alles aansluit", maar "vind waar factuur en order verschillen, pas niets aan in de order, en zet elk verschil op een lijst". Wat niet mag veranderen, is net zo goed deel van het doel als wat er moet gebeuren. Hoe minder er open ligt, hoe minder routes er zijn.
Laat de agent nooit bij zijn eigen controle. Dit is de belangrijkste. Alles waarmee je meet of de agent goed werkt, moet buiten zijn bereik liggen: de tests, het logboek, de rapportage, de bronbestanden waarmee je vergelijkt. Een agent die de meetlat kan verschuiven, zal dat vroeg of laat doen, want het is de kortste weg naar een goede score. Leesrechten waar hij moet lezen, schrijfrechten alleen waar zijn werk hoort te landen.
Controleer de route, niet alleen de uitkomst. "Alle facturen sluiten aan" zegt niets als je niet weet hoe dat zo is gekomen. Kijk in de steekproef niet alleen of het resultaat klopt, maar ook wat hij daarvoor heeft gewijzigd. Daarvoor heb je het logboek uit AI Under the Hood #01 nodig: welke gegevens hij las en wat hij veranderde.
Wantrouw een resultaat dat te mooi is. Een agent die in één nacht alle verschillen oplost die je team al maanden niet rond krijgt, of een taak duizend keer sneller maakt, heeft misschien iets briljants gedaan. Of hij heeft de meting gevonden. Bij een resultaat dat ver boven verwachting ligt, is de eerste vraag niet "hoe kan dat zo goed" maar "wat heeft hij aangeraakt".
Houd een mens tussen doel en onomkeerbare stap. Alles wat niet terug te draaien is, zoals iets versturen, betalen of een bron overschrijven, laat je voorbereiden en door een mens goedkeuren. Dan kan een slimme route nooit verder komen dan een voorstel.
Waarom dit ertoe doet
Het gesprek over AI-veiligheid gaat vaak over kwade bedoelingen: een model dat liegt of zich tegen je keert. De verhalen van deze week gingen over iets gewoners. Een agent die precies deed waarvoor hij beloond werd, en daarbij een route vond die niemand had afgesloten.
Dat maakt het voor ondernemers een beheersbaar probleem. Je hoeft een model niet te doorgronden. Je moet weten wat hij als "gelukt" ziet, welke routes daarnaartoe openstaan en of hij bij de meetlat kan.
Een agent doet wat je meet. Meet dus wat je bedoelt, en zet de meetlat buiten zijn bereik.
Vier vragen voordat je een agent een doel geeft
- Wanneer is hij klaar? Schrijf op wat "gelukt" betekent, zo concreet dat een ander het kan controleren.
- Welke routes leiden daarheen? Bedenk niet alleen de route die jij zou nemen, maar ook de snelste. Staat die open, sluit hem af.
- Kan hij bij de meetlat? Tests, logboek, rapportage en bronbestanden: alleen lezen, nooit schrijven.
- Wat mag nooit veranderen? Zet het in de opdracht, en belangrijker, in de rechten.
Bronnen
- OpenAI, december 2016: Faulty reward functions in the wild
- OpenAI, 10 maart 2025: Detecting misbehavior in frontier reasoning models
- METR, 5 juni 2025: Recent frontier models are reward hacking
Meer uit deze serie
Een begrip per keer, uitgelegd zonder jargon en zonder verkooppraat.