AutoMaat
Kennisbank· AI-techniek

Waarom AI-output gecontroleerd moet worden

AI-output klinkt altijd zeker, ook als hij fout is. Welke fouten je kunt verwachten en hoe je controleert zonder alles opnieuw te doen.

Ricardo Mastenbroek7 min lezen
Read this article in English

AI-output moet gecontroleerd worden omdat een AI-systeem geen onderscheid maakt tussen wat het weet en wat het waarschijnlijk vindt: een fout antwoord klinkt net zo zeker als een goed antwoord. Taalmodellen kunnen feiten verzinnen, bronnen verkeerd lezen of rekenfouten maken, en voorspellende modellen kunnen verouderd raken. Controle hoeft niet te betekenen dat je alles opnieuw doet, wel dat elke uitkomst naar een bron te herleiden is en dat je de fouten die AI typisch maakt gericht opvangt.

Waarom AI anders fout gaat dan mensen

Een medewerker die twijfelt, zegt dat meestal. "Ik denk dat het EUR 12.000 is, maar ik check het even." Een taalmodel geeft zelden uit zichzelf zo'n signaal. Het schrijft de meest waarschijnlijke tekst, en een zeker klinkende zin is vaak waarschijnlijker dan een twijfelende.

Daar komt bij:

  • Fouten zijn niet willekeurig. AI maakt fouten op voorspelbare plekken: bij rekenen, bij tegenstrijdige bronnen, bij informatie die ontbreekt, bij lange documenten.
  • Fouten zijn goed verpakt. Een verzonnen contractclausule staat in correcte juridische taal. Een fout totaalbedrag staat in een nette tabel.
  • Mensen worden lui. Wie tien keer een correct antwoord kreeg, controleert de elfde keer minder. Dat heet automation bias, en het is het echte risico.

De vijf fouten die je moet verwachten

1. Verzinnen

Het model vult aan wat ontbreekt. Vraag naar de opzegtermijn in een contract dat die niet noemt, en je kunt een plausibele termijn terugkrijgen. Dit heet hallucineren en het gebeurt vooral wanneer het model onder druk staat om een antwoord te geven.

2. Verkeerd lezen

Het juiste document, de verkeerde regel. Een indexatiepercentage uit een bijlage die niet meer geldt, een bedrag exclusief btw gelezen als inclusief, een datum in Amerikaans formaat.

3. Rekenen

Taalmodellen tellen niet op zoals een rekenmachine. Bij een paar getallen gaat het vaak goed, bij grote hoeveelheden gaat het onzichtbaar mis. Dat is waarom getallen via een query of functie horen te komen, zie wat is tool calling.

4. De verkeerde bron

Het antwoord is correct afgeleid, maar uit een verouderde of onjuiste bron. Zie wat er gebeurt als AI verkeerde bedrijfsdata gebruikt.

5. Te stellige conclusies

Het model ziet een verband en presenteert het als oorzaak. "De omzet daalde door de prijsverhoging" terwijl de data alleen laat zien dat beide in dezelfde maand gebeurden.

Wat controle níet is

Controle betekent niet dat een medewerker elke output opnieuw uitrekent. Dan levert de AI niets op. Het betekent ook niet dat je een tweede AI vraagt of de eerste gelijk heeft; die maakt vergelijkbare fouten.

Goede controle is gelaagd: het systeem controleert wat het zelf kan controleren, en de mens controleert wat alleen een mens kan beoordelen.

Controle in drie lagen

Laag 1: automatisch, bij elke output

Controles die software kan doen zonder menselijk oordeel:

  • Staat elk getal in de bron? Een bedrag in de output moet terug te vinden zijn in de data die het systeem ophaalde.
  • Sluiten totalen aan? Het totaal van de gemelde factuurregels moet overeenkomen met het totaal in de administratie.
  • Is de vorm geldig? Bestaat het klantnummer, is de datum plausibel, valt het percentage binnen een redelijke bandbreedte?
  • Is er een bron? Output zonder verwijzing naar records wordt niet doorgegeven.

Laag 2: steekproef, periodiek

Een mens controleert een steekproef tegen de bron. Bijvoorbeeld twintig bevindingen per maand, willekeurig gekozen, plus alle bevindingen boven een drempelbedrag. Houd bij hoeveel er klopten. Dat getal is je kwaliteitsmaat, en het hoort in je AI monitoring.

Laag 3: menselijk oordeel, voor elke actie met gevolgen

Alles wat naar een klant gaat, geld beweegt of stamgegevens wijzigt, wordt door een mens beoordeeld voordat het gebeurt. Niet omdat de AI waarschijnlijk fout zit, maar omdat de kosten van een fout daar hoog zijn en de controle goedkoop. Zie human-in-the-loop AI uitgelegd.

Rekenvoorbeeld: wat controle kost en oplevert

Rekenvoorbeeld: stel, een AI-systeem meldt elke maand 50 mogelijke lekken tussen contract en factuur, met een gemiddelde waarde van EUR 900. Bij controle blijkt 80 procent terecht en 20 procent niet.

Zonder controle, alles doorzetten: 40 terechte correcties, EUR 36.000. Maar ook 10 onterechte correcties: klanten die een aanvullende factuur krijgen die niet klopt. Elk daarvan kost een creditnota, een excuus en goodwill.

Met controle: elke bevinding komt met de bron erbij: het contractartikel, de factuurregels, het verschil. Een medewerker beoordeelt er een in gemiddeld drie minuten. Voor 50 bevindingen is dat tweeënhalf uur per maand. De 10 onterechte worden eruit gehaald voordat een klant ze ziet.

De getallen zijn aannames. Het punt is de verhouding: controle kost weinig als de bron er direct bij staat, en veel als iemand zelf moet zoeken. Daarom is herleidbaarheid de belangrijkste eigenschap van bruikbare AI-output.

Controle verschilt per soort output

Niet elke AI-output vraagt dezelfde controle.

  • Getallen (bedragen, totalen, aantallen): controleer automatisch tegen de bron. Een getal dat niet uit een berekening op de bron komt, vertrouw je niet.
  • Extracties (een afspraak uit een contract, een datum uit een mail): controleer een steekproef tegen het originele document, en alles waar veel geld aan hangt.
  • Samenvattingen en uitleg: controleer of elke bewering naar een bron verwijst. Een samenvatting mag korter zijn dan de bron, niet anders.
  • Voorspellingen (kans op vertrek, verwachte omzet): controleer achteraf, door voorspelling en werkelijkheid naast elkaar te leggen.
  • Concepten (mails, factuurteksten): controleer voordat ze de deur uitgaan, altijd door een mens.

Controle makkelijk maken

Het ontwerp van de output bepaalt hoe snel iemand kan controleren. Goede AI-output voor omzetcontrole bevat per bevinding:

  1. Wat er gevonden is, in één zin.
  2. Het bewijs: de records waaruit het blijkt, met verwijzing.
  3. De berekening, als er een bedrag is.
  4. Hoe zeker het systeem is, en waarom.
  5. Een voorgestelde actie.

Met die vijf elementen is controle een kwestie van kijken, niet van zoeken. Hoe je dat zekerheidsniveau beoordeelt, staat in hoe je weet of een AI-aanbeveling betrouwbaar is.

Waar het misgaat

De output wordt direct doorgezet. Een AI-samenvatting van een contract wordt in het CRM geplakt als bron van waarheid. Drie maanden later werkt iemand ermee zonder te weten dat het een samenvatting was.

Alleen de uitkomst wordt getoond. "Klant X betaalt EUR 2.300 per jaar te weinig" zonder onderbouwing. De controleur moet alles zelf opzoeken, dus hij controleert niet, of hij vertrouwt het blind.

Steekproeven stoppen. In de eerste maand controleert iedereen alles. In maand zes niemand meer. Juist dan verandert er iets aan de data of het model.

Controle zonder terugkoppeling. Een onterechte bevinding wordt weggeklikt, maar niemand kijkt waarom hij onterecht was. Dezelfde fout komt volgende maand terug.

Controlelijst

  1. Is elke output herleidbaar naar records in een bronsysteem?
  2. Komen getallen uit een berekening of query, niet uit het model zelf?
  3. Worden totalen automatisch aangesloten op de administratie?
  4. Is er een vaste maandelijkse steekproef, met een benoemde controleur?
  5. Wordt bijgehouden hoeveel bevindingen terecht waren?
  6. Wordt elke onterechte bevinding teruggekoppeld naar de oorzaak?
  7. Beoordeelt een mens alles wat naar een klant gaat of geld raakt?

In een revenue intelligence-systeem

In een systeem voor omzetcontrole is controleerbaarheid geen extra, maar de kern. Een lekmelding die niemand kan controleren, wordt niet opgevolgd. RiOS laat daarom bij elk signaal de data erachter zien, hoe zeker het systeem is, wat het kost in euro's en welke oplossing wordt voorgesteld, en is zo ontworpen dat een bevinding die de zekerheidsdrempel niet haalt, niet wordt getoond. Hoe controle past in de rest van de AI-opbouw, lees je in hoe AI binnen Revenue Intelligence werkt.

Veelgestelde vragen

Worden AI-modellen niet vanzelf beter, zodat controle overbodig wordt?

Modellen worden beter, maar de fouten die ontstaan door verkeerde of ontbrekende data blijven. En hoe beter het model, hoe groter het risico dat mensen stoppen met controleren. Controle blijft nodig; alleen de vorm kan lichter worden.

Kan ik een tweede AI laten controleren wat de eerste doet?

Als aanvulling kan het nuttig zijn, bijvoorbeeld om te checken of een samenvatting alle bedragen uit de bron bevat. Als enige controle niet, omdat beide modellen vergelijkbare fouten maken.

Hoeveel moet ik controleren?

Alles wat gevolgen heeft buiten je eigen systemen. Daarnaast een vaste steekproef van de rest. Als de steekproef maandenlang foutloos is, kun je hem verkleinen, maar nooit schrappen.

Wat als een fout toch doorglipt?

Dan wil je snel weten wat er gebeurde en welke andere uitkomsten op dezelfde manier fout kunnen zijn. Daarvoor heb je een logboek per stap nodig.

Deel dit artikel
Kennisbank · AI-techniek

Meer in dit cluster

Alle 22 onderwerpen in dit cluster

Meer van AutoMaat

Liever weten wat dit jou concreet kost?

De Revenue Audit zet een eurobedrag op de plek waar jouw omzet weglekt.

Plan de Revenue Audit