Hoe weet je of een AI-aanbeveling betrouwbaar is?
Een AI-aanbeveling is betrouwbaar als het bewijs klopt, de zekerheid onderbouwd is en het systeem aantoonbaar vaker gelijk heeft dan niet. Zo toets je dat.
Een AI-aanbeveling is betrouwbaar als je het bewijs kunt nazien in je eigen systemen, als het systeem aangeeft hoe zeker het is en waarom, en als je over een langere periode kunt aantonen dat aanbevelingen met een hoge zekerheid vaker klopten dan die met een lage. Een zekerheidsscore op zich zegt weinig; pas als je hem naast de werkelijke uitkomsten legt, weet je of je hem kunt gebruiken. Zonder bron en zonder meetbare trefkans is een aanbeveling een mening met een getal erbij.
Drie vragen bij elke aanbeveling
Voordat je naar scores kijkt, zijn er drie vragen die je bij elke aanbeveling kunt stellen.
1. Kan ik het bewijs zien? Een aanbeveling om een klant een correctiefactuur te sturen, moet wijzen naar het contractartikel, de factuurregels en het berekende verschil. Kun je die in een minuut nakijken, dan is de aanbeveling controleerbaar. Kan dat niet, dan vraagt het systeem om blind vertrouwen.
2. Klopt de redenering? Volgt de aanbeveling logisch uit het bewijs? "Klant betaalt minder dan vorig jaar, dus er is een prijsfout" klopt niet als de klant ook minder afnam. Een goede aanbeveling sluit alternatieve verklaringen uit of noemt ze.
3. Hoe zeker is het systeem, en is die zekerheid onderbouwd? Daar gaat de rest van dit artikel over.
Confidence scores bij AI uitgelegd
Veel AI-systemen geven bij een uitkomst een zekerheidsscore, ook wel confidence score: een getal tussen 0 en 1, een percentage, of een label als hoog, middel, laag. Wat dat getal betekent, verschilt per soort AI.
Bij voorspellende modellen
Een predictive model geeft een kans. "Deze klant heeft 0,78 kans om niet te verlengen." Als het model goed gekalibreerd is, betekent dat: van alle klanten die 0,78 krijgen, verlengt ongeveer 78 procent niet. Dat is toetsbaar.
Bij regels en vergelijkingen
Een bevinding die voortkomt uit een harde vergelijking, contractprijs EUR 95 en gefactureerd EUR 85, is in principe zeker, als de brondata klopt. De onzekerheid zit dan niet in de berekening, maar in de data: is dit de juiste contractversie, is er misschien een afspraak die niet in het systeem staat?
Bij taalmodellen
Een taalmodel dat een afspraak uit een contract haalt, heeft geen ingebouwde betrouwbare zekerheidsscore. Vraag je het model hoe zeker het is, dan krijg je een getal, maar dat getal is ook gegenereerde tekst. Het zegt iets, maar niet genoeg om op te vertrouwen. Betere signalen zijn: vond het model een letterlijke passage die de afspraak onderbouwt, gaven meerdere onafhankelijke extracties hetzelfde antwoord, klopt de vorm met wat je verwacht?
Kalibratie: het enige wat telt
Een zekerheidsscore is alleen bruikbaar als hij gekalibreerd is: als 90 procent zekerheid ook echt ongeveer negen van de tien keer klopt. Veel systemen zijn te zelfverzekerd. Ze geven 90 procent waar het in werkelijkheid 65 procent is.
Je toetst dat zelf, met gegevens die je toch al hebt. Houd per aanbeveling bij welke score hij had en of hij bij controle klopte. Na een paar maanden maak je een tabel:
| Zekerheid volgens systeem | Aantal aanbevelingen | Klopte bij controle | Werkelijke trefkans |
|---|---|---|---|
| 90 tot 100% | 120 | 110 | 92% |
| 70 tot 90% | 80 | 58 | 73% |
| 50 tot 70% | 60 | 27 | 45% |
In dit voorbeeld zijn de hoogste twee groepen redelijk gekalibreerd; de laagste groep is te optimistisch. Aanbevelingen onder de 70 procent verdienen dus extra aandacht, of horen niet getoond te worden.
De cijfers in de tabel zijn een voorbeeld. De methode is wat telt: zonder deze tabel weet je niet wat de scores van jouw systeem waard zijn.
Rekenvoorbeeld: een drempel kiezen
Rekenvoorbeeld: stel, een systeem vindt maandelijks 200 mogelijke lekken met een gemiddelde waarde van EUR 600. Beoordeling door een medewerker kost vijf minuten per stuk. Een onterechte actie richting klant kost je naar schatting EUR 250 aan tijd en goodwill.
Met de kalibratietabel hierboven:
- Alles tonen: 200 beoordelingen, 16,7 uur werk. Alle terechte lekken worden gevonden, mits de medewerker scherp blijft.
- Alleen boven 70 procent tonen: bij de verdeling uit de tabel zijn dat ongeveer 154 beoordelingen, 12,8 uur. Je mist dan de terechte lekken in de laagste groep: ongeveer 46 aanbevelingen, waarvan 45 procent terecht. Dat zijn zo'n 21 lekken, bij EUR 600 gemiddeld ongeveer EUR 12.500 per maand.
- Laagste groep apart, in een maandelijkse bulkcontrole: je behoudt de opbrengst, maar concentreert het werk.
Welke drempel juist is, hangt af van de verhouding tussen de waarde van een gevonden lek, de kosten van beoordeling en de kosten van een fout. Die verhouding is voor elk bedrijf anders. Het principe dat onzekere bevindingen niet worden gepubliceerd, heet fail-closed. Meer over de kosten van lekken staat in hoe je revenue leakage berekent.
Signalen dat een aanbeveling onbetrouwbaar is
- Geen bron. Een bedrag of conclusie zonder verwijzing naar records.
- Altijd hoge zekerheid. Een systeem dat bij elke aanbeveling 95 procent geeft, onderscheidt niet.
- Bron en conclusie lopen uiteen. Het contract zegt 2,5 procent, de aanbeveling rekent met 3 procent.
- Wisselend antwoord. Dezelfde situatie levert bij herhaling een andere aanbeveling op.
- Verouderde data. De aanbeveling baseert zich op gegevens van voor een bekende wijziging.
- Te mooi om waar te zijn. Een lek van EUR 200.000 bij een klant met EUR 50.000 jaaromzet. Waarschijnlijk een koppelingsfout.
Die laatste categorie ontstaat vaak door verkeerde bedrijfsdata, niet door het model.
Betrouwbaarheid verandert in de tijd
Een systeem dat vorig kwartaal goed gekalibreerd was, hoeft dat nu niet meer te zijn. Drie dingen veranderen het:
- Je data verandert. Een nieuw prijsmodel, een migratie van administratiepakket, een nieuwe productlijn. Patronen waarop het systeem vertrouwde, gelden niet meer.
- Het model verandert. Aanbieders van taalmodellen brengen nieuwe versies uit. Gedrag kan verschuiven, ook als niemand bij jou iets aanpast.
- Je processen veranderen. Als je team bepaalde lekken structureel dicht, worden de resterende bevindingen zeldzamer en vaak lastiger.
Daarom is de kalibratietabel geen eenmalige toets, maar een vast onderdeel van AI monitoring.
Controlelijst: een AI-systeem beoordelen op betrouwbaarheid
Vraag een leverancier of je eigen team:
- Toont elke aanbeveling het bewijs uit de bronsystemen?
- Is er een zekerheidsniveau per aanbeveling, en hoe wordt het bepaald?
- Is dat niveau gekalibreerd, en kun je de gegevens zien?
- Wat gebeurt er met aanbevelingen onder een drempel? Worden ze getoond, apart gezet of weggelaten?
- Wordt bijgehouden hoe vaak aanbevelingen klopten?
- Worden afgewezen aanbevelingen gebruikt om het systeem te verbeteren?
- Hoe gaat het systeem om met tegenstrijdige bronnen? Kiest het er een, of meldt het de tegenstrijdigheid?
Betrouwbaarheid is een eigenschap van het systeem, niet van het model
Een beter taalmodel maakt aanbevelingen niet automatisch betrouwbaarder. Betrouwbaarheid ontstaat uit het geheel: juiste brondata, harde berekeningen in software, een onderbouwd zekerheidsniveau, een drempel voor publicatie en een mens die de rest beoordeelt. Dat geheel staat beschreven in hoe AI binnen Revenue Intelligence werkt. De rol van de mens daarin wordt uitgewerkt in human-in-the-loop AI uitgelegd.
In RiOS laat elk signaal de data erachter zien, een zekerheidsniveau, de impact in euro's en een voorgestelde stap, en het platform wordt gebouwd op fail-closed publicatie: een bevinding die de zekerheidsdrempel niet haalt, komt niet op het dashboard. Hoe dat werkt, staat op de pagina over het systeem.
Veelgestelde vragen
Wat is een goede confidence score?
Er is geen universele grens. Een score is goed als hij gekalibreerd is, dus als 80 procent ook ongeveer acht van de tien keer klopt. Welke drempel je hanteert, hangt af van wat een gemiste bevinding en een onterechte actie je kosten.
Kan ik een taalmodel vragen hoe zeker het is?
Dat kan, maar het antwoord is zelf gegenereerde tekst en niet betrouwbaar gekalibreerd. Kijk liever of het model een letterlijke bron kan aanwijzen en of het antwoord overeenkomt met andere bronnen.
Hoe lang duurt het voordat ik weet of een systeem betrouwbaar is?
Je hebt genoeg beoordeelde aanbevelingen nodig om per zekerheidsgroep iets te zeggen. Bij tientallen aanbevelingen per maand heb je na een paar maanden een eerste beeld. Blijf het daarna bijhouden, want data en modellen veranderen.
Is een aanbeveling met 100 procent zekerheid altijd juist?
Nee. Een harde vergelijking kan 100 procent zeker zijn over de berekening en toch fout zijn omdat de brondata niet klopt of een afspraak buiten het systeem is gemaakt.
Meer in dit cluster
- Hoe werkt AI binnen Revenue Intelligence?Begin hier
- AI monitoring uitgelegd
- Waarom AI-output gecontroleerd moet worden
- AI recommendations vs AI decisions
- Human-in-the-loop AI uitgelegd
- AI architecture voor Revenue Intelligence
- Wat is anomaly detection?
- Wat is predictive analytics?