AutoMaat
Kennisbank· AI-techniek

Inference uitgelegd

Inference is het moment waarop een AI-model antwoordt. Wat het kost, waar je data dan is en waarom de uitkomst niet altijd gelijk is.

Ricardo Mastenbroek7 min lezen
Read this article in English

Inference is het gebruiken van een getraind AI-model: je geeft het invoer, het rekent en geeft een uitkomst terug. Trainen gebeurt één keer en maakt het model, inference gebeurt bij elke vraag en is het moment waarop je data het model ingaat. Voor bedrijfssoftware bepaalt inference drie dingen die je moet kennen: wat elke vraag kost, waar je data op dat moment is, en hoe voorspelbaar de uitkomst is.

Training en inference: twee verschillende fases

Een AI-model ontstaat door training. Daarbij wordt het model met enorme hoeveelheden voorbeelden bijgesteld tot het goed voorspelt. Dat is duur, duurt lang en gebeurt bij grote modellen bij de maker ervan. Na de training liggen de instellingen van het model vast. Die instellingen heten gewichten of parameters.

Inference is alles wat daarna gebeurt. Elke keer dat iemand een vraag stelt, een document laat samenvatten of een agent een stap laat zetten, draait het model een berekening met die vaste gewichten op de nieuwe invoer. Het model leert daarbij niets bij. Wat je vandaag invoert, verandert het model morgen niet, tenzij de aanbieder die data later gebruikt voor nieuwe training. Dat is een contractuele vraag, geen technische, en je moet hem stellen.

Die scheiding is belangrijk om misverstanden te voorkomen. "De AI leert van onze data" klopt bij inference niet. Wat wel kan: software slaat informatie op en geeft die bij een volgende vraag opnieuw mee. Dat lijkt op leren, maar het zit in de software, niet in het model. Wie wel het model zelf wil aanpassen, komt uit bij fine-tuning. Het verschil met het meegeven van data lees je in Fine-tuning vs RAG voor bedrijfssoftware.

Hoe inference bij een taalmodel werkt

Een taalmodel schrijft een antwoord token voor token. Een token is een stukje tekst, vaak een deel van een woord. Bij elke stap berekent het model welke tokens waarschijnlijk volgen, kiest er één, zet die achter de tekst en rekent opnieuw. Een antwoord van 300 woorden is dus honderden rekenstappen achter elkaar, elk over het hele context window. Wat dat venster is en waarom het ertoe doet, staat in Context windows uitgelegd voor AI-systemen.

Twee dingen volgen hieruit.

Langere invoer en langere antwoorden kosten meer. De rekentijd groeit met wat erin gaat en wat eruit komt. Aanbieders rekenen daarom meestal per token, vaak met een apart tarief voor invoer en uitvoer.

Het antwoord is niet altijd hetzelfde. Bij het kiezen van het volgende token zit vaak een mate van toeval. Een instelling die temperatuur heet bepaalt hoeveel. Op nul kiest het model steeds het meest waarschijnlijke token, maar ook dan zijn antwoorden in de praktijk niet altijd exact gelijk. Voor een samenvatting is dat geen probleem. Voor een controle waarbij je wilt dat dezelfde factuur twee keer hetzelfde oordeel krijgt, wel.

Waar inference draait en waarom dat telt

Op het moment van inference moet je data bij het model zijn. Dat is dus het moment waarop je klantnamen, bedragen en contractvoorwaarden een server bereiken. Er zijn grofweg drie varianten.

Variant Waar draait het model Wat dat betekent voor je data
API van een modelaanbieder Bij de aanbieder van het model Data gaat naar die aanbieder; afspraken over opslag, regio en hergebruik staan in hun voorwaarden
Model via een cloudplatform In een cloudomgeving, vaak met keuze van regio Data blijft binnen die cloudomgeving en regio, onder de afspraken met dat platform
Eigen hardware Op servers die je zelf beheert Data verlaat je omgeving niet, maar je beheert alles zelf en de beschikbare modellen zijn beperkter

Geen van de drie is per definitie goed of fout. Wat telt is dat je weet welke het is en dat het klopt met je verwerkersovereenkomst. Vraag bij elke leverancier van AI-software: welk model gebruik je, waar draait de inference, in welke regio, en wordt mijn data bewaard of gebruikt voor training? Zie ook Hoe bescherm je persoonsgegevens in AI-systemen?.

Wat inference kost, en waarom dat je architectuur bepaalt

Een enkele vraag aan een taalmodel kost weinig. Het wordt anders als software per record een model aanroept. Een systeem dat elke nacht elke factuurregel door een taalmodel haalt om te beoordelen of hij klopt, doet duizenden aanroepen per nacht. Dat is traag, duur, en voor het grootste deel overbodig: of een factuurbedrag gelijk is aan het orderbedrag, is een vergelijking die een database in een fractie van een seconde doet.

Daarom zie je bij goed gebouwde systemen een taakverdeling:

  • Regels en queries doen het rekenwerk: koppelen, optellen, vergelijken. Dat is exact, goedkoop en herhaalbaar.
  • Kleinere, gespecialiseerde modellen doen taken als afwijkingen scoren of teksten indelen. Zie Wat is anomaly detection?.
  • Een groot taalmodel komt pas in actie waar taal nodig is: een vrije-tekstclausule uitlezen, een bevinding uitleggen, een voorstel formuleren.

Die volgorde houdt inference beperkt tot waar het iets toevoegt. Het past ook bij hoe AI binnen Revenue Intelligence hoort te werken: het model is één onderdeel van een keten, niet de hele keten.

Rekenvoorbeeld: per record of per uitzondering

Rekenvoorbeeld: stel, je hebt 40.000 factuurregels per jaar en je wilt ze allemaal laten controleren.

  • Aanpak A: elke regel door een taalmodel. 40.000 aanroepen, elk met factuurregel, order en contractinformatie in het venster. Dat zijn veel tokens, veel wachttijd en elke uitkomst is een oordeel van het model dat je niet exact kunt reproduceren.
  • Aanpak B: eerst regels, dan het model. Een query vergelijkt alle 40.000 regels met order en prijslijst. Stel dat 600 regels afwijken. Alleen die 600 gaan naar een model dat uitzoekt of er een verklaring in het contract of de notities staat. Dat is 1,5 procent van de aanroepen.

Aanpak B is niet alleen goedkoper. Hij is ook beter te controleren: de 39.400 regels die kloppen, zijn exact vergeleken, en de 600 afwijkingen hebben elk een aanwijsbare reden. Wat de aanroepen in euro's kosten, hangt af van model, aanbieder en hoeveelheid tekst. Het verschil in orde van grootte blijft.

Latency: waarom sommige antwoorden lang duren

De tijd tussen vraag en antwoord heet latency. Bij inference hangt die af van de grootte van het model, de lengte van de invoer, de lengte van het antwoord en hoe druk de servers zijn. Een agent die tien stappen zet, wacht tien keer.

Voor een nachtelijke controle maakt dat niets uit. Voor iets wat een verkoper in een klantgesprek wil opzoeken, wel. Goede software maakt die afweging per taak: snel en klein waar het moet, groot en grondig waar het kan.

Controlelijst: vragen over inference aan je leverancier

  1. Welke modellen gebruik je, en voor welke stap in het proces?
  2. Waar draait de inference, in welke regio, en bij welke partij?
  3. Wordt mijn invoer opgeslagen door de modelaanbieder, en hoe lang?
  4. Wordt mijn data gebruikt om modellen te trainen? Staat dat in het contract?
  5. Welke berekeningen worden door regels of queries gedaan, en welke door een model?
  6. Als ik dezelfde controle twee keer draai, krijg ik dan dezelfde uitkomst? Zo niet, hoe wordt daarmee omgegaan?
  7. Wat gebeurt er als de modelaanbieder niet bereikbaar is: stopt het systeem, of valt het terug op iets anders?

Veelgestelde vragen

Leert een AI-model van mijn vragen?

Niet tijdens inference. Het model gebruikt vaste gewichten. Alleen als de aanbieder je data later gebruikt voor training, kan het een toekomstige versie beïnvloeden. Of dat mag, staat in de voorwaarden en hoort in je contract uitgesloten te zijn.

Waarom geeft AI soms een ander antwoord op dezelfde vraag?

Omdat bij het kiezen van elk woord vaak een mate van toeval zit, en omdat kleine verschillen in invoer of in de server tot een andere uitkomst kunnen leiden. Voor controlewerk moet software daarom exacte berekeningen buiten het model houden.

Is inference op eigen servers veiliger?

Je data verlaat je omgeving niet, dat is een voordeel. Je bent dan wel zelf verantwoordelijk voor beveiliging, updates en beschikbaarheid, en je hebt minder keuze in modellen. Veiliger is het alleen als je dat beheer goed doet.

Wat kost inference?

Dat hangt af van het model, de aanbieder en hoeveel tekst erin en eruit gaat. Er is geen vaste prijs per vraag te noemen. Wat je wel kunt sturen, is hoe vaak een model wordt aangeroepen en met hoeveel tekst.

Deel dit artikel
Kennisbank · AI-techniek

Meer in dit cluster

Alle 22 onderwerpen in dit cluster

Meer van AutoMaat

Liever weten wat dit jou concreet kost?

De Revenue Audit zet een eurobedrag op de plek waar jouw omzet weglekt.

Plan de Revenue Audit