Context windows uitgelegd voor AI-systemen
Wat een context window is, waarom een groter venster niet betekent dat AI al je data overziet, en hoe je stil afgekapte analyses voorkomt.
Een context window is de hoeveelheid tekst die een taalmodel in één keer kan meenemen bij het schrijven van een antwoord: jouw vraag, de instructies, de meegegeven documenten en het antwoord zelf. Alles wat daar niet in past, bestaat voor het model op dat moment niet. Een groot venster betekent niet dat het model al je bedrijfsdata overziet. Het betekent dat de software eromheen moet kiezen wat erin gaat, en die keuze bepaalt of een analyse klopt.
Hoe een context window werkt
Een taalmodel heeft geen geheugen tussen gesprekken en geen toegang tot je systemen. Het krijgt bij elke aanroep een blok tekst en schrijft daarop verder. Dat blok is het context window. Het wordt gemeten in tokens: stukjes tekst die kleiner zijn dan een woord. Een kort Nederlands woord is vaak één token, een lang samengesteld woord als "indexatieclausule" meerdere. Getallen, datums en bedragen worden vaak in meerdere tokens opgeknipt.
In dat ene blok zit alles:
- de systeeminstructies van de software ("je bent een assistent die facturen controleert"),
- de beschrijving van het gereedschap dat het model mag gebruiken,
- de eerdere berichten in het gesprek,
- de documenten of data die zijn meegegeven,
- en het antwoord dat het model nog moet schrijven.
De vensters van moderne modellen zijn groot: honderdduizenden tokens, bij sommige modellen meer. Dat klinkt als genoeg voor alles. Voor een jaar aan facturen, een CRM met duizenden deals en honderden contracten is het dat niet, en zelfs als het zou passen, is het geen goed idee om het er allemaal in te stoppen.
Waarom groter niet hetzelfde is als beter
Aandacht is niet gelijk verdeeld
Dat iets in het venster staat, betekent niet dat het model er even goed op let. Modellen zijn beter geworden in het vinden van een detail in een lange tekst, maar bij grote hoeveelheden data neemt de kans toe dat een regel wordt overgeslagen of verkeerd gekoppeld. Voor een samenvatting is dat vaak niet erg. Voor een controle waarbij één gemiste factuurregel het verschil is, wel.
Rekenen gaat niet beter met meer tekst
Een model dat 4.000 factuurregels in zijn venster heeft, telt die niet op zoals een database dat doet. Het schat, het vat samen, het rondt af. Soms klopt de uitkomst. Je weet alleen niet wanneer. Totalen, verschillen en aantallen horen berekend te worden door code of een database, met het model als degene die de vraag vertaalt en het resultaat uitlegt. Dat onderscheid staat ook centraal in RAG vs database queries voor bedrijfsdata.
Kosten en snelheid
Elke token in het venster wordt bij elke aanroep verwerkt. Een groot venster vullen kost dus rekenkracht, tijd en geld, bij elke vraag opnieuw. Hoe dat werkt lees je in Inference uitgelegd.
Afkappen gebeurt stil
Dit is het gevaarlijkste punt. Past de data niet, dan moet de software iets weglaten. Slecht gebouwde software kapt de lijst gewoon af: de eerste 500 orders gaan mee, de rest niet. Het model krijgt dat niet te horen en schrijft een antwoord alsof het alles heeft gezien. "Alle orders in Q3 zijn gefactureerd" kan dan betekenen: alle orders die pasten.
Wat dit betekent voor omzetanalyse
Stel dat je een AI-assistent vraagt: "Welke gewonnen deals van dit jaar hebben geen factuur?" Er zijn drie manieren waarop software dat kan aanpakken.
Alles in het venster. Alle deals en alle facturen worden als tekst meegegeven. Het model vergelijkt zelf. Dit werkt bij tien deals. Bij duizenden deals wordt het traag, duur en onbetrouwbaar, en loop je het risico dat er stil wordt afgekapt.
Een selectie in het venster. De software zoekt eerst de deals die relevant lijken en geeft die mee. Beter, maar de vraag is dan wie bepaalt wat relevant is. Een selectie op basis van gelijkenis (zie Embeddings uitgelegd voor business software) mist precies de deals die er anders uitzien.
Rekenen buiten het venster. De software voert een query uit die deals en facturen koppelt op klant en bedrag, en geeft alleen de uitkomst mee: 14 deals zonder factuur, met de details. Het model legt uit, rangschikt en stelt een actie voor. Het venster bevat dan weinig, maar wel het juiste. Dit is de aanpak die schaalt en die je kunt narekenen.
De derde aanpak is waar een goed Revenue Intelligence-systeem met AI op leunt. Het model hoeft niet alles te zien. Het moet de juiste vraag laten uitvoeren en de uitkomst goed uitleggen.
Context window en agents
Bij een AI-agent die meerdere stappen zet, vult het venster zich tijdens het werk. Elke keer dat de agent een tool aanroept, komt het resultaat in het venster erbij. Een agent die twintig facturen opvraagt en bij elke factuur de order erbij zoekt, heeft na een tijd een vol venster.
Software lost dat meestal op door oudere stappen samen te vatten of weg te laten. Daarmee kan informatie verloren gaan die later nodig was. Een agent die aan het begin las dat klant X een afwijkende betaaltermijn heeft, kan dat twintig stappen later kwijt zijn. Dat is geen fout van het model, maar van hoe de taak is opgeknipt. Kleinere taken met een duidelijke uitkomst zijn betrouwbaarder dan één lange sessie. Meer over het gereedschap waarmee agents werken in Wat is tool calling?.
Rekenvoorbeeld: wat past er eigenlijk in
Rekenvoorbeeld: stel, je hebt 3.000 factuurregels per jaar. Elke regel bevat klantnaam, factuurnummer, datum, artikel, aantal, prijs en btw. Als tekst is dat al gauw tientallen tokens per regel. Neem 50 tokens als ruwe aanname.
- 3.000 regels maal 50 tokens is 150.000 tokens.
- Voeg de bijbehorende orders toe, ongeveer even groot, en je zit op 300.000 tokens.
- Voeg de contracten toe waarin prijsafspraken staan, en je zit ruim boven wat de meeste modellen in één keer verwerken.
En dan heb je het over één jaar, zonder CRM-data, zonder creditnota's, zonder meerwerk. Het werkelijke aantal tokens hangt af van je data en van het model. Het punt is de orde van grootte: omzetdata van een bedrijf met EUR 2M+ omzet past niet zinvol in één venster. Filteren en rekenen buiten het model is geen optimalisatie, het is een voorwaarde.
Hoe je herkent of een systeem hier goed mee omgaat
Vraag bij elke AI-tool die over je data rapporteert:
- Hoeveel data heeft het model gezien voor dit antwoord? Een goed systeem kan dat laten zien: 1.240 orders, 1.198 facturen, periode januari tot en met september.
- Wat gebeurt er als het niet past? Wordt de gebruiker gewaarschuwd, of wordt er stil afgekapt?
- Worden totalen berekend of geschreven? Vraag naar een getal en vraag vervolgens hoe het tot stand kwam. Als het antwoord is "het model heeft het uitgerekend", ben je voorzichtig.
- Kan ik de bron van een bewering openen? Elke claim over een klant of factuur hoort terug te leiden naar een record.
- Hoe lang zijn de agentsessies? Een agent die uren doorwerkt op één venster, verliest onderweg informatie.
Controlelijst voor je eigen gebruik van AI op bedrijfsdata
Ook als je gewoon een chatassistent gebruikt met een geüpload bestand, gelden dezelfde regels:
- Upload geen export van duizenden regels en vraag om een totaal. Laat het totaal in Excel of je boekhoudpakket uitrekenen.
- Vraag het model om te zeggen hoeveel regels het heeft gelezen. Vergelijk dat met het aantal in het bestand.
- Knip grote vragen op. Eerst per klant, per maand of per productgroep.
- Vraag bij elke bevinding om het factuurnummer of ordernummer, zodat je het kunt nakijken.
- Wees extra kritisch bij "alles klopt". Een model dat de helft niet heeft gezien, vindt daar ook geen fouten in.
Veelgestelde vragen
Wat is een token?
Een token is het stukje tekst waarmee een taalmodel rekent. Vaak een woord of een deel van een woord. Hoeveel tokens een tekst kost, hangt af van de taal en het model. Nederlandse teksten en getallen kosten doorgaans meer tokens dan je op basis van het aantal woorden zou denken.
Onthoudt een AI-model wat ik gisteren vroeg?
Het model zelf niet. Software kan eerdere gesprekken of notities opslaan en bij een nieuwe vraag opnieuw in het venster zetten. Dat voelt als geheugen, maar het is de software die kiest wat erin komt.
Is een groter context window altijd beter?
Nee. Het geeft ruimte, maar kost meer en garandeert niet dat het model alles even goed gebruikt. Voor bedrijfsdata is de selectie van wat erin gaat belangrijker dan de maximale grootte.
Kan ik mijn hele CRM in een AI-assistent laden?
Technisch kun je veel uploaden, maar het model gaat er niet mee rekenen zoals een database. Voor vragen over aantallen en bedragen heb je een koppeling nodig die queries uitvoert en alleen de uitkomst aan het model geeft.
Hoe merk ik dat data is afgekapt?
Vaak niet, en dat is het probleem. Vraag daarom altijd hoeveel records zijn meegenomen en vergelijk dat met de bron. Een systeem dat dit niet kan tonen, is voor controlewerk ongeschikt.
Meer in dit cluster
- Hoe werkt AI binnen Revenue Intelligence?Begin hier
- RAG vs database queries voor bedrijfsdata
- Embeddings uitgelegd voor business software
- Inference uitgelegd
- Fine-tuning vs RAG voor bedrijfssoftware
- AI architecture voor Revenue Intelligence
- Wat is anomaly detection?
- Wat is predictive analytics?