
AI-content herkennen: eindelijk een beetje houvast
15/09/2026Tokens: wat zijn dat, en waarom raken ze je portemonnee?
"Je hebt je tokenlimiet bereikt!" Elke ervaren AI-gebruiker kent die melding. En daar sta je dan: tijdelijk klaar met vragen stellen. Reden genoeg om eens goed te kijken naar wat een token nou eigenlijk is, en waarom het lonend is om er zuinig mee om te gaan.
Wat is een token?
Elk model heeft een input en een output: er gaat iets in, er komt iets uit. Bij numerieke modellen is dat overzichtelijk: één getal is behapbaar en staat in een logisch, lineair verband tot andere getallen. Taal is lastiger. Jij stelt als gebruiker een vraag in de vorm van een lap tekst, maar die tekst is als geheel te specifiek en te groot om een model er iets mee te laten doen. De kans dat exact diezelfde zin ooit nog terugkomt, is nagenoeg nul.
Daarom wordt tekst opgesplitst in kleinere stukjes. Wij doen dat trouwens ook: we lezen woord voor woord, en die woorden vormen samen de betekenis. Bij taalmodellen bleek een splitsing op woordniveau echter niet altijd de beste aanpak; soms werkt een splitsing op subwoordniveau juist beter, ergens tussen een lettergreep en een heel woord in.
Dát kleine stukje is een token. Hoeveel karakters zo'n token telt en hoe die eruitzien, verschilt per tokenizer en per taalmodel.
Waarom kost een token geld?
Zowel de input als de output van een taalmodel bestaat uit tokens. Daarom is het aantal tokens een logische maatstaf voor modelgebruik, en dus ook de basis voor prijsbepaling. Elk gebruik van een model brengt marginale kosten met zich mee: hoe meer je een model vraagt, hoe meer berekeningen nodig zijn, hoe meer stroom er verbruikt wordt.
Dat zorgt voor hitte in een datacentrum, waardoor er weer meer koeling nodig is, vaak met water. Elke extra vraag kost een bedrijf dus daadwerkelijk geld; het is geen puur verdienmodel. OpenAI zou als bedrijf zelfs verlies maken, juist omdat het gebruik van taalmodellen tot op zekere hoogte gratis aanbiedt.
Bij interfaces zoals websites of apps betaal je vaak een vast maandbedrag. Stuur je queries direct naar een model via een API, dan betaal je per token, en dan valt op dat inputtokens goedkoper zijn dan outputtokens. Dat verschil zit in de verwerking: input wordt in één keer, synchroon, verwerkt, terwijl output stap voor stap wordt voorspeld. Elk extra stukje input is dus maar één extra berekening, terwijl elk extra stukje output een volledige nieuwe rekenronde vergt over alles wat al berekend is.
"Elke extra vraag kost een bedrijf daadwerkelijk geld, het is geen puur verdienmodel."
Vier tips om tokens te besparen
Laat beleefdheidswoordjes achterwege
"Hallo" en "dankjewel" voegen niets toe voor een taalmodel. Het zijn alleen extra tokens.
Investeer in prompt engineering
Beter in één keer een scherpe prompt schrijven dan een antwoord stap voor stap bijschaven tot het eindelijk klopt.
Start een nieuwe chat bij een nieuw onderwerp
Binnen een chat wordt alles onthouden in het context window, en dat window is onderdeel van de input bij elke nieuwe vraag. Hoe langer de chat, hoe meer ruis.
Kies bewust je model
Bij Anthropic is Claude Haiku licht en snel, Claude Opus zwaar. Bij OpenAI is dat GPT-5 mini tegenover GPT-5, bij Google Gemini Flash tegenover Gemini Pro. Een simpele vraag heeft geen zwaar model nodig.
Een token is een goede maatstaf voor modelgebruik. Maar de echte waarde zit erin dat je die maatstaf combineert met een andere KPI, zodat je stuurt op effectiviteit in plaats van op volume. Het doel is niet zoveel mogelijk AI gebruiken. Het doel is AI zó gebruiken dat het ook daadwerkelijk iets oplevert.
Benieuwd hoe wij AI open en bewust inzetten?
We schrijven regelmatig over automatiseringen, datagedreven oplossingen en AI-toepassingen. Check onze andere blogs of neem gewoon contact op, we denken graag mee.
Altijd als eerste het nieuws van Univia ontvangen?
Volg ons op social media, en houd onze blog pagina in de gaten voor de laatste updates! Of schrijf je nu in voor onze nieuwsbrief!











