AI Tools

Token Counter

Snel starten met
0tekens
0woorden
0tokens

Exact aantal tokens voor de gekozen OpenAI-encoding — geen schatting. Voor andere aanbieders (Anthropic, Google) is dit een indicatie: die gebruiken een eigen tokenizer. De tekst wordt naar onze eigen server gestuurd om te tokenizen (niet naar een AI-API).

Een taalmodel rekent niet in woorden maar in tokens, en het verschil is groter dan mensen verwachten: Nederlandse tekst kost per woord meer tokens dan Engelse, en code, JSON en emoji vallen weer heel anders uit. Deze tool telt met de daadwerkelijke tokenizer die OpenAI gebruikt — cl100k_base voor GPT-3.5 en GPT-4, o200k_base voor GPT-4o en nieuwer — en niet met de veelgebruikte vuistregel van vier tekens per token. Je ziet niet alleen het aantal, maar ook hoe je tekst in losse tokenstukken uiteenvalt, wat vaak verrassend leerzaam is: precies daar zie je waarom een lange samengestelde term meer kost dan je dacht. Handig om te controleren of een prompt binnen het contextvenster past, om twee formuleringen tegen elkaar af te wegen, of om vooraf een kosteninschatting te maken — modellen worden immers per duizend tokens afgerekend. Let op één ding: anders dan de meeste tools in deze toolbox verwerkt deze niet lokaal. Je tekst gaat naar onze eigen server om geteld te worden, want de tokenizer draait daar. Hij gaat níét naar een AI-aanbieder en wordt niet opgeslagen. Het gebruik is gratis en onbeperkt, ook zakelijk — geen account, geen licentie, geen limiet op het aantal keren.

Waar je dit voor gebruikt

  • Controleren of een systeemprompt binnen het contextvenster past
  • Twee formuleringen vergelijken op tokenkosten
  • Vooraf inschatten wat een batch van duizend documenten kost

Wat anderen van deze tool vinden

Nog geen beoordelingen voor deze tool. Die van jou is de eerste.

Veelgestelde vragen

Is dit het exacte aantal tokens van mijn AI-model?

Voor OpenAI-modellen die de gekozen encoding gebruiken: ja, exact. Dit is dezelfde tokenizer-bibliotheek die OpenAI zelf publiceert, geen benadering. Kies cl100k_base voor GPT-3.5 en GPT-4, en o200k_base voor GPT-4o en nieuwere modellen. Voor andere aanbieders is het een indicatie: Anthropic en Google gebruiken elk een eigen tokenizer, en die komt op dezelfde tekst op een ander aantal uit. In de praktijk zit het voor gewone lopende tekst binnen ongeveer tien procent van elkaar, wat voor een kosteninschatting ruim voldoende is, maar reken er niet mee af tot op het token.

Hoeveel tokens is een woord ongeveer?

De vuistregel die je overal leest — ongeveer vier tekens per token, of driekwart woord per token — klopt redelijk voor Engelse lopende tekst en veel minder goed voor de rest. Nederlands valt duurder uit omdat samenstellingen als "verzekeringsmaatschappij" in meerdere stukken worden geknipt waar het Engels een enkel token gebruikt. Code, JSON en URL’s vallen ook ongunstig uit door alle leestekens. Emoji en niet-Latijns schrift kunnen meerdere tokens per teken kosten. Precies daarom is tellen zinvoller dan schatten, zeker als je met een krap contextvenster of een groot volume werkt.

Wordt mijn tekst naar een AI-aanbieder gestuurd?

Nee. Je tekst gaat wel naar onze eigen server — daar draait de tokenizer, want die heeft de volledige BPE-tabellen nodig die te groot zijn om in de browser te laden. Hij gaat niet door naar OpenAI, Anthropic of welke andere aanbieder dan ook, wordt niet opgeslagen en niet gelogd; na het tellen is hij weg. Dat is wel een verschil met de meeste andere tools in deze toolbox, die volledig in je browser draaien. Werk je met tekst die de deur echt niet uit mag, houd dan rekening met dit onderscheid.

Zit er een maximum aan de tekstlengte?

Ja, vijftigduizend tekens per keer. Dat is ruim: het is grofweg een document van vijftien tot twintig pagina’s, en meer dan genoeg voor vrijwel elke prompt. De grens zit er om te voorkomen dat één aanvraag de server minutenlang bezet houdt. Heb je een groter document, knip het dan in stukken en tel die op — tokenizen is nagenoeg optelbaar, met hooguit een verschil van enkele tokens op de knippunten. Er is geen dagcap en geen betaalde variant met een hogere limiet.

Tellen input- en outputtokens allebei mee voor de kosten?

Ja, en dat wordt vaak vergeten. Aanbieders rekenen input en output apart af, waarbij output meestal een stuk duurder is per token — bij sommige modellen een factor vier of vijf. Deze tool telt wat je erin stopt. Voor een volledige kostenraming tel je daar het verwachte antwoord bij op, en bij een gesprek met meerdere beurten ook de hele voorgeschiedenis die telkens opnieuw wordt meegestuurd. Dat laatste is de meest onderschatte kostenpost in een chattoepassing.