Ein Tokenizer ist die erste Station, die Ihr Satz auf dem Weg ins Modell durchläuft – und er ist nicht fürs Verstehen zuständig, sondern nur fürs Zerlegen und Nummerieren. Bevor ein Text in ein großes Modell gelangt, schneidet der Tokenizer ihn in einzelne Tokens und ersetzt jedes durch eine Nummer aus seinem Vokabular. Was das Modell tatsächlich liest, ist diese Zahlenfolge. Wer das verstanden hat, kann sich manche Verwirrung sparen: Ein Token ist weder ein Zeichen noch ein Wort.
Geschnitten wird nicht nach Zeichen, sondern nach Häufigkeit
Die meisten gängigen Tokenizer arbeiten mit einem Verfahren namens BPE, kurz für Byte Pair Encoding. Beim Training zählt der Algorithmus, welche Zeichenkombinationen am häufigsten gemeinsam vorkommen – und je häufiger eine Kombination auftritt, desto eher wird sie zu einem einzigen Token verschmolzen. Häufige Wörter und geläufige Wortteile bleiben deshalb oft am Stück erhalten; ein englisches Wort kann ein einziges Token sein. Seltene Wörter, Namen und neue Wortschöpfungen werden dagegen feiner zerlegt, drei oder vier Stücke für ein Wort sind keine Seltenheit.
Auch Leerzeichen, Satzzeichen, Zahlen und Code fließen in die Zerlegung ein, und die Regeln sind wenig intuitiv. Im Englischen wird das Leerzeichen vor einem Wort oft mit dem Wort zu einem Token verbunden, Zeilenumbrüche, Zahlenfolgen und eingerückter Code werden jeweils gesondert behandelt. Derselbe Inhalt kann also allein durch eine andere Formatierung auf eine andere Token-Zahl kommen.
Warum derselbe Satz bei einem anderen Modell nicht aufgeht
Das Vokabular jedes Modells wird separat trainiert. Größe, Verschmelzungsregeln und die bevorzugten Sprachen unterscheiden sich. Je größer das Vokabular, desto mehr und längere Fragmente bleiben in der Regel am Stück. Deckt ein Vokabular Chinesisch gut ab, kann ein chinesisches Schriftzeichen genau 1 Token sein; bei schlechter Abdeckung zerfällt dasselbe Zeichen in mehrere Tokens auf Byte-Ebene.
Das beantwortet die Frage aus dem Titel. Als Faustregel entspricht 1 Token im Englischen etwa 3 bis 4 Zeichen. Im Chinesischen schwankt es deutlich stärker: Ein Zeichen pro Token ist sehr üblich, zwei oder mehr sind aber auch nicht ungewöhnlich – es hängt vom jeweiligen Modell ab. Wer mit der Zählung von Modell A den Verbrauch von Modell B schätzt und auf andere Werte kommt, erlebt den Normalfall; falsch gezählt hat dann keines der beiden Modelle.
Die Token-Zahl bestimmt auch unmittelbar, was etwas in der Praxis kostet. Bei nutzungsbasierter Abrechnung werden Eingabe und Ausgabe meist pro Token berechnet. Die Obergrenze des Kontextfensters und die Menge an Gesprächsverlauf, die auf einmal hineinpasst, werden ebenfalls in Tokens gemessen, und je mehr Tokens eine Antwort erzeugen muss, desto langsamer kommt sie in der Regel zurück. Beim Aufbau einer Wissensbasis wird das noch deutlicher: Auch das Aufteilen von Dokumenten in Abschnitte, wie es in Was ist RAG eigentlich? Der Unterschied zu Fine-Tuning und Prompt Engineering beschrieben wird, richtet sich nach Tokens statt nach Zeichen – zu große Abschnitte verschwenden das Fenster, zu kleine zerreißen leicht die Bedeutung.
Drei Rechenfehler, die oft passieren
Der erste ist, die Kosten direkt aus der Zeichenanzahl zu schätzen. Zwischen Zeichen und Tokens gibt es keine feste Umrechnung, und sobald Englisch, Chinesisch und Code gemischt auftreten, wächst die Abweichung. Budgets auf Zeichenbasis fallen deshalb leicht zu niedrig aus.
Der zweite ist die Annahme, Chinesisch sei grundsätzlich günstiger oder grundsätzlich teurer. Genauer lautet die Aussage: Mit den meisten gängigen Vokabularen verbraucht derselbe Inhalt auf Chinesisch in der Regel mehr Tokens als auf Englisch, weil häufige englische Wörter eher am Stück treffen, während Chinesisch häufiger zerlegt wird. Ein Naturgesetz ist das aber nicht. Mit einem Vokabular, das gut auf Chinesisch abgestimmt ist, schrumpft der Abstand spürbar – die Aussage muss sich immer auf ein konkretes Modell beziehen.
Der dritte ist, die Token-Zahl als Beleg für die Stärke eines Modells zu lesen. Wenn derselbe Satz bei einem Modell 80 und bei einem anderen 110 Tokens ergibt, zeigt das nur, dass beide unterschiedlich zerlegen – nicht, welches klüger ist. Das Vokabular ist ein Kompromiss: Ein großes Vokabular schneidet grob, macht aber jedes Token in der Darstellung teurer; ein kleines schneidet fein und erzeugt längere Folgen.
Was er nicht kann
Ein Tokenizer ist nicht das Modell selbst. Er entscheidet nur, in welcher Körnung Text hineingegeben wird; Bedeutung versteht er nicht, und ob ein Satz stimmt, beurteilt er auch nicht. Wie sinnvoll zerlegt wird, wirkt sich durchaus darauf aus, wie gut ein Modell arbeiten kann – eine schlechte Zerlegung erschwert Rechnen und den Umgang mit seltenen Wörtern. Verstehen und Schlussfolgern bleiben aber Sache der Modellparameter. Wer beides auseinanderhält, erwartet vom Tokenizer weder zu viel noch macht er die falsche Komponente verantwortlich.
Für den Alltag gibt es eine einfache Selbstkontrolle: Schätzen Sie Kosten und Länge nicht nach Zeichen im Kopf, sondern zählen Sie Ihren echten Text einmal mit dem Tokenizer-Werkzeug des Modells, das Sie verwenden. Rechnen Sie System-Prompt, Gesprächsverlauf und Spielraum für die Ausgabe mit ein und lassen Sie rund zwanzig Prozent Puffer. Wer in Tokens statt in Zeichen plant, vermeidet die meisten Überraschungen bei Rechnung und Kontextüberlauf im Voraus.