Tokens: Die kleinen Textstücke, aus denen Sprachmodelle ihre Welt bauen
Derselbe Satz kann je nach Sprachmodell anders zerlegt werden. Wer Tokens versteht, erkennt, wie Text zur Rechenfolge wird – und warum Kontextfenster keine Bedeutung messen.
Der Satz bleibt gleich. Der Schnitt nicht.
Wer denselben Satz durch die Tokenizer zweier Sprachmodelle schickt, kann zwei verschiedene Zerlegungen erhalten. Die Buchstaben sind identisch. Für einen Menschen bedeutet der Satz noch dasselbe. Nur die Maschine zieht ihre Grenzen an anderen Stellen.
Darin steckt der erste Hinweis darauf, was Tokens sind: keine digitalen Wörter. Ein Token kann einem vollständigen Wort entsprechen, einem Wortteil, einem Satzzeichen oder einer anderen Zeichenfolge. Bei manchen Verfahren beeinflusst sogar ein vorangestelltes Leerzeichen, welcher Eintrag verwendet wird.
Genau genommen muss man zwischen Token und Token-ID unterscheiden. Der Tokenizer ordnet einer erkannten Einheit einen Eintrag aus seinem Vokabular zu. Dessen numerische ID dient dem Modell als Index. Über diesen Index wird zunächst ein Vektor aus einer Einbettungstabelle abgerufen.
Die Rede von kleinen Textstücken ist deshalb eine brauchbare Anschauung, aber keine vollständige Beschreibung. Das Modell erhält weder ausgeschnittene Wörter noch Bedeutungspartikel. Es verarbeitet eine geordnete Folge diskreter Symbole. Welche Beziehungen zwischen ihnen nützlich sind, wurde während des Trainings gelernt.
Wie der Tokenizer zu seinen Grenzen kommt
Der Tokenizer ist kein austauschbarer Textzähler. Sein Vokabular und seine Regeln sind auf das jeweilige Modell abgestimmt. Würden dieselben IDs plötzlich für andere Zeichenfolgen stehen, verwiesen sie auf Einbettungen, die für etwas anderes gelernt wurden.

Viele Systeme verwenden eine Subword-Tokenisierung. Häufige Zeichenfolgen können einen gemeinsamen Eintrag erhalten, seltene Wörter werden dagegen in kleinere Einheiten zerlegt. Dadurch muss nicht jedes denkbare Wort vollständig im Vokabular stehen.
Ein bekanntes Verfahren ist Byte Pair Encoding, kurz BPE. Vereinfacht beginnt es mit kleinen Einheiten und führt häufig benachbarte Folgen schrittweise zusammen. Die Arbeit von Sennrich, Haddow und Birch übertrug diesen Ansatz auf neuronale maschinelle Übersetzung, um offene Wortschätze und seltene Wörter besser zu behandeln.
BPE ist jedoch nicht das einzige Verfahren. Unigram-Modelle wählen Segmentierungen nach einem anderen Prinzip; bytebasierte Varianten können Zeichenfolgen auf kleinere, aus Bytes abgeleitete Einheiten zurückführen. SentencePiece wurde als sprachunabhängiges System entwickelt, das direkt auf Rohtext trainiert werden kann und Leerraum in die Darstellung einbezieht.
Die entstehenden Grenzen folgen nicht zuverlässig der Grammatik. Ein deutsches Kompositum kann an Stellen zerfallen, die wie sinnvolle Wortbestandteile aussehen. Das heißt nicht, dass der Tokenizer eine morphologische Analyse vorgenommen hat. Häufigkeit, Trainingsdaten und Optimierungsverfahren bestimmen den Schnitt – nicht ein Wörterbuch der Bedeutungen.
Was im Sprachmodell ankommt
Nach der Tokenisierung wählt jede Token-ID zunächst einen Vektor aus der Einbettungsmatrix. Positionsinformationen werden je nach Architektur hinzugefügt oder anderweitig einbezogen, damit die Reihenfolge der Symbole erhalten bleibt.
In den Schichten des Modells verändern sich diese Darstellungen. Die in der ursprünglichen Transformer-Arbeit beschriebene Attention-Mechanik ermöglicht es, Informationen aus anderen zulässigen Positionen der Sequenz einzubeziehen. Der Eingangsvektor eines Tokens ist gelernt; seine spätere Repräsentation hängt jedoch vom Kontext ab.
Dieselbe Zeichenfolge kann deshalb in einer Liefermeldung anders verarbeitet werden als in einem Gedicht oder in Programmcode. Bedeutung sitzt nicht fest im Token wie ein Etikett auf einer Schublade. Sie entsteht aus den Beziehungen innerhalb der Sequenz.
Ein autoregressives Sprachmodell berechnet daraus eine Wahrscheinlichkeitsverteilung für das nächste Token. Ein Decodierungsverfahren wählt daraus eine Fortsetzung, die der Sequenz hinzugefügt wird. Danach wird die nächste Position bestimmt. Was beim Lesen wie ein flüssiger Satz erscheint, entsteht technisch Schritt für Schritt.
Wo die Bausteinmetapher bricht
Die Vorstellung von Wortbausteinen legt nahe, dass stabile sprachliche Einheiten zu größeren Bedeutungen zusammengesetzt werden. Bei häufigen Wörtern wirkt dieses Bild plausibel. An seltenen Namen, wechselnder Großschreibung, Satzzeichen und ungewöhnlichen Zeichenfolgen beginnt es zu bröckeln.
Ein geläufiger Ausdruck kann als einzelner Vokabulareintrag vorkommen. Eine seltene Schreibweise desselben Ausdrucks benötigt womöglich mehrere IDs. Leerraum kann mit dem nachfolgenden Text verbunden sein. Bytebasierte Verfahren können eine unbekannte Zeichenfolge weiter zerlegen, statt ein einziges klassisches Symbol für ein unbekanntes Wort einzusetzen.
Nicht jedes Token steht überhaupt für sichtbaren Text. Modelle und Schnittstellen verwenden häufig spezielle Symbole für Rollen, Abschnittsgrenzen oder andere strukturelle Funktionen. Die Oberfläche kann solche Markierungen verbergen, obwohl sie Teil der verarbeiteten Sequenz sind.
Darum ist die Tokenzahl keine Eigenschaft eines Textes allein. Sie gehört zur Kombination aus Zeichenfolge, möglicher Vorverarbeitung und konkretem Tokenizer. Ein Absatz besitzt nicht unabhängig vom Modell eine objektive Anzahl von Tokens. Wort- und Zeichenzahlen liefern höchstens eine grobe Annäherung.
Das Kontextfenster zählt Plätze, nicht Wichtigkeit
Das Kontextfenster bezeichnet den Sequenzraum, den ein Modell innerhalb einer Verarbeitung berücksichtigen kann. Systemanweisungen, Nutzereingaben, Gesprächsverlauf, eingefügte Dokumente, Werkzeugresultate und erzeugte Antworten können sich diesen Raum teilen – abhängig davon, wie der jeweilige Dienst die Anfrage aufbaut.

Der Ausdruck Token-Limit ist weniger eindeutig. Er kann eine Grenze für die Eingabe, die Ausgabe oder den gesamten Kontext meinen. Maßgeblich ist deshalb die technische Dokumentation des konkreten Systems. Das Tokenbudget wiederum beschreibt den Anteil dieses Raums, der für eine Aufgabe eingeplant wird.
Mehr Tokens bedeuten nicht automatisch mehr Information. Wiederholungen können viel Raum belegen, ohne zusätzliche Orientierung zu liefern. Ein kurzer Satz kann dagegen die entscheidende Bedingung enthalten. Das Budget zählt technische Einheiten, nicht Relevanz.
Auch ein großes Kontextfenster ist kein Gedächtnis im menschlichen Sinn. Es beschreibt zunächst Kapazität: wie viel Sequenz verarbeitet werden kann. Daraus folgt nicht, dass jedes enthaltene Detail gleich stark in die Antwort eingeht.
Wo ein Dienst Ein- und Ausgabetokens abrechnet, folgt auch die Kostenrechnung dieser technischen Einheit und nicht der Wortzahl. Eine belastbare Kalkulation setzt daher die Codierung und Abrechnungsregeln des tatsächlich verwendeten Modells voraus.
Ein Satz unter dem Tokenmesser
Nehmen wir die Anweisung: „Bitte prüfe den Lieferstatus für Auftrag AB-XQ und antworte knapp.“ Für Menschen besteht sie aus vertrauten Wörtern und einem Kürzel. Eine rein illustrative, nicht modellgetreue Zerlegung könnte so aussehen: Bitte | prüf | e | den | Liefer | status | für | Auftrag | AB | - | XQ | und | antworte | knapp | .
Ein realer Tokenizer kann ganz andere Grenzen setzen. Vielleicht enthält sein Vokabular „Lieferstatus“ als zusammenhängendes Muster. Vielleicht zerlegt er „Auftrag“ oder das Kürzel anders. Manche Einheiten schließen den vorangestellten Leerraum ein. Aus dem Sprachgefühl lässt sich die gültige Sequenz nicht ableiten.
Nun wird dieselbe Information als Objekt formuliert: {"auftrag":"AB-XQ","status":"offen"}. Für Menschen wirkt das kompakt. Der Tokenizer muss jedoch auch Schlüssel, Werte, Anführungszeichen, Doppelpunkte und Kommas abbilden. Ob dieses Format weniger Tokens benötigt als ein natürlicher Satz, hängt erneut von der konkreten Codierung ab.
Ein belastbarer Vergleich verwendet deshalb den Tokenizer des vorgesehenen Modells und den vollständigen technischen Kontext. Dazu gehören auch Vorlagen, Rollenmarkierungen und eingefügte Daten, soweit sie tatsächlich an das Modell übertragen werden. Anschließend lässt sich prüfen, ob eine kürzere Variante nicht nur weniger Raum benötigt, sondern auch dieselbe Bedeutung und Instruktionsklarheit bewahrt.
Für Modelle mit dokumentierter Codierung können Bibliotheken die Token-Grenzen und IDs sichtbar machen. Ein Beispiel ist die Dokumentation von tiktoken. Eine solche Messung ist nur dann aussagekräftig, wenn die verwendete Codierung zum tatsächlichen Modell passt. Ein fremder Tokenizer liefert eine Demonstration, aber keine verlässliche Zahl für den eigenen Modellpfad.
Tokenoptimierung sollte daher nicht in Telegrammstil enden. Kürze kann Kontext freihalten. Entfernte Bedingungen, kryptische Abkürzungen oder verlorene Struktur können die Antwort zugleich verschlechtern. Das kleinste Tokenbudget ist nicht automatisch das beste.
Bedeutung kommt nach dem Schnitt
Tokens erklären, warum Sprachmodelle auf kleine Schreibvarianten reagieren können und dennoch mit Wörtern umgehen, die nicht vollständig in ihrem Vokabular stehen. Unbekannter Text lässt sich aus vorhandenen Einheiten zusammensetzen und im Kontext verarbeiten.
Doch die technische Einheit ist keine Bedeutungseinheit. Der Tokenizer bestimmt das Raster, auf dem gerechnet wird. Erst das Modell lernt, welche Beziehungen zwischen den Positionen in einem bestimmten Zusammenhang nützlich sind.
Ein Sprachmodell zerlegt nicht erst verstandene Sprache in technische Teile. Es beginnt mit diskreten Symbolen – und alles, was wie Bedeutung wirkt, entsteht erst aus ihren gelernten Beziehungen im Kontext.
NOAH Insights
FAQ
Kurze Antworten auf die wichtigsten Fragen zum Beitrag.
Sind Tokens dasselbe wie Wörter?
Nein. Ein Token kann ein Wort, einen Wortteil, ein Satzzeichen, eine andere Zeichenfolge oder ein spezielles Struktursymbol repräsentieren.
Was ist der Unterschied zwischen einem Token und einer Token-ID?
Das Token ist die Einheit aus dem Vokabular. Die Token-ID ist der numerische Index, über den das Modell die zugehörige Einbettung abruft.
Warum hat derselbe Text bei verschiedenen Modellen unterschiedlich viele Tokens?
Modelle können unterschiedliche Vokabulare, Tokenisierungsverfahren und Vorverarbeitungsregeln verwenden. Dadurch entstehen aus derselben Zeichenfolge verschiedene Sequenzen.
Was ist der Unterschied zwischen Token-Limit und Kontextfenster?
Das Kontextfenster bezeichnet den verfügbaren Sequenzraum des Modells. Token-Limit kann je nach Dienst die maximale Eingabe, Ausgabe oder den gesamten Kontext meinen.
Kann man die Tokenzahl aus der Wortzahl berechnen?
Nur näherungsweise. Sprache, Leerraum, Sonderzeichen und Formatierung beeinflussen die Zerlegung. Für eine exakte Messung ist der konkrete Tokenizer erforderlich.
Quellen und Kontext
Redaktionelle Referenzen, vertrauenswürdige Grundlagen und Kontextsignale für diesen Beitrag.
KI-Strategie klären
Ordnen Sie Governance, Freigaben und operative Verantwortung in einem belastbaren ANORA-Setup ein.
Weiter