Zum Hauptinhalt springen

Grundlagen

Was sind KI-Token?

Token sind die Einheiten, die ein Sprachmodell tatsächlich liest und schreibt — keine Wörter oder Zeichen. Wie Tokenisierung funktioniert, wie Eingabe und Ausgabe gezählt werden, und warum nur der eigene Tokenizer des Modells eine exakte Zahl liefert.

Alle Erklärungen · Zuletzt geprüft:

Ein Token ist kein Wort und kein Zeichen

Ein Tokenizer zerlegt Text in Stücke aus einem festen Vokabular, das er beim Training gelernt hat. Ein kurzes, gebräuchliches Wort ist oft genau ein Token; ein längeres oder selteneres Wort kann in zwei oder drei zerfallen; ein einzelnes ungewöhnliches Symbol kann selbst mehr als ein Token beanspruchen. Satzzeichen, Leerzeichen und Zeilenumbrüche sind ebenfalls Token und nicht kostenlos.

Deshalb entwickeln sich Tokenanzahl, Wortanzahl und Zeichenanzahl unabhängig voneinander. Zwei Sätze mit gleicher Wortzahl können unterschiedlich viele Token benötigen, und ein Satz mit kürzeren, gebräuchlicheren Wörtern kann seine Tokenanzahl senken, ohne als Text kürzer zu werden.

Tokenisierung unterscheidet sich je nach Sprache und Modell

Jedes Modell bringt seinen eigenen Tokenizer und sein eigenes festes Vokabular mit, aufgebaut aus dem Text, mit dem es trainiert wurde. Formulierungen, die in diesem Trainingstext häufig vorkamen, verdichten sich zu wenigen, längeren Token; seltene Formulierungen zerfallen eher in mehrere, kürzere Stücke.

Daraus folgen zwei Dinge unmittelbar. Erstens kann derselbe Satz je nach Sprache eine merklich andere Tokenzahl kosten, weil kein Vokabular zwei Sprachen gleich gut abbildet. Zweitens kann derselbe Satz bei zwei verschiedenen Modellen unterschiedlich viele Token kosten, weil jedes ein eigenes Vokabular hat — eine Zählung aus dem Tokenizer eines Modells ist keine verlässliche Schätzung für ein anderes.

Eine Anfrage verbraucht Eingabe-Token und Ausgabe-Token

Jede Anfrage hat zwei Token-Pools, die getrennt gezählt und meist getrennt bepreist werden. Eingabe-Token sind alles, was an das Modell geschickt wird: Anweisungen, der sichtbare Gesprächsverlauf, angehängte Dokumente und Werkzeugergebnisse. Ausgabe-Token sind alles, was das Modell im Gegenzug erzeugt.

Eingabe-Token sind in einem mehrstufigen Gespräch kein einmaliger Posten. Weil jede neue Anfrage den bisherigen Verlauf erneut mitschickt, zählen frühere Nachrichten und angehängtes Material bei jedem Zug erneut als Eingabe — nicht nur in dem Zug, in dem sie zuerst hinzukamen.

Token sind die Einheit, in der ein Kontextfenster gemessen wird

Ein Kontextfenster ist ein in Token ausgedrücktes Budget, das sich Eingabe und Ausgabe einer einzelnen Anfrage teilen. „Was ist ein Kontextfenster?“ erklärt, wie sich dieses Budget in der Praxis verhält; hier zählt nur die Einheit — das Fenster wird nicht in Wörtern, Zeichen oder Nachrichten gemessen, sondern in Token, und Eingabe wie Ausgabe schöpfen aus derselben Gesamtmenge.

Kosten schätzen ohne feste Zahl

Tokenbasierte Kosten sind eine Multiplikation: verbrauchte Token mal ein je Modell festgelegter Satz. Anbieter legen diese Sätze nach eigenem Zeitplan fest und ändern sie; ein leistungsfähigeres Modell kostet pro Token typischerweise mehr als ein kleineres, und Ausgabe-Token werden meist höher bepreist als Eingabe-Token. Nichts davon macht eine konkrete Zahl an dieser Stelle sinnvoll — ein hier abgedruckter Satz wäre binnen Monaten falsch.

Unabhängig von der aktuellen Preistabelle bleibt die Form der Kosten gleich: kürzere, fokussiertere Prompts und kürzere, fokussiertere Antworten verbrauchen weniger Token, und große Anhänge bei jedem Zug eines langen Gesprächs erneut mitzuschicken, ist einer der häufigsten Wege, wie der Tokenverbrauch wächst, ohne dass es jemand so entschieden hätte.

Eine exakte Zahl braucht den eigenen Tokenizer des Modells

Eine Faustregel zu Token pro Wort ist eine Näherung für eine Sprache, verarbeitet von einem Tokenizer, und überträgt sich nicht auf eine andere Sprache, eine andere Schrift oder ein anderes Modell. Auch die Formatierung ändert die Zahl: Code, JSON und stark interpunktierter Text tokenisieren meist weniger effizient als dieselbe Information als schlichter Fließtext.

Wenn eine exakte Zahl wichtig ist — weil eine Anfrage nahe an einem Kontextlimit liegt oder weil Kosten genau vorhergesagt werden müssen —, ist die einzig verlässliche Methode, den tatsächlichen Text vor dem Senden durch den eigenen Tokenizer oder eine Zähl-Schnittstelle des jeweiligen Modells laufen zu lassen. Eine auf Wörtern oder Zeichen basierende Schätzung ist eine als Zahl verkleidete Vermutung.

Häufige Fragen

Ist ein Token dasselbe wie ein Wort?
Nein. Ein kurzes, gebräuchliches Wort ist oft ein Token, aber ein längeres oder selteneres Wort kann in mehrere zerfallen, und Satzzeichen, Leerzeichen und Zeilenumbrüche zählen selbst als Token. Tokenanzahl und Wortanzahl laufen bestenfalls lose parallel.
Warum benötigt derselbe Satz in verschiedenen Werkzeugen unterschiedlich viele Token?
Jedes Werkzeug meldet meist die Zählung aus dem Tokenizer eines bestimmten Modells, und jedes Modell hat sein eigenes, aus eigenem Trainingstext aufgebautes Vokabular. Eine für den Tokenizer eines Modells korrekte Zählung ist für ein anderes nur eine Schätzung.
Verbraucht Formatierung wie Code oder JSON mehr Token als reiner Text?
Oft ja. Einrückung, Satzzeichen und wiederholte Symbole sind selbst Token, sodass ein stark strukturiertes Format merklich mehr Token verbrauchen kann als dieselbe Information in schlichten Sätzen.
Wie finde ich die exakte Tokenzahl einer Anfrage, bevor ich sie sende?
Lassen Sie den genauen Text durch den eigenen Tokenizer des jeweiligen Modells oder eine von ihm bereitgestellte Zähl-Schnittstelle laufen. Jede auf Wort- oder Zeichenzahl basierende Schätzung ist ungefähr, und der Fehler wächst mit Unterschieden in Sprache, Schrift und Formatierung.

Ausprobieren statt darüber lesen

ClawAI zählt die tatsächlich verbrauchten Eingabe- und Ausgabe-Token einer Anfrage, sobald die Antwort erzeugt ist, und zeigt die Kosten und das dafür beanspruchte Guthaben zu dieser Antwort an, statt eine vorab geschätzte Zahl.