Thomas Henderikx

KI-Basiswissen

Modul 1 · Lektion 02

Was ist ein Token?

KI in 90 Sekunden

Warum rechnen KI-Anbieter eigentlich in „Tokens" – und nicht einfach in Wörtern oder Seiten?

Mit Klick wird das Video von YouTube geladen. Dabei wird eine Verbindung zu Google hergestellt. Mehr im Datenschutz.

Erklärung

Bevor ein Sprachmodell Text verarbeitet, wird dieser in kleinere Einheiten übersetzt. Diese Einheiten heißen Tokens.

Ein Token kann je nach Modell ein ganzes Wort sein, ein Teil eines Wortes, eine Zahl oder ein Satzzeichen. Wie genau ein Text zerlegt wird, hängt vom jeweiligen Tokenizer ab.

Das Modell arbeitet also nicht direkt mit unseren geschriebenen Wörtern oder einzelnen Buchstaben, sondern mit einer Folge solcher Tokens.

Deshalb beziehen sich beispielsweise Kontextlängen und häufig auch API-Kosten auf Tokens.

Beispiel

Text

  • Token 1
  • Token 2
  • Token 3
  • …
Ein Token kann z. B. ein Wort, Wortteil, eine Zahl oder ein Satzzeichen repräsentieren. Die genaue Zerlegung hängt vom Tokenizer ab.

Ein häufiges kurzes Wort kann als ein einzelnes Token dargestellt werden.

Ein seltenes oder lang zusammengesetztes Wort kann dagegen aus mehreren Tokens bestehen.

Das hilft auch zu erklären, warum Aufgaben wie „Wie viele Buchstaben hat dieses Wort?" für Sprachmodelle überraschend schwierig sein können: Ihre primäre Repräsentation des Textes besteht aus Tokens und nicht aus einer Liste einzelner Buchstaben.

Das heißt nicht, dass moderne Modelle niemals Buchstaben zählen können. Es erklärt aber, warum solche Aufgaben weniger selbstverständlich sind, als sie für uns wirken.

Warum ist das wichtig?

Tokens beeinflussen unter anderem, wie viel Kontext ein Modell verarbeiten kann und wie API-Nutzung häufig berechnet wird.