Dein Smartphone kann auch das nächste Wort vorschlagen. Warum kann ChatGPT dann Texte zusammenfassen, übersetzen, programmieren oder Argumente vergleichen?
Mit Klick wird das Video von YouTube geladen. Dabei wird eine Verbindung zu Google hergestellt. Mehr im Datenschutz.
Erklärung
Auf einer sehr abstrakten Ebene steckt tatsächlich eine ähnliche Grundidee dahinter: Eine plausible Fortsetzung vorhersagen.
Aber moderne Sprachmodelle unterscheiden sich massiv in Architektur, Größenordnung, Trainingsverfahren und darin, wie viel Kontext sie berücksichtigen können.
Um über sehr unterschiedliche Texte hinweg gute Vorhersagen zu treffen, entstehen im Modell interne Repräsentationen von Beziehungen und Strukturen.
Dadurch kann Next-Token-Prediction zu Fähigkeiten führen, die weit über das hinausgehen, was wir normalerweise unter Autovervollständigung verstehen.
Beispiel
Plausible Fortsetzungen vorhersagen
Wortvorhersage
- kurzer Kontext
- einfache Fortsetzungen
modernes Sprachmodell
- viel Kontext
- komplexe gelernte Beziehungen
- dadurch deutlich komplexere Aufgaben möglich
Eine Handy-Tastatur erkennt vielleicht: „Guten Morgen, wie …" und schlägt „geht" vor.
Ein modernes Sprachmodell kann dagegen einen langen Vertrag lesen, bestimmte Klauseln miteinander vergleichen und daraus eine strukturierte Zusammenfassung erzeugen.
Das zugrunde liegende Generationsprinzip bleibt die schrittweise Vorhersage von Tokens.
Die dafür gelernten internen Strukturen sind aber wesentlich komplexer.
Warum ist das wichtig?
Das einfache Grundprinzip darf nicht mit einfachen Fähigkeiten verwechselt werden. Aus ihm können in großen Modellen wesentlich komplexere Verhaltensweisen entstehen.
