+140 XP

Tokens, Training und Inference: Was passiert, wenn Sie Enter drücken

# Tokens, Training und Inference: Was passiert, wenn Sie Enter drücken

Tippen Sie "Paris ist die Hauptstadt von" in ChatGPT, Claude oder Gemini, und mit hoher Wahrscheinlichkeit folgt "Frankreich". Warum das Modell das tut, behandeln wir im Detail in 'Was ein Modell wirklich tut: Vorhersage, nicht Verstehen.'

Schauen wir unter die Haube. Drei Konzepte erklären die gesamte Pipeline: Tokens, Training und Inference.

Schritt 1: Tokens (wie das Modell liest)

Ein Large Language Model (LLM) liest Wörter nicht so, wie Sie es tun. Es zerlegt Text in Tokens: kleine Bausteine, die oft ganze Wörter sind, manchmal aber nur Wortteile.

Hier die klassische Überraschung. Das Wort "strawberry" ist für das Modell keine Einheit. Es wird meist als etwas wie "straw" + "berry" gelesen. Deshalb hatten Modelle historisch Mühe, die Buchstaben in "strawberry" zu zählen: Sie haben die einzelnen Buchstaben nie gesehen, nur die Bausteine.

Eine grobe Daumenregel für Englisch: 1 Token entspricht etwa 4 Zeichen oder rund 3/4 eines Wortes. 100 Tokens sind also etwa 75 Wörter.

Ein paar schnelle Beispiele, wie Text aufgeteilt wird:

  • "cat" → 1 Token
  • "unbelievable" → "un" + "believ" + "able" (3 Tokens)
  • "GPT-4" → "G" + "PT" + "-" + "4" (mehrere Tokens)
  • Ein Leerzeichen vor einem Wort ist meist Teil des Tokens (" France" ist etwas anderes als "France")

Sie können sich das mit dem kostenlosen Tokenizer-Tool von OpenAI selbst ansehen. Fügen Sie einen Satz ein und beobachten Sie, wie er in farbige Bausteine zerlegt wird.

Warum Tokens für Sie relevant sind

Tokens sind die Einheit für Preise und Limits. Wenn ein Tool von einem "Context Window von 200.000 Tokens" spricht, heißt das, dass rund 150.000 Wörter in eine einzige Konversation passen. Wenn eine API "3 $ pro Million Input-Tokens" verlangt, zählt sie diese Bausteine, nicht Wörter.

Praktische Konsequenz: Kürzere Prompts kosten weniger und passen besser. Und seltsames Verhalten bei Rechtschreibung, Reimen oder Buchstabenzählen lässt sich oft auf die Tokenisierung zurückführen.

Schritt 2: Training (wie das Modell gelernt hat)

Bevor Sie überhaupt etwas eingetippt haben, hat das Modell ein Training durchlaufen: einen langen, teuren Prozess des Lernens aus enormen Textmengen (Bücher, Websites, Code, Artikel).

Die Kernaufgabe ist erschreckend einfach. Dem Modell wird eine Textsequenz gezeigt, bei der das letzte Token verdeckt ist, und es muss das nächste Token vorhersagen.

Zeigen Sie ihm "The sky is", und es lernt, "blue" vorherzusagen. Zeigen Sie ihm "2 + 2 =", und es lernt, "4" vorherzusagen. Wiederholen Sie das über Billionen Tokens, Milliarden Mal, und das Modell justiert langsam seine internen Einstellungen (genannt Parameter, die Zahlen, die es anpasst), um besser zu raten.

Niemand hat die Regel "Paris gehört zu Frankreich" von Hand einprogrammiert. Das Modell hat dieses Muster Millionen Mal in seinen Trainingstexten gesehen und die statistische Verbindung selbst gelernt.

Zwei Phasen, die Sie kennen sollten

Training hat zwei Hauptphasen:

1. Pre-Training: Das Modell liest den riesigen Textberg und lernt die Vorhersage des nächsten Tokens. Daraus entsteht ein "rohes" Modell, das viel weiß, aber nicht besonders hilfreich oder höflich ist.

2. Fine-Tuning und Alignment: Menschen und automatisiertes Feedback bringen dem Modell bei, Anweisungen zu folgen, hilfreich zu sein und schädliche Antworten zu vermeiden. Das macht aus einem Textvorhersager ChatGPT.

Deshalb haben Modelle auch einen Knowledge Cutoff. Das Training fand zu einem festen Zeitpunkt statt, also kennt ein Modell Ereignisse nach diesem Datum möglicherweise nicht, sofern es nicht im Web suchen kann. 2026 bieten ChatGPT, Claude und Gemini alle eine Live-Websuche, um diese Lücke zu schließen, aber das Basiswissen bleibt zum Trainingszeitpunkt eingefroren.

Schritt 3: Inference (was passiert, wenn Sie Enter drücken)

Inference ist der Moment der Nutzung: Das Modell hat das Lernen abgeschlossen und macht jetzt in Echtzeit Vorhersagen für Sie.

Hier die vollständige Abfolge, wenn Sie Enter drücken:

1. Ihr Prompt wird in Tokens zerlegt.

2. Das Modell liest diese Tokens und sagt das wahrscheinlichste nächste Token vorher.

3. Es hängt dieses Token an die Sequenz an und sagt dann das nächste vorher.

4. Es wiederholt das, Token für Token, bis es entscheidet, dass die Antwort fertig ist.

Dieses wortweise Streaming, das Sie im Interface sehen? Das ist buchstäblich das Modell, das ein Token generiert, dann das nächste, dann das nächste. Sie beobachten Inference live.

Warum Sie auf denselben Prompt unterschiedliche Antworten erhalten

Würde das Modell immer das eine wahrscheinlichste Token wählen, wäre es repetitiv und roboterhaft. Deshalb gibt es eine Einstellung namens Temperature, die kontrollierte Zufälligkeit hinzufügt.

  • Niedrige Temperature (nahe 0): vorhersehbar, fokussiert, reproduzierbar. Gut für faktische Aufgaben, Code, Datenextraktion.
  • Hohe Temperature (nahe 1 oder darüber): abwechslungsreich, kreativ, überraschend. Gut für Brainstorming, Story-Ideen, Werbetexte.

Deshalb liefert die Frage "gib mir einen Slogan für mein Café" zweimal gestellt zwei verschiedene Slogans. Die Zufälligkeit ist ein Feature, kein Bug.

Inference im Code sehen

Wenn Sie die Pipeline konkret sehen wollen, hier ein kurzes, ausführbares Beispiel mit der OpenAI API. (Sie brauchen einen API-Key; dasselbe Prinzip funktioniert mit den APIs von Anthropics Claude und Googles Gemini.)

python
from openai import OpenAI

client = OpenAI()  # nutzt Ihren API-Key

response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "user", "content": "Paris is the capital of"}
    ],
    temperature=0,        # nahe null = wahrscheinlichstes Token, sehr vorhersehbar
    max_tokens=5          # begrenzt die Antwort auf wenige Tokens
)

print(response.choices[0].message.content)
# Erwartete Ausgabe: France

Zwei Dinge fallen auf. temperature=0 sagt dem Modell, auf Sicherheit zu spielen und die wahrscheinlichste Fortsetzung zu wählen. max_tokens=5 begrenzt die Antwortlänge in Tokens, nicht in Wörtern, was direkt zu Schritt 1 zurückführt.

Wissenscheck

1. Warum hatten Sprachmodelle historisch Mühe, die Buchstaben in einem Wort wie 'strawberry' zu zählen?

2. Ein Tool wirbt mit einem 'Context Window von 200.000 Tokens'. Was sagt Ihnen das praktisch?

3. Was ist laut Lektion die Kernaufgabe, die das Modell während des Trainings lernt?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE korrekten Aussagen zu Tokens und ihrer Bedeutung.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE praktischen Konsequenzen, die sich korrekt aus der Funktionsweise der Tokenisierung ergeben.

Wählen Sie alle richtigen Antworten aus.

Alles zusammen: die komplette Pipeline

Verfolgen wir einen echten Prompt von Anfang bis Ende. Sie tippen:

> "Fasse diese E-Mail in einem Satz zusammen: [fügt eine lange E-Mail ein]"

1. Tokens: Ihre Anweisung plus die gesamte E-Mail wird in Tokens zerhackt. Eine E-Mail mit 500 Wörtern entspricht etwa 650 Tokens.

2. Training (längst erledigt): Das Modell hat vor langer Zeit aus unzähligen Beispielen gelernt, was "zusammenfassen" bedeutet und wie Zusammenfassungen aufgebaut sind.

3. Inference: Das Modell liest all diese Tokens und generiert eine Zusammenfassung in einem Satz, Token für Token, bis es einen natürlichen Endpunkt erreicht.

Kein Nachschlagen. Nur sehr, sehr gute Vorhersage des nächsten Tokens, geformt durch Training und angetrieben durch Inference.

Warum dieses mentale Modell Sie im Umgang mit KI besser macht

Sobald Sie das Modell als Vorhersager des nächsten Tokens sehen, fällt eine Menge praktischer Ratschläge an ihren Platz:

  • Geben Sie Kontext von Anfang an mit. Das Modell sagt ausschließlich auf Basis der Tokens vorher, die vor ihm liegen. Wenn Sie die E-Mail nicht einfügen, kann es sie nicht zusammenfassen. Es gibt kein verstecktes Gedächtnis für Ihre Dateien.
  • Beispiele steuern Vorhersagen. Zeigen Sie dem Modell zwei Beispielzusammenfassungen in Ihrem bevorzugten Stil, schiebt es das in Richtung genau dieses Stils. Deshalb funktioniert "zeigen, nicht nur sagen" in Prompts so gut.
  • Seien Sie spezifisch, um die Vermutungen einzuengen. "Schreib einen Tweet" lässt die Vorhersage völlig offen. "Schreib einen Tweet mit 280 Zeichen, freundlicher Ton, ein Emoji, keine Hashtags" schränkt scharf ein, was als Nächstes kommt.
  • Halluzinationen sind zu selbstsichere Vorhersagen. Wenn das Modell eine erfundene Quelle produziert, sagt es Text vorher, der auf Basis von Mustern richtig *aussieht*, auch wenn er nicht stimmt. Deshalb prüfen Sie alles nach, was wichtig ist.

Für eine tiefere, aber noch gut lesbare Erklärung ist der Wikipedia-Artikel zu Large Language Models eine solide, kostenlose Referenz, die einigermaßen verständlich bleibt.

Key Takeaways

  • Das Modell liest in Tokens, nicht in Wörtern. Etwa 4 Zeichen pro Token. Das bestimmt Preise, Kontextlimits und Eigenheiten wie das Verzählen der Buchstaben in "strawberry". Probieren Sie das Tokenizer-Tool einmal aus, um es konkret zu machen.
  • Training ist Vorhersage des nächsten Tokens in gigantischem Maßstab. Das Modell hat Muster wie "Paris → Frankreich" gelernt, indem es über Billionen Tokens den nächsten Baustein geraten hat, nicht durch das Auswendiglernen einer Faktendatenbank.
  • Inference ist das, was läuft, wenn Sie Enter drücken: ein Token nach dem anderen vorhergesagt und an Sie zurückgestreamt. Die wortweise Live-Ausgabe ist die Vorhersage in Echtzeit.
  • Setzen Sie Temperature bewusst ein. Niedrig für faktische, reproduzierbare Arbeit; hoch für kreatives Brainstorming.
  • Füttern Sie das Modell mit Kontext und Beispielen. Es sagt nur aus den Tokens vorher, die Sie ihm geben, also liefern spezifische Prompts mit klaren Beispielen präzisere, nützlichere Antworten.

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Spezifische Prompts mit Beispielen, Rollen und Formatvorgaben schreiben
  • Temperature niedrig setzen für faktische Arbeit, hoch für kreatives Brainstorming
  • Token-Verbrauch mit dem Tokenizer gegen die Context-Limits planen
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.