Tokens, Training und Inference: Was passiert, wenn Sie Enter drücken
# TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, Training und Inference: Was passiert, wenn Sie Enter drücken
Tippen Sie "Paris ist die Hauptstadt von" in ChatGPT, Claude oder Gemini, und mit hoher Wahrscheinlichkeit folgt "Frankreich". Warum das Modell das tut, behandeln wir im Detail in 'Was ein Modell wirklich tut: Vorhersage, nicht Verstehen.'
Schauen wir unter die Haube. Drei Konzepte erklären die gesamte PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →: TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, Training und Inference.
Schritt 1: TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → (wie das Modell liest)
Ein Large Language ModelLarge Language ModelA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen → (LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →) liest Wörter nicht so, wie Sie es tun. Es zerlegt Text in TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →: kleine Bausteine, die oft ganze Wörter sind, manchmal aber nur Wortteile.
Hier die klassische Überraschung. Das Wort "strawberry" ist für das Modell keine Einheit. Es wird meist als etwas wie "straw" + "berry" gelesen. Deshalb hatten Modelle historisch Mühe, die Buchstaben in "strawberry" zu zählen: Sie haben die einzelnen Buchstaben nie gesehen, nur die Bausteine.
Eine grobe Daumenregel für Englisch: 1 Token entspricht etwa 4 Zeichen oder rund 3/4 eines Wortes. 100 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → sind also etwa 75 Wörter.
Ein paar schnelle Beispiele, wie Text aufgeteilt wird:
- "cat" → 1 TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →
- "unbelievable" → "un" + "believ" + "able" (3 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →)
- "GPT-4" → "G" + "PT" + "-" + "4" (mehrere TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →)
- Ein Leerzeichen vor einem Wort ist meist Teil des TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → (" France" ist etwas anderes als "France")
Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen sich das mit dem kostenlosen Tokenizer-Tool von OpenAI selbst ansehen. Fügen Sie einen Satz ein und beobachten Sie, wie ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → in farbige Bausteine zerlegt wird.
Warum TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → für Sie relevant sind
TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → sind die Einheit für Preise und Limits. Wenn ein Tool von einem "Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen → von 200.000 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →" spricht, heißt das, dass rund 150.000 Wörter in eine einzige Konversation passen. Wenn eine APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → "3 $ pro Million Input-TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →" verlangt, zählt sie diese Bausteine, nicht Wörter.
Praktische Konsequenz: KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →ürzere Prompts kosten weniger und passen besser. Und seltsames Verhalten bei Rechtschreibung, Reimen oder Buchstabenzählen lässt sich oft auf die Tokenisierung zurückführen.
Schritt 2: Training (wie das Modell gelernt hat)
Bevor Sie überhaupt etwas eingetippt haben, hat das Modell ein Training durchlaufen: einen langen, teuren Prozess des Lernens aus enormen Textmengen (Bücher, Websites, Code, Artikel).
Die Kernaufgabe ist erschreckend einfach. Dem Modell wird eine Textsequenz gezeigt, bei der das letzte TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → verdeckt ist, und es muss das nächste Token vorhersagen.
Zeigen Sie ihm "The sky is", und es lernt, "blue" vorherzusagen. Zeigen Sie ihm "2 + 2 =", und es lernt, "4" vorherzusagen. Wiederholen Sie das über Billionen TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, Milliarden Mal, und das Modell justiert langsam seine internen Einstellungen (genannt Parameter, die Zahlen, die es anpasst), um besser zu raten.
Niemand hat die Regel "Paris gehört zu Frankreich" von Hand einprogrammiert. Das Modell hat dieses Muster Millionen Mal in seinen Trainingstexten gesehen und die statistische Verbindung selbst gelernt.
Zwei Phasen, die Sie kennen sollten
Training hat zwei Hauptphasen:
1. Pre-Training: Das Modell liest den riesigen Textberg und lernt die Vorhersage des nächsten TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →. Daraus entsteht ein "rohes" Modell, das viel weiß, aber nicht besonders hilfreich oder höflich ist.
2. Fine-Tuning und Alignment: Menschen und automatisiertes Feedback bringen dem Modell bei, Anweisungen zu folgen, hilfreich zu sein und schädliche Antworten zu vermeiden. Das macht aus einem Textvorhersager ChatGPT.
Deshalb haben Modelle auch einen Knowledge Cutoff. Das Training fand zu einem festen Zeitpunkt statt, also kennt ein Modell Ereignisse nach diesem Datum möglicherweise nicht, sofern es nicht im Web suchen kann. 2026 bieten ChatGPT, Claude und Gemini alle eine Live-Websuche, um diese Lücke zu schließen, aber das Basiswissen bleibt zum Trainingszeitpunkt eingefroren.
Schritt 3: Inference (was passiert, wenn Sie Enter drücken)
Inference ist der Moment der Nutzung: Das Modell hat das Lernen abgeschlossen und macht jetzt in Echtzeit Vorhersagen für Sie.
Hier die vollständige Abfolge, wenn Sie Enter drücken:
1. Ihr Prompt wird in TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → zerlegt.
2. Das Modell liest diese TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → und sagt das wahrscheinlichste nächste Token vorher.
3. Es hängt dieses TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → an die Sequenz an und sagt dann das nächste vorher.
4. Es wiederholt das, TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → für TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, bis es entscheidet, dass die Antwort fertig ist.
Dieses wortweise Streaming, das Sie im Interface sehen? Das ist buchstäblich das Modell, das ein TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → generiert, dann das nächste, dann das nächste. Sie beobachten Inference live.
Warum Sie auf denselben Prompt unterschiedliche Antworten erhalten
Würde das Modell immer das eine wahrscheinlichste TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → wählen, wäre es repetitiv und roboterhaft. Deshalb gibt es eine Einstellung namens Temperature, die kontrollierte Zufälligkeit hinzufügt.
- Niedrige Temperature (nahe 0): vorhersehbar, fokussiert, reproduzierbar. Gut für faktische Aufgaben, Code, Datenextraktion.
- Hohe Temperature (nahe 1 oder darüber): abwechslungsreich, kreativ, überraschend. Gut für Brainstorming, Story-Ideen, Werbetexte.
Deshalb liefert die Frage "gib mir einen Slogan für mein Café" zweimal gestellt zwei verschiedene Slogans. Die Zufälligkeit ist ein Feature, kein Bug.
Inference im Code sehen
Wenn Sie die PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen → konkret sehen wollen, hier ein kurzes, ausführbares Beispiel mit der OpenAI APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →. (Sie brauchen einen APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →-Key; dasselbe Prinzip funktioniert mit den APIs von Anthropics Claude und Googles Gemini.)
from openai import OpenAI
client = OpenAI() # nutzt Ihren API-Key
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "user", "content": "Paris is the capital of"}
],
temperature=0, # nahe null = wahrscheinlichstes Token, sehr vorhersehbar
max_tokens=5 # begrenzt die Antwort auf wenige Tokens
)
print(response.choices[0].message.content)
# Erwartete Ausgabe: FranceZwei Dinge fallen auf. temperature=0 sagt dem Modell, auf Sicherheit zu spielen und die wahrscheinlichste Fortsetzung zu wählen. max_tokens=5 begrenzt die Antwortlänge in TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, nicht in Wörtern, was direkt zu Schritt 1 zurückführt.
Wissenscheck
1. Warum hatten Sprachmodelle historisch Mühe, die Buchstaben in einem Wort wie 'strawberry' zu zählen?
2. Ein Tool wirbt mit einem 'Context Window von 200.000 Tokens'. Was sagt Ihnen das praktisch?
3. Was ist laut Lektion die Kernaufgabe, die das Modell während des Trainings lernt?
4. Wählen Sie ALLE korrekten Aussagen zu Tokens und ihrer Bedeutung.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE praktischen Konsequenzen, die sich korrekt aus der Funktionsweise der Tokenisierung ergeben.
Wählen Sie alle richtigen Antworten aus.
Alles zusammen: die komplette PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →
Verfolgen wir einen echten Prompt von Anfang bis Ende. Sie tippen:
> "Fasse diese E-Mail in einem Satz zusammen: [fügt eine lange E-Mail ein]"
1. TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →: Ihre Anweisung plus die gesamte E-Mail wird in TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → zerhackt. Eine E-Mail mit 500 Wörtern entspricht etwa 650 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →.
2. Training (längst erledigt): Das Modell hat vor langer Zeit aus unzähligen Beispielen gelernt, was "zusammenfassen" bedeutet und wie Zusammenfassungen aufgebaut sind.
3. Inference: Das Modell liest all diese TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → und generiert eine Zusammenfassung in einem Satz, TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → für TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, bis es einen natürlichen Endpunkt erreicht.
Kein Nachschlagen. Nur sehr, sehr gute Vorhersage des nächsten TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, geformt durch Training und angetrieben durch Inference.
Warum dieses mentale Modell Sie im Umgang mit KI besser macht
Sobald Sie das Modell als Vorhersager des nächsten TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → sehen, fällt eine Menge praktischer Ratschläge an ihren Platz:
- Geben Sie Kontext von Anfang an mit. Das Modell sagt ausschließlich auf Basis der TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → vorher, die vor ihm liegen. Wenn Sie die E-Mail nicht einfügen, kann es sie nicht zusammenfassen. Es gibt kein verstecktes Gedächtnis für Ihre Dateien.
- Beispiele steuern Vorhersagen. Zeigen Sie dem Modell zwei Beispielzusammenfassungen in Ihrem bevorzugten Stil, schiebt es das in Richtung genau dieses Stils. Deshalb funktioniert "zeigen, nicht nur sagen" in Prompts so gut.
- Seien Sie spezifisch, um die Vermutungen einzuengen. "Schreib einen Tweet" lässt die Vorhersage völlig offen. "Schreib einen Tweet mit 280 Zeichen, freundlicher Ton, ein Emoji, keine Hashtags" schränkt scharf ein, was als Nächstes kommt.
- Halluzinationen sind zu selbstsichere Vorhersagen. Wenn das Modell eine erfundene Quelle produziert, sagt es Text vorher, der auf Basis von Mustern richtig *aussieht*, auch wenn ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → nicht stimmt. Deshalb prüfen Sie alles nach, was wichtig ist.
Für eine tiefere, aber noch gut lesbare Erklärung ist der Wikipedia-Artikel zu Large Language Models eine solide, kostenlose Referenz, die einigermaßen verständlich bleibt.
Key Takeaways
- Das Modell liest in Tokens, nicht in Wörtern. Etwa 4 Zeichen pro TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →. Das bestimmt Preise, Kontextlimits und Eigenheiten wie das Verzählen der Buchstaben in "strawberry". Probieren Sie das Tokenizer-Tool einmal aus, um es konkret zu machen.
- Training ist Vorhersage des nächsten Tokens in gigantischem Maßstab. Das Modell hat Muster wie "Paris → Frankreich" gelernt, indem es über Billionen TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → den nächsten Baustein geraten hat, nicht durch das Auswendiglernen einer Faktendatenbank.
- Inference ist das, was läuft, wenn Sie Enter drücken: ein TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → nach dem anderen vorhergesagt und an Sie zurückgestreamt. Die wortweise Live-Ausgabe ist die Vorhersage in Echtzeit.
- Setzen Sie Temperature bewusst ein. Niedrig für faktische, reproduzierbare Arbeit; hoch für kreatives Brainstorming.
- Füttern Sie das Modell mit Kontext und Beispielen. Es sagt nur aus den TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → vorher, die Sie ihm geben, also liefern spezifische Prompts mit klaren Beispielen präzisere, nützlichere Antworten.
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Spezifische Prompts mit Beispielen, Rollen und Formatvorgaben schreiben
- Temperature niedrig setzen für faktische Arbeit, hoch für kreatives Brainstorming
- Token-Verbrauch mit dem Tokenizer gegen die Context-Limits planen
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- KIKI-Ausgaben pro Mitarbeiter sinken: Effizienzgewinn oder Adoptionsstau?Die KI-Ausgaben pro Mitarbeiter sind bei führenden Unternehmen im August 2026 gesunken, was Gerede über eine Abkühlung ausgelöst hat. Die tatsächliche Lage ist komplizierter, und interessanter, als Optimisten und Pessimisten zugeben wollen.
- KIWas Context Windows für Ihre Arbeit wirklich bedeutenContext Windows bestimmen, wie viele Informationen ein KI-Modell in einer einzigen Sitzung halten und verarbeiten kann. Wer ihre Mechanik versteht, gestaltet Prompts anders, strukturiert Dokumente anders und entscheidet anders, wann er dem Output eines Modells traut.
- KIWas mit Ihren Geschäftsdaten wirklich passiert, wenn sie in ein KI-Modell gelangenEinen Vertrag, eine Kundenliste oder interne Finanzzahlen in ein KI-Tool zu geben, fühlt sich an wie die Nutzung einer Suchmaschine. Das ist es nicht, und der Unterschied hat reale rechtliche und wettbewerbliche Folgen.