Das Context Window: das Arbeitsgedächtnis des Modells
# Das Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen →: das Arbeitsgedächtnis des Modells
Fügen Sie ein 40-seitiges PDF in Claude ein und bitten Sie um eine Zusammenfassung. Funktioniert sofort. Fügen Sie einen 900-seitigen Roman ein, und Sie laufen gegen eine Wand: „This message exceeds the maximum length.“ Gleiches Tool, gleicher Prompt, völlig anderes Ergebnis. Der Unterschied ist das Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen →, und sobald Sie es verstehen, ergibt die Hälfte des seltsamen Verhaltens von KI-Chatbots plötzlich Sinn.
Was Sie zuerst verstehen müssen
Ein LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen → (Large Language ModelLarge Language ModelA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →, die Technologie hinter ChatGPT, Claude und Gemini) hat kein Gedächtnis zwischen Konversationen. Wenn Sie einen neuen Chat starten, weiß das Modell nichts über den letzten. Es „erinnert“ sich nicht an Sie, wie es ein Kollege täte.
Alles, was das Modell während eines Chats „weiß“, liegt an einem Ort: im Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen →.
Stellen Sie sich das Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen → als das Arbeitsgedächtnis des Modells vor, wie die Schreibtischfläche vor Ihnen. Was auf den Tisch passt, kann das Modell sehen und nutzen. Was über die Kante fällt, ist weg.
Dazu gehören:
- Ihre Nachrichten
- Die Antworten des Modells
- Alle Dateien oder Texte, die Sie eingefügt haben
- Versteckte Systemanweisungen, die die App im Hintergrund hinzufügt
Alles liegt auf demselben Tisch. Und der Tisch hat eine feste Größe.
TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →: das Budget, das Sie ausgeben
Die Größe des Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen → wird in TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → gemessen, nicht in Wörtern.
Ein TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → ist ein Textstück. Grob gilt: 1 Token entspricht etwa 4 Zeichen oder drei Viertel eines Wortes. 100 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → sind also rund 75 Wörter.
Schnelle Beispiele:
- „cat“ = 1 TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →
- „unbelievable“ = oft 3 oder 4 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → (in Stücke zerlegt)
- Eine typische Textseite = etwa 500 bis 700 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →
Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen das selbst mit OpenAIs kostenlosem Tokenizer-Tool nachvollziehen. Fügen Sie beliebigen Text ein und beobachten Sie, wie ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → in farbige TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → zerfällt. Das ist der schnellste Weg, dieses Konzept zu begreifen.
Warum ist das relevant? Weil das Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen → ein Budget ist und TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → die Währung sind.
Anfang 2026 sehen typische Limits so aus:
- ChatGPT (Modelle der GPT-5-Klasse): rund 128.000 bis 256.000 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → je nach Tarif
- Claude (Sonnet und Opus 4.x): 200.000 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, mit einigen Enterprise-Optionen deutlich darüber
- Gemini 2.x: bis zu 1.000.000 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → oder mehr in einigen Versionen
Eine Million TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → klingt unendlich. Ist es nicht. Rechnen wir nach.
Warum das 40-seitige PDF funktioniert (und der Roman nicht)
Ein 40-seitiges PDF entspricht etwa 20.000 bis 28.000 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →. Werfen Sie das in ein 200.000-TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →-Window, und Sie haben vielleicht 12 Prozent des Tisches belegt. Reichlich Platz für Ihre Fragen und die Antworten des Modells.
Ein 900-seitiger Roman entspricht etwa 400.000 bis 500.000 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →. Das überläuft selbst ein 200.000-TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →-Window. Die App lehnt es ab, weil es physisch nicht auf den Tisch passt.
Das ist die praktische Regel:
> Wenn Ihr Inhalt ins Window passt, kann das Modell über alles auf einmal nachdenken. Wenn nicht, müssen Sie es aufteilen.
Wenn etwas zu groß ist, haben Sie diese Optionen:
1. In Chunks aufteilen und einen nach dem anderen verarbeiten.
2. Unterwegs zusammenfassen und Zusammenfassungen statt Volltext weitergeben.
3. Ein Modell mit größerem Window nutzen (genau dafür ist Geminis Million-TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →-Window bei riesigen Dokumenten nützlich).
Warum lange Chats den Anfang zu „vergessen“ beginnen
Hier ist das Verhalten, das die meisten Menschen verwirrt.
Sie sind 50 Nachrichten tief in einem langen Brainstorming-Chat. Sie bitten das Modell, ein Detail wiederzugeben, das Sie ganz am Anfang erwähnt haben. Es liegt falsch oder erfindet etwas.
Das Modell ist nicht faul. Der Anfang Ihrer Konversation ist vom Tisch gefallen.
Zur Erinnerung: Jede Nachricht, Ihre und die des Modells, verbraucht TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →-Budget. Eine lange Konversation fügt ständig TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → hinzu. Wenn die Summe das Window übersteigt, wird der älteste Inhalt hinausgedrängt, um Platz für den neuesten zu machen.
In einem sehr langen Chat sieht das Modell also möglicherweise buchstäblich nicht mehr, was Sie vor einer Stunde gesagt haben. Es ist nicht mehr im Arbeitsgedächtnis.
Ein einfaches mentales Modell:
[ CONTEXT WINDOW = 200,000 tokens ]
Earliest messages --> pushed out when full
...
Recent messages --> always visible
Your latest prompt --> always visibleDeshalb kann sich das Modell in langen Sitzungen auch selbst widersprechen. Die Anweisung, die Sie bei Nachricht 3 gegeben haben („antworte immer in britischem Englisch“), kann bei Nachricht 80 verschwunden sein.
„Aber ChatGPT erinnert sich über Chats hinweg an meinen Namen?“
Guter Punkt. Moderne Apps ergänzen Funktionen oberhalb des reinen Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen →:
- Memory (ChatGPT, Gemini): Die App speichert einige Fakten über Sie und fügt sie stillschweigend wieder in neue Chats ein.
- Projects (Claude, ChatGPT): ein gemeinsamer Bereich, in dem Anweisungen und Dateien über Konversationen hinweg bestehen bleiben.
Das ist nicht das Modell, das sich erinnert. Es ist die App, die Informationen jedes Mal erneut ins Context Window einspeist. Das Window bleibt das Einzige, was das Modell tatsächlich sieht.
Wissenscheck
1. Wie lässt sich die Rolle des Context Window für ein Sprachmodell am besten beschreiben?
2. Warum lässt sich ein 40-seitiges PDF problemlos zusammenfassen, während ein 900-seitiger Roman den Fehler „message exceeds maximum length“ auslöst?
3. Ein Kollege sagt: „Die KI wird sich an unser Gespräch von letzter Woche erinnern, wenn ich einen neuen Chat starte.“ Was ist laut Lektion die korrekte Richtigstellung?
4. Wählen Sie ALLE Elemente aus, die Platz im Context Window (dem „Schreibtisch“ des Modells) belegen.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE Aussagen aus, die laut Lektion korrekt wiedergeben, wie Tokens funktionieren.
Wählen Sie alle richtigen Antworten aus.
Wie Sie mit dem Window arbeiten, nicht gegen es
Sobald Sie TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → als Budget behandeln, treffen Sie bessere Entscheidungen. Hier die praktische Denkweise.
1. Für neue Themen neu anfangen
Schicken Sie nicht Ihre gesamte Woche durch einen endlosen Chat. Ein überladener Chat verschwendet Budget auf irrelevante Historie und erhöht die Verwechslungsgefahr. Neue Aufgabe, neuer Chat.
2. Wichtiges nach vorne holen
Platzieren Sie Ihre wichtigsten Anweisungen und Referenzmaterialien nahe an Ihrer eigentlichen Frage, nicht 40 Nachrichten weiter oben verschüttet. Wenn eine Regel wichtig ist, wiederholen Sie sie.
3. Den relevanten Teil einfügen, nicht alles
Sie müssen keinen kompletten 200-Seiten-Vertrag einfügen, um nach der KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →ündigungsklausel zu fragen. Fügen Sie die Klausel und etwas umgebenden Kontext ein. Weniger Rauschen, präzisere Antworten, niedrigere Kosten.
4. Zusammenfassen, um einen langen Chat zu „retten“
Wenn eine lange Konversation träge oder vergesslich wird, fragen Sie:
> „Fasse alles, was wir bisher entschieden haben, als Bulletpoint-Liste zusammen, die ich in einen neuen Chat einfügen kann.“
Starten Sie dann einen sauberen Chat mit dieser Zusammenfassung obenan. Sie haben Stunden Arbeit in ein paar hundert TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen → komprimiert.
5. Projects für laufende Arbeit nutzen
Wenn Sie immer wieder zum gleichen Material zurückkehren (ein Buchmanuskript, eine Produktspezifikation, ein Kundenaccount), legen Sie es in ein Project, damit es immer geladen ist, ohne erneutes Einfügen.
Ein konkretes Beispiel: Ihr Budget zählen
Wenn Sie mit der APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → arbeiten (der Entwicklerschnittstelle zu diesen Modellen), wird der TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →-Verbrauch direkt ausgewiesen. Auch Nicht-Entwickler profitieren davon, das einmal gesehen zu haben.
# pip install anthropic
import anthropic
client = anthropic.Anthropic() # verwendet Ihren API-Key
response = client.messages.create(
model="claude-sonnet-4-5",
max_tokens=300,
messages=[
{"role": "user", "content": "Summarize the causes of WWI in 5 bullets."}
],
)
print(response.content[0].text)
# Das Modell sagt Ihnen genau, wie viel Budget Sie verbraucht haben:
print("Input tokens:", response.usage.input_tokens)
print("Output tokens:", response.usage.output_tokens)input_tokens ist, was Sie gesendet haben (Ihr Prompt plus eingefügte Dateien). output_tokens ist, was das Modell zurückgeschrieben hat. Beides zählt gegen die Limits und, in bezahlten Tarifen, gegen die Kosten. Diese Zahlen zu beobachten macht das ganze Konzept greifbar.
Verbreitete Missverständnisse, ausgeräumt
„Ein größeres Context Window bedeutet ein intelligenteres Modell.“ Nein. Es bedeutet einen größeren Schreibtisch, nicht einen schärferen Verstand. Ein Modell mit einem riesigen Window kann trotzdem falsch lesen, was auf dem Tisch liegt.
„Das Modell liest mein gesamtes Dokument jedes Mal sorgfältig.“ Nicht ganz. Bei sehr großen Eingaben kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Modelle Details übersehen, die in der Mitte begraben sind, ein bekanntes Muster, das manchmal „lost in the middle“ genannt wird. Wichtige Anweisungen gehören an den Anfang oder das Ende Ihrer Eingabe.
„Wenn ich es einmal gesagt habe, weiß es das für immer.“ Nur innerhalb dieses Chats und nur, solange es im Window bleibt. Über Chats hinweg tragen es nur Memory oder Projects weiter.
Key Takeaways
- Das Context Window ist das Arbeitsgedächtnis des Modells. Alles, was das Modell „sehen“ kann (Ihre Nachrichten, seine Antworten, eingefügte Dateien), liegt dort, und es hat eine feste Größe, gemessen in TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →.
- Tokens sind ein Budget: grob 75 Wörter pro 100 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →. Ein 40-seitiges PDF passt leicht in ein 200.000-TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →-Window, ein ganzer Roman nicht.
- Lange Chats vergessen den Anfang, weil alte Nachrichten hinausgedrängt werden, wenn das Window voll wird. Wiederholen Sie wichtige Anweisungen und starten Sie für neue Themen neue Chats.
- Zusammenfassen, um Arbeit zu sichern: Bitten Sie das Modell, Ihre Entscheidungen als Bulletpoints festzuhalten, und fügen Sie das in einen sauberen Chat ein, um Budget zurückzugewinnen.
- Memory und Projects sind kein echtes Gedächtnis. Sie speisen Fakten in jeder Sitzung erneut ins Window ein. Nutzen Sie sie für Material, das Sie wiederverwenden, und fügen Sie für alles andere nur die relevanten Teile ein.
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Wichtige Anweisungen am Anfang oder Ende langer Inputs wiederholen
- Entscheidungen in Bullet Points zusammenfassen und in einen neuen Chat einfügen
- Token-Verbrauch mit dem Tokenizer gegen die Context-Limits planen
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- KIRichtiger Kontext, falsche Annahme: Was Morgan Stanley über Prompting im großen Maßstab gelernt hatDer Einsatz eines KI-Assistenten für die Finanzberater von Morgan Stanley hat ein Problem offengelegt, das die meisten Teams übersehen: Mehr Informationen für das Modell bedeuten keine besseren Antworten. Die eigentliche Disziplin besteht darin, auszuwählen, welcher Kontext zählt. Und dieser Unterschied verändert die Art, wie Sie Prompts bauen, von Grund auf.
- KIWas Context Windows für Ihre Arbeit wirklich bedeutenContext Windows bestimmen, wie viele Informationen ein KI-Modell in einer einzigen Sitzung halten und verarbeiten kann. Wer ihre Mechanik versteht, gestaltet Prompts anders, strukturiert Dokumente anders und entscheidet anders, wann er dem Output eines Modells traut.
- KIDie Juristin, die aufhörte, sich ChatGPT immer wieder zu erklärenDer Frust einer Wirtschaftsjuristin über KI-Tools, die zwischen den Sitzungen alles vergessen, hat still und leise eine ganze Welle von Fachleuten zu einer anderen Arbeitsweise gebracht. Der Wechsel von KI als Einmal-Tool zu KI mit dauerhaftem Kontext ist eine der am meisten unterschätzten Produktivitätsveränderungen der letzten zwei Jahre.