+140 XP

Das Context Window: das Arbeitsgedächtnis des Modells

# Das Context Window: das Arbeitsgedächtnis des Modells

Fügen Sie ein 40-seitiges PDF in Claude ein und bitten Sie um eine Zusammenfassung. Funktioniert sofort. Fügen Sie einen 900-seitigen Roman ein, und Sie laufen gegen eine Wand: „This message exceeds the maximum length.“ Gleiches Tool, gleicher Prompt, völlig anderes Ergebnis. Der Unterschied ist das Context Window, und sobald Sie es verstehen, ergibt die Hälfte des seltsamen Verhaltens von KI-Chatbots plötzlich Sinn.

Was Sie zuerst verstehen müssen

Ein LLM (Large Language Model, die Technologie hinter ChatGPT, Claude und Gemini) hat kein Gedächtnis zwischen Konversationen. Wenn Sie einen neuen Chat starten, weiß das Modell nichts über den letzten. Es „erinnert“ sich nicht an Sie, wie es ein Kollege täte.

Alles, was das Modell während eines Chats „weiß“, liegt an einem Ort: im Context Window.

Stellen Sie sich das Context Window als das Arbeitsgedächtnis des Modells vor, wie die Schreibtischfläche vor Ihnen. Was auf den Tisch passt, kann das Modell sehen und nutzen. Was über die Kante fällt, ist weg.

Dazu gehören:

  • Ihre Nachrichten
  • Die Antworten des Modells
  • Alle Dateien oder Texte, die Sie eingefügt haben
  • Versteckte Systemanweisungen, die die App im Hintergrund hinzufügt

Alles liegt auf demselben Tisch. Und der Tisch hat eine feste Größe.

Tokens: das Budget, das Sie ausgeben

Die Größe des Context Window wird in Tokens gemessen, nicht in Wörtern.

Ein Token ist ein Textstück. Grob gilt: 1 Token entspricht etwa 4 Zeichen oder drei Viertel eines Wortes. 100 Tokens sind also rund 75 Wörter.

Schnelle Beispiele:

  • „cat“ = 1 Token
  • „unbelievable“ = oft 3 oder 4 Tokens (in Stücke zerlegt)
  • Eine typische Textseite = etwa 500 bis 700 Tokens

Sie können das selbst mit OpenAIs kostenlosem Tokenizer-Tool nachvollziehen. Fügen Sie beliebigen Text ein und beobachten Sie, wie er in farbige Tokens zerfällt. Das ist der schnellste Weg, dieses Konzept zu begreifen.

Warum ist das relevant? Weil das Context Window ein Budget ist und Tokens die Währung sind.

Anfang 2026 sehen typische Limits so aus:

  • ChatGPT (Modelle der GPT-5-Klasse): rund 128.000 bis 256.000 Tokens je nach Tarif
  • Claude (Sonnet und Opus 4.x): 200.000 Tokens, mit einigen Enterprise-Optionen deutlich darüber
  • Gemini 2.x: bis zu 1.000.000 Tokens oder mehr in einigen Versionen

Eine Million Tokens klingt unendlich. Ist es nicht. Rechnen wir nach.

Warum das 40-seitige PDF funktioniert (und der Roman nicht)

Ein 40-seitiges PDF entspricht etwa 20.000 bis 28.000 Tokens. Werfen Sie das in ein 200.000-Token-Window, und Sie haben vielleicht 12 Prozent des Tisches belegt. Reichlich Platz für Ihre Fragen und die Antworten des Modells.

Ein 900-seitiger Roman entspricht etwa 400.000 bis 500.000 Tokens. Das überläuft selbst ein 200.000-Token-Window. Die App lehnt es ab, weil es physisch nicht auf den Tisch passt.

Das ist die praktische Regel:

> Wenn Ihr Inhalt ins Window passt, kann das Modell über alles auf einmal nachdenken. Wenn nicht, müssen Sie es aufteilen.

Wenn etwas zu groß ist, haben Sie diese Optionen:

1. In Chunks aufteilen und einen nach dem anderen verarbeiten.

2. Unterwegs zusammenfassen und Zusammenfassungen statt Volltext weitergeben.

3. Ein Modell mit größerem Window nutzen (genau dafür ist Geminis Million-Token-Window bei riesigen Dokumenten nützlich).

Warum lange Chats den Anfang zu „vergessen“ beginnen

Hier ist das Verhalten, das die meisten Menschen verwirrt.

Sie sind 50 Nachrichten tief in einem langen Brainstorming-Chat. Sie bitten das Modell, ein Detail wiederzugeben, das Sie ganz am Anfang erwähnt haben. Es liegt falsch oder erfindet etwas.

Das Modell ist nicht faul. Der Anfang Ihrer Konversation ist vom Tisch gefallen.

Zur Erinnerung: Jede Nachricht, Ihre und die des Modells, verbraucht Token-Budget. Eine lange Konversation fügt ständig Tokens hinzu. Wenn die Summe das Window übersteigt, wird der älteste Inhalt hinausgedrängt, um Platz für den neuesten zu machen.

In einem sehr langen Chat sieht das Modell also möglicherweise buchstäblich nicht mehr, was Sie vor einer Stunde gesagt haben. Es ist nicht mehr im Arbeitsgedächtnis.

Ein einfaches mentales Modell:

[ CONTEXT WINDOW = 200,000 tokens ]

Earliest messages  -->  pushed out when full
   ...
Recent messages    -->  always visible
Your latest prompt -->  always visible

Deshalb kann sich das Modell in langen Sitzungen auch selbst widersprechen. Die Anweisung, die Sie bei Nachricht 3 gegeben haben („antworte immer in britischem Englisch“), kann bei Nachricht 80 verschwunden sein.

„Aber ChatGPT erinnert sich über Chats hinweg an meinen Namen?“

Guter Punkt. Moderne Apps ergänzen Funktionen oberhalb des reinen Context Window:

  • Memory (ChatGPT, Gemini): Die App speichert einige Fakten über Sie und fügt sie stillschweigend wieder in neue Chats ein.
  • Projects (Claude, ChatGPT): ein gemeinsamer Bereich, in dem Anweisungen und Dateien über Konversationen hinweg bestehen bleiben.

Das ist nicht das Modell, das sich erinnert. Es ist die App, die Informationen jedes Mal erneut ins Context Window einspeist. Das Window bleibt das Einzige, was das Modell tatsächlich sieht.

Wissenscheck

1. Wie lässt sich die Rolle des Context Window für ein Sprachmodell am besten beschreiben?

2. Warum lässt sich ein 40-seitiges PDF problemlos zusammenfassen, während ein 900-seitiger Roman den Fehler „message exceeds maximum length“ auslöst?

3. Ein Kollege sagt: „Die KI wird sich an unser Gespräch von letzter Woche erinnern, wenn ich einen neuen Chat starte.“ Was ist laut Lektion die korrekte Richtigstellung?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE Elemente aus, die Platz im Context Window (dem „Schreibtisch“ des Modells) belegen.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE Aussagen aus, die laut Lektion korrekt wiedergeben, wie Tokens funktionieren.

Wählen Sie alle richtigen Antworten aus.

Wie Sie mit dem Window arbeiten, nicht gegen es

Sobald Sie Tokens als Budget behandeln, treffen Sie bessere Entscheidungen. Hier die praktische Denkweise.

1. Für neue Themen neu anfangen

Schicken Sie nicht Ihre gesamte Woche durch einen endlosen Chat. Ein überladener Chat verschwendet Budget auf irrelevante Historie und erhöht die Verwechslungsgefahr. Neue Aufgabe, neuer Chat.

2. Wichtiges nach vorne holen

Platzieren Sie Ihre wichtigsten Anweisungen und Referenzmaterialien nahe an Ihrer eigentlichen Frage, nicht 40 Nachrichten weiter oben verschüttet. Wenn eine Regel wichtig ist, wiederholen Sie sie.

3. Den relevanten Teil einfügen, nicht alles

Sie müssen keinen kompletten 200-Seiten-Vertrag einfügen, um nach der Kündigungsklausel zu fragen. Fügen Sie die Klausel und etwas umgebenden Kontext ein. Weniger Rauschen, präzisere Antworten, niedrigere Kosten.

4. Zusammenfassen, um einen langen Chat zu „retten“

Wenn eine lange Konversation träge oder vergesslich wird, fragen Sie:

> „Fasse alles, was wir bisher entschieden haben, als Bulletpoint-Liste zusammen, die ich in einen neuen Chat einfügen kann.“

Starten Sie dann einen sauberen Chat mit dieser Zusammenfassung obenan. Sie haben Stunden Arbeit in ein paar hundert Tokens komprimiert.

5. Projects für laufende Arbeit nutzen

Wenn Sie immer wieder zum gleichen Material zurückkehren (ein Buchmanuskript, eine Produktspezifikation, ein Kundenaccount), legen Sie es in ein Project, damit es immer geladen ist, ohne erneutes Einfügen.

Ein konkretes Beispiel: Ihr Budget zählen

Wenn Sie mit der API arbeiten (der Entwicklerschnittstelle zu diesen Modellen), wird der Token-Verbrauch direkt ausgewiesen. Auch Nicht-Entwickler profitieren davon, das einmal gesehen zu haben.

python
# pip install anthropic
import anthropic

client = anthropic.Anthropic()  # verwendet Ihren API-Key

response = client.messages.create(
    model="claude-sonnet-4-5",
    max_tokens=300,
    messages=[
        {"role": "user", "content": "Summarize the causes of WWI in 5 bullets."}
    ],
)

print(response.content[0].text)

# Das Modell sagt Ihnen genau, wie viel Budget Sie verbraucht haben:
print("Input tokens:", response.usage.input_tokens)
print("Output tokens:", response.usage.output_tokens)

input_tokens ist, was Sie gesendet haben (Ihr Prompt plus eingefügte Dateien). output_tokens ist, was das Modell zurückgeschrieben hat. Beides zählt gegen die Limits und, in bezahlten Tarifen, gegen die Kosten. Diese Zahlen zu beobachten macht das ganze Konzept greifbar.

Verbreitete Missverständnisse, ausgeräumt

„Ein größeres Context Window bedeutet ein intelligenteres Modell.“ Nein. Es bedeutet einen größeren Schreibtisch, nicht einen schärferen Verstand. Ein Modell mit einem riesigen Window kann trotzdem falsch lesen, was auf dem Tisch liegt.

„Das Modell liest mein gesamtes Dokument jedes Mal sorgfältig.“ Nicht ganz. Bei sehr großen Eingaben können Modelle Details übersehen, die in der Mitte begraben sind, ein bekanntes Muster, das manchmal „lost in the middle“ genannt wird. Wichtige Anweisungen gehören an den Anfang oder das Ende Ihrer Eingabe.

„Wenn ich es einmal gesagt habe, weiß es das für immer.“ Nur innerhalb dieses Chats und nur, solange es im Window bleibt. Über Chats hinweg tragen es nur Memory oder Projects weiter.

Key Takeaways

  • Das Context Window ist das Arbeitsgedächtnis des Modells. Alles, was das Modell „sehen“ kann (Ihre Nachrichten, seine Antworten, eingefügte Dateien), liegt dort, und es hat eine feste Größe, gemessen in Tokens.
  • Tokens sind ein Budget: grob 75 Wörter pro 100 Tokens. Ein 40-seitiges PDF passt leicht in ein 200.000-Token-Window, ein ganzer Roman nicht.
  • Lange Chats vergessen den Anfang, weil alte Nachrichten hinausgedrängt werden, wenn das Window voll wird. Wiederholen Sie wichtige Anweisungen und starten Sie für neue Themen neue Chats.
  • Zusammenfassen, um Arbeit zu sichern: Bitten Sie das Modell, Ihre Entscheidungen als Bulletpoints festzuhalten, und fügen Sie das in einen sauberen Chat ein, um Budget zurückzugewinnen.
  • Memory und Projects sind kein echtes Gedächtnis. Sie speisen Fakten in jeder Sitzung erneut ins Window ein. Nutzen Sie sie für Material, das Sie wiederverwenden, und fügen Sie für alles andere nur die relevanten Teile ein.

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Wichtige Anweisungen am Anfang oder Ende langer Inputs wiederholen
  • Entscheidungen in Bullet Points zusammenfassen und in einen neuen Chat einfügen
  • Token-Verbrauch mit dem Tokenizer gegen die Context-Limits planen
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.