+130 XP

Worin LLMs stark sind (und worin nicht)

# Worin llms stark sind (und worin nicht)

Fragen Sie ChatGPT, Claude oder Gemini, wie oft der Buchstabe „r" in „strawberry" vorkommt, und die Chance ist real, dass die Antwort „zwei" lautet. Richtig ist drei. Das ist ein Modell, das eine juristische Zusammenfassung entwerfen, Quantentunneln erklären und funktionierenden Code schreiben kann, und doch stolpert es über etwas, das ein Sechsjähriger richtig macht.

Dieser Widerspruch ist die ganze Lektion. Sobald Sie verstehen, *warum* das passiert, können Sie vorhersagen, wo diese Werkzeuge glänzen und wo sie still versagen.

Kurz dazu, was ein LLM eigentlich tut

LLM steht für „large language model". Es ist der Motor hinter ChatGPT, Claude und Gemini. Einfach gesagt: ein System, das darauf trainiert ist, den wahrscheinlichsten nächsten Textbaustein vorherzusagen, auf Basis von Mustern in sehr großen Textmengen.

Es ist kein Taschenrechner. Es ist keine Datenbank. Es ist ein sehr ausgefeilter Muster-Vervollständiger für Sprache.

Behalten Sie diesen einen Gedanken im Kopf, und das meiste Verhalten hört auf, überraschend zu sein.

Das Strawberry-Problem, erklärt

LLMs lesen Buchstaben nicht so wie Sie. Bevor sie Ihren Text verarbeiten, zerlegen sie ihn in Tokens: Textbausteine, oft ganze Wörter oder Wortteile. „Strawberry" wird vielleicht zu einem oder zwei Tokens, nicht zu sieben einzelnen Buchstaben.

Wenn Sie also nach der Anzahl der „r" fragen, arbeitet das Modell mit einer unscharfen, vorzerlegten Version des Wortes. Es hat die Buchstaben nie einzeln gesehen. Es rät auf Basis von Mustern, und Raten ist genau das falsche Werkzeug für eine exakte Zählung.

Derselbe blinde Fleck zeigt sich bei:

  • Exakter Arithmetik mit großen Zahlen (48.271 × 9.330)
  • Zählen von Wörtern, Zeichen oder Einträgen in einer langen Liste
  • Allem, was präzise, mechanische Buchführung erfordert

Probieren Sie das aus und beobachten Sie, wie es danebengreift:

> „Wie viele Wörter enthält dieser Satz, und wie viele beginnen mit einem Vokal?"

Oft kommt eine selbstbewusste, falsche Zahl.

Die Lösung: geben Sie ihm Werkzeuge

Aktuelle Versionen von ChatGPT, Claude und Gemini können im Hintergrund Code ausführen oder einen Taschenrechner aufrufen. Wenn sie das tun, steigt die Genauigkeit sprunghaft, weil die eigentliche Rechnung von einem echten Computer erledigt wird und nicht durch Musterraten.

Wenn Sie ein Modell mit Code-Fähigkeit haben, erzwingt dieser Prompt den zuverlässigen Weg:

Count the letter "r" in "strawberry" by writing and running 
Python code, then show me the result.
python
word = "strawberry"
print(word.count("r"))  # 3

Die Lehre: Wenn Sie eine exakte Zahl brauchen, bitten Sie das Modell, *ein Werkzeug zu benutzen*, oder erledigen Sie diesen Schritt selbst.

Wo LLMs wirklich glänzen

Jetzt die gute Nachricht. Dieselbe Muster-Vervollständigung, die beim Zählen scheitert, ist bei Spracharbeit *brillant*. Das sind die Gewinne, auf die Sie täglich setzen sollten.

Umschreiben und Tonalität ändern

Das ist wohl der nützlichste Einsatz von LLMs überhaupt. Fügen Sie holprigen Text ein und verlangen Sie einen bestimmten Ton.

> „Schreib diese E-Mail wärmer und kürzer und streich die Entschuldigung am Anfang."

Es gibt hier keine einzelne „richtige" Antwort, und genau deshalb läuft das Modell zu Hochform auf. Es mischt Sprache neu, es berechnet keinen Fakt.

Zusammenfassen

Werfen Sie einen langen Artikel, ein Transkript oder einen Thread hinein und fragen Sie nach dem Kern.

> „Fass diesen 2.000-Wörter-Report in 5 Bullet Points zusammen, die eine vielbeschäftigte Führungskraft interessieren."

Darin ist es sehr gut. Denken Sie nur daran: Es kann gelegentlich ein Detail weglassen oder verzerren, prüfen Sie also jede Zahl und jeden Namen, auf den es ankommt.

Brainstorming und Entwürfe

Beim leeren Blatt wirken LLMs wie Magie. Namen, Gliederungen, Blickwinkel, erste Entwürfe.

> „Gib mir 10 Betreffzeilen für eine Webinar-Einladung zu KI für Steuerberater. Mische neugierig, direkt und leicht verspielt."

Sie fragen nicht nach *der* richtigen Antwort. Sie fragen nach vielen plausiblen Optionen, auf die Sie reagieren können. Das ist das Heimspiel des Modells.

Ein sauberer Entwurfs-Gewinn, direkt nebeneinander

Hier der Kontrast, der die ganze Landschaft abbildet.

Der Fehlschlag (Präzisionsaufgabe):

> „Wie viele r in strawberry?" → „Es sind zwei r." (Falsch.)

Der Gewinn (Sprachaufgabe):

> „Mach aus diesen groben Notizen ein höfliches Kunden-Update in 3 Sätzen: Projekt verzögert, neuer Termin 14. März, überarbeiteter Plan folgt Freitag."

> → „Hallo Sarah, ich möchte kurz darauf hinweisen, dass sich der Projektzeitplan verschoben hat; unser neuer Zieltermin ist der 14. März. Wir stellen gerade einen überarbeiteten Plan zusammen und schicken ihn Ihnen bis Freitag. Danke für Ihre Geduld, und melden Sie sich gerne bei Fragen."

Gleiches Werkzeug, gleiche Minute. Das eine ist eine Vermutung, die sich als Fakt ausgibt. Das andere ist genau das, wofür diese Systeme gebaut wurden.

Das Muster, das Sie sich merken sollten

Es gibt einen einfachen Test dafür, ob eine Aufgabe den Stärken eines LLM entgegenkommt.

Spielt den Stärken zu: Die Aufgabe hat viele akzeptable Antworten, und „gut genug und flüssig" ist das Ziel. Umschreiben, Zusammenfassen, Erklären, Brainstorming, Übersetzen, Entwerfen.

Spielt den Schwächen zu: Die Aufgabe hat genau eine richtige Antwort, die von präzisem Zählen, Rechnen oder aktuellen Fakten abhängt. Mathematik, Zeichenzählungen, Live-Daten, exakte Quellenangaben.

Wenn Sie im Bereich „eine richtige Antwort" sind, geben Sie dem Modell entweder ein Werkzeug oder prüfen Sie das Ergebnis selbst.

Why Can't ChatGPT Count the R's in Strawberry?

Watch on YouTube

Wissenscheck

1. Was beschreibt laut Lektion am genauesten, was ein LLM grundsätzlich tut?

2. Warum zählt ein LLM den Buchstaben „r" in „strawberry" oft falsch?

3. Sie brauchen von einem LLM ein exaktes Ergebnis für „48.271 × 9.330". Was ist laut Lektion der beste Ansatz?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE Aufgaben aus, die die Lektion als blinde Flecken nennt, bei denen LLMs ohne Werkzeuge typischerweise scheitern.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE Aussagen, die die Argumentation der Lektion zu Erfolg und Scheitern von LLMs korrekt wiedergeben.

Wählen Sie alle richtigen Antworten aus.

Die andere große Schwäche: selbstbewusst falsche Antworten

Wir gehen darauf in der Lektion zu Halluzinationen tiefer ein, aber es gehört auch hierher. Eine Halluzination ist, wenn ein LLM etwas Falsches mit voller Überzeugung behauptet: ein erfundenes Zitat, eine erfundene Statistik, ein Gerichtsfall, den es nie gab.

Das ist kein Lügen. Das Modell macht seinen Job und sagt plausibel klingenden Text vorher, und „plausibel" ist nicht dasselbe wie „wahr".

Die riskantesten Aufgaben verbinden zwei Merkmale:

1. Es gibt eine präzise, überprüfbare Antwort.

2. Das Modell hat kein Werkzeug, um sie zu prüfen.

Deshalb sind „Wie hoch ist die Einwohnerzahl von Lyon 2026?" oder „Nenne drei peer-reviewte Studien zu X" Gefahrenzonen. Das Modell erfindet bereitwillig eine sauber aussehende Antwort.

Praktische Verteidigung

Nutzen Sie das Modell für die *Form* der Arbeit und prüfen Sie die *Fakten*.

> „Entwirf einen Absatz über die Vorteile von Remote-Arbeit. Markiere jede konkrete Statistik mit [VERIFY], damit ich weiß, was ich prüfen muss."

Die meisten aktuellen Modelle kennzeichnen auf Nachfrage, wo sie unsicher sind. Sie können auch die Websuche aktivieren (verfügbar in ChatGPT, Claude und Gemini), damit Faktenaussagen an echte, anklickbare Quellen gebunden werden.

Für eine tiefergehende, kostenlose Lektüre dazu, wie diese Systeme funktionieren und wo sie danebenliegen, ist der Kurs Elements of AI ein hervorragender, jargonarmer Einstieg.

Wie Sie Ihre Arbeit danach strukturieren

Sie müssen keine Liste auswendig lernen. Sortieren Sie einfach jede Aufgabe, bevor Sie prompten.

Schritt 1: Benennen Sie den Aufgabentyp. Ist das eine *Sprach*-Aufgabe (umschreiben, zusammenfassen, Brainstorming) oder eine *Präzisions*-Aufgabe (zählen, rechnen, Fakten finden)?

Schritt 2: Passen Sie das Vorgehen an.

  • Sprachaufgabe → frei prompten, iterieren, die beste Version auswählen.
  • Präzisionsaufgabe → das Modell bitten, ein Werkzeug zu nutzen (Code, Taschenrechner, Websuche), oder diesen Teil selbst erledigen.

Schritt 3: Prüfen Sie, was prüfbar ist. Zahlen, Namen, Daten und Zitate bekommen einen kurzen zweiten Blick. Ton und Formulierung brauchen das nicht.

Ein kombinierter Prompt, der jede Stärke richtig einsetzt:

Summarize the attached sales notes into 4 bullets for my boss. 
For any total or percentage, calculate it using code and double 
check it. Flag anything you're unsure about with [VERIFY].

Das übergibt die Spracharbeit dem Modell und die Mathematik einem Werkzeug, in einem Zug. Das ist die Haltung: Lassen Sie das LLM Sprache machen, und vertrauen Sie ihm standardmäßig nie als Taschenrechner oder Enzyklopädie.

Wichtigste Erkenntnisse

  • LLMs sagen Sprache vorher, sie berechnen keine Fakten. Deshalb treffen sie beim Umschreiben ins Schwarze und stolpern beim Zählen der „r" in „strawberry".
  • Setzen Sie auf sie bei Sprachaufgaben: umschreiben, zusammenfassen, Brainstorming, entwerfen, übersetzen. Jede Aufgabe mit vielen akzeptablen Antworten ist eine Stärke.
  • Seien Sie vorsichtig bei Präzisionsaufgaben: exakte Mathematik, Zählen, Live-Daten und Quellenangaben. Sagen Sie dem Modell, es soll ein Werkzeug nutzen, oder prüfen Sie selbst.
  • Erzwingen Sie den zuverlässigen Weg per Prompt. Verlangen Sie „use code" für Mathematik, aktivieren Sie die Websuche für Fakten und fordern Sie [VERIFY]-Markierungen für alles Prüfbare.
  • Prüfen Sie, was prüfbar ist, und entspannen Sie beim Rest. Zahlen, Namen und Daten doppelt checken; Ton und Formulierung laufen lassen.

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Ordnen Sie jede Aufgabe vor dem Prompten als Sprachaufgabe oder Präzisionsaufgabe ein
  • Alle Quellenangaben, Zahlen, Daten, Namen und kritischen Aussagen gegen die Quellen prüfen
  • Weisen Sie das Modell an, für Mathematik Tools und für Fakten die Websuche zu nutzen
  • Fordern Sie [VERIFY]-Markierungen für alle überprüfbaren Aussagen im Output
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.