+160 XP

Die Gemini-Modellfamilie: Pro, Flash und wann Sie was einsetzen

# Die Gemini-Modellfamilie: Pro, Flash und wann Sie was einsetzen

Google liefert Gemini Pro für die schwerste, langsamste, reasoning-intensivste Arbeit und Gemini Flash für alles, was schnell und günstig sein muss, und beide sind von Grund auf nativ multimodal. Was einen Hobbyisten von jemandem unterscheidet, der zuverlässige KI-Features ausliefert, ist das Wissen, welches Modell wann und warum aufgerufen wird. Diese Entscheidung heißt *Model Routing*, und sie ist der größte Hebel, den Sie über Kosten, Latenz und Qualität von allem haben, was Sie auf Gemini bauen.

Zwei Stufen, eine Familie

Gemini ist eine Familie, kein einzelnes Modell. Die zwei Stufen, zu denen Sie ständig greifen werden:

  • Gemini Pro ist das Schwergewicht. Am besten bei mehrstufigem Reasoning, schwierigem Code, dichten Dokumenten, mehrdeutigen Anweisungen und Aufgaben, bei denen ein falscher Schritt alles Weitere vergiftet. Höhere Latenz, höherer Preis pro Token.
  • Gemini Flash ist das Arbeitspferd. Ausgelegt auf Durchsatz und niedrige Kosten. Es bewältigt den Großteil des realen Produktionstraffics: Klassifikation, Extraktion, Zusammenfassung, Routing, einfaches Entwerfen und Chat. Es gibt außerdem eine noch leichtere Flash-Stufe (Modelle im Flash-Lite-Stil) für die günstigsten Jobs mit hohem Volumen.

„Nativ multimodal“ ist der Teil, den die meisten zu wenig nutzen. Beide Stufen akzeptieren Text, Bilder, Audio, PDFs und Video *in derselben Anfrage*, nicht über ein aufgesetztes Vision-Modul. Sie können Flash einen Screenshot und eine Frage geben, und es liest beides als einen Input. Das werden Sie ständig nutzen.

Beide Stufen teilen außerdem Geminis prägendes Merkmal: ein sehr großes Kontextfenster. Wir reden je nach Modellversion von Hunderttausenden bis über einer Million Tokens. Das reicht, um eine komplette Codebase, einen langen Vertrag oder stundenlange Transkripte in einen einzigen Prompt zu packen. Langer Kontext ändert Ihre Architektur: Manchmal schlägt „einfach das ganze Dokument in den Prompt“ eine komplizierte Retrieval-Pipeline. (Mehr zu diesem Tradeoff weiter unten.)

Prüfen Sie aktuelle Modell-IDs, Kontextgrenzen und Preise immer in der Gemini-Modelldokumentation, denn Versionsnamen und Limits ändern sich schnell.

Die Routing-Entscheidung, konkret

Hier das mentale Modell. Fragen Sie: Braucht diese Aufgabe Reasoning oder nur Verarbeitung?

Betrachten Sie zwei Jobs am selben Support-Ticket.

Job A: „Fasse dieses Ticket in zwei Sätzen für die Queue zusammen.“

Hohes Volumen, geringe Tragweite, keine Argumentationskette. Das ist Flash. Es läuft tausendmal am Tag und niemand liest den Output nochmal.

Job B: „Lies dieses Ticket, die drei vorherigen Tickets des Kunden, unser Rückerstattungs-PDF und die Bestellhistorie, entscheide dann, ob der Kunde Anspruch auf Rückerstattung hat, zitiere die exakte Policy-Klausel und entwirf die Antwort.“

Mehrere Quellen, eine korrekt anzuwendende Policy, eine Entscheidung mit Geld dahinter und ein Zitat, das stimmen muss. Das ist Pro.

Die Falle ist, für beides ein Modell zu nutzen. Job A an Pro zu schicken verbrennt Geld und erhöht die Latenz ohne Qualitätsgewinn. Job B an Flash zu schicken riskiert eine selbstbewusst falsche Rückerstattungsentscheidung. Routen Sie pro Aufgabe, nicht pro App.

Ein gängiges Produktionsmuster ist eine Flash-first-Kaskade: Flash versucht die Aufgabe, und Sie eskalieren nur dann zu Pro, wenn eine günstige Confidence-Prüfung fehlschlägt oder die Aufgabe als besonders kritisch markiert ist.

python
from google import genai

client = genai.Client()  # liest GEMINI_API_KEY aus der Umgebung

def answer(question: str, complex_task: bool = False) -> str:
    model = "gemini-2.5-pro" if complex_task else "gemini-2.5-flash"
    resp = client.models.generate_content(
        model=model,
        contents=question,
    )
    return resp.text

print(answer("Summarize this ticket in two sentences: ..."))
print(answer("Decide refund eligibility and cite the policy clause: ...", complex_task=True))

Dieses complex_task-Flag ist der Punkt, an dem echte Systeme interessant werden. Sie können es aus einem schnellen Flash-Klassifikator setzen, aus Metadaten (Ticketwert, Kundenstufe) oder aus einer Regex auf Schlüsselwörter wie „refund“ oder „legal“. Die Routing-Logik ist Ihr Produkt, kein nachträglicher Gedanke.

Gemini API in 100 Seconds

Watch on YouTube

Langer Kontext vs. RAG: wann Sie Retrieval überspringen

RAG als Konzept kennen Sie bereits. Geminis langer Kontext erzwingt eine echte Architekturentscheidung, die Sie bei kleineren Modellen nicht hatten.

Wenn Ihr Wissen bequem ins Fenster passt und sich selten ändert, ist alles in den Prompt zu packen oft einfacher und genauer als eine Retrieval-Pipeline zu bauen. Kein Chunking, kein Embedding-Store, kein Relevanz-Tuning. Sie geben Pro den vollständigen 80-seitigen Vertrag und stellen Ihre Frage gegen das Ganze auf einmal.

Aber langer Kontext ist nicht gratis. Kosten skalieren mit Input-Tokens, und sehr lange Prompts erhöhen die Latenz. Die Faustregel lautet also:

  • Ein Dokument oder ein kleines festes Korpus, das wiederholt befragt wird? Langer Kontext. Kombinieren Sie ihn mit Context Caching (die API erlaubt es, ein großes gemeinsames Präfix zu cachen, sodass Sie nicht bei jedem Call erneut für die Verarbeitung desselben Dokuments zahlen).
  • Millionen von Dokumenten oder Inhalte, die sich ständig ändern? Dann gewinnt weiterhin RAG. Sie bekommen keine Wissensdatenbank in irgendein Fenster, und Sie wollen das auch nicht.

Die ehrliche Antwort für viele Produktionssysteme ist beides: RAG engt Millionen Dokumente auf die zehn relevantesten ein, und diese zehn übergeben Sie dann vollständig in das lange Kontextfenster statt aggressiv zu chunken. Langer Kontext macht Ihren Retrieval-Schritt weniger fragil.

Wo Sie Gemini tatsächlich betreiben

Dieselben Modelle tauchen über Googles Oberflächen hinweg auf. Wählen Sie die Oberfläche passend dazu, wie ernst die Arbeit ist.

Prototyping und schnelle Tools

Google AI Studio ist der Startpunkt. Web-UI mit Free-Tier, um Prompts zu testen, Flash und Pro nebeneinander zu vergleichen, Temperature und System Instructions zu justieren und den exakten API-Code für das Gebaute abzugreifen. Wenn ein Prompt in AI Studio funktioniert, exportieren Sie ihn per Klick.

Der Alltagsassistent

Die Gemini App ist der Assistent für Consumer und Workspace. Darin können Sie Gems bauen: gespeicherte, wiederverwendbare Assistenten mit eigenen Anweisungen und (in unterstützten Tarifen) eigenen Referenzdateien. Denken Sie an ein Gem als verpackten System-Prompt plus Kontext, den auch Nicht-Entwickler erstellen und teilen können. Ein Gem „Brand Voice Editor“ oder „Quarterly Report Analyst“ bedeutet, dass Ihr Team aufhört, immer wieder dieselben Anweisungen einzufügen.

In den Tools, die Sie ohnehin nutzen

Gemini in Google Workspace bringt die Modelle direkt in Docs, Gmail, Sheets, Slides, Meet und Drive. In Gmail entwerfen, ein Doc zusammenfassen, eine Tabelle in Sheets generieren, Meeting-Notizen in Meet bekommen. Für Automatisierung jenseits der UI können Sie mit Apps Script Gemini aus einer Tabelle oder einem Workspace-Workflow heraus mit wenigen Zeilen aufrufen.

Wissenscheck

1. Was ist „Model Routing“ und warum ist es beim Bauen auf Gemini relevant?

2. Die Lektion baut die Routing-Entscheidung um eine Kernfrage herum auf. Welche ist das?

3. Ein Team betreibt einen Job mit geringer Tragweite und hohem Volumen, tausende Male pro Tag: Support-Tickets in zwei Sätzen für eine Queue zusammenfassen, die niemand nochmal liest. Welches Modell passt am besten und warum?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE Aussagen, die korrekt beschreiben, wie Geminis native Multimodalität und das große Kontextfenster Ihre Bauweise verändern.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE Aufgaben, die die Lektion als typische Gemini-Flash-Workloads benennt.

Wählen Sie alle richtigen Antworten aus.

Grounding, damit das Modell aufhört zu raten

Ein rohes Modell antwortet aus Trainingsdaten, die veralten und Fakten erfinden. Grounding with Google Search verbindet einen Gemini-API-Call mit Live-Suchergebnissen, und die Antwort kommt mit belegenden Links zurück, die Sie Nutzern zeigen können. Schalten Sie es pro Anfrage ein, wenn Aktualität oder Überprüfbarkeit zählt (aktuelle Ereignisse, Preise, neue Dokumente). Lassen Sie es aus bei geschlossenen Aufgaben wie „schreib diesen Absatz um“.

python
from google import genai
from google.genai import types

client = genai.Client()

resp = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="What were the headline announcements at the most recent Google I/O?",
    config=types.GenerateContentConfig(
        tools=[types.Tool(google_search=types.GoogleSearch())]
    ),
)
print(resp.text)

Für Entwickler und Agents

  • [Gemini API](https://ai.google.dev/gemini-api/docs): die direkte programmatische Schnittstelle, die Grundlage für alles, was Sie ausliefern.
  • Gemini CLI: ein Open-Source-Agent, der in Ihrem Terminal läuft. Richten Sie ihn auf ein Repo und lassen Sie ihn erklären, refaktorieren oder mehrstufige Aufgaben auf Ihren Dateien ausführen.
  • Gemini Code Assist: Completions und Chat in Ihrer IDE und auf GitHub, auf Basis von Gemini-Modellen.
  • Agent Development Kit (ADK): ein Open-Source-Framework, um Multi-Agent-Systeme mit Tools, State und Orchestrierung zu bauen, statt Agent-Loops selbst zu stricken.

Für Produktionsmaßstab

Vertex AI ist der Enterprise-Weg auf Google Cloud: dieselben Gemini-Modelle mit IAM, Data-Residency-Kontrollen, höheren Quotas, Monitoring, Tuning und einem Weg, der den Einkauf zufriedenstellt. Die Faustregel: auf der Gemini API mit einem AI-Studio-Key prototypen, dann zu Vertex AI wechseln, wenn Sie Governance und Skalierung brauchen.

Eine echte Routing-Architektur

Setzen wir es zusammen. Stellen Sie sich einen internen „Deal Desk“-Assistenten vor, der Vertriebsverträge prüft.

1. Intake (Flash). Ein Nutzer lädt ein PDF hoch. Flash klassifiziert es: Vertrag, NDA oder Müll. Günstig, sofort, läuft auf allem.

2. Extraktion (Flash, multimodal). Bei Verträgen liest Flash das PDF direkt (kein separater OCR-Schritt) und zieht strukturierte Felder: Parteien, Wert, Laufzeit, anwendbares Recht.

3. Risikoprüfung (Pro, langer Kontext). Der vollständige Vertragstext plus Ihr Playbook-PDF gehen in Pro, das nicht-standardmäßige Klauseln markiert und jede davon erklärt, gegroundet auf Ihr Playbook. Das ist der Reasoning-Schritt, also rechtfertigt er den Pro-Preis.

4. Entwurf (Flash). Flash entwirft die Redline-Mail zurück an den Vertriebler auf Basis von Pros Ergebnissen.

5. Live-Fragen (Flash + Grounding). Der Vertriebler fragt „ist diese Gegenpartei in den Nachrichten?“, und ein gegroundeter Flash-Call antwortet mit Search-gestützten Links.

Ein Workflow, vier Modellaufrufe, und nur einer davon ist Pro. So sieht gutes Routing aus: teure Reasoning-Kapazität genau dort einsetzen, wo die Entscheidung zählt, und Flash das Volumen tragen lassen.

Key Takeaways

  • Routen Sie pro Aufgabe, nicht pro App. Fragen Sie „Reasoning oder Verarbeitung?“ Reasoning und hohe Tragweite gehen an Pro; Volumen, Extraktion und Entwürfe an Flash. Setzen Sie standardmäßig auf eine Flash-first-Kaskade und eskalieren Sie nur bei Bedarf.
  • Nutzen Sie native Multimodalität aus. Schicken Sie PDFs, Bilder und Audio direkt in dieselbe Anfrage, statt separate OCR- oder Transkriptionsschritte anzuflanschen. Flash bewältigt das meiste davon problemlos.
  • Behandeln Sie langen Kontext als Architekturentscheidung. Packen Sie ein einzelnes Dokument direkt ins Fenster (mit Context Caching), statt RAG zu bauen, das Sie nicht brauchen, aber behalten Sie RAG für große oder sich schnell ändernde Korpora und kombinieren Sie beides.
  • Passen Sie die Oberfläche an die Tragweite an. Prototypen in AI Studio, Features auf der Gemini API ausliefern, wiederverwendbare Assistenten als Gems verpacken und zu Vertex AI wechseln, wenn Sie Governance und Skalierung brauchen.
  • Schalten Sie Grounding ein, wenn Wahrheit und Aktualität zählen, und lassen Sie es bei geschlossenen, in sich abgeschlossenen Aufgaben aus, um Latenz und Kosten zu sparen.

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Standardmäßig eine Flash-first-Kaskade nutzen und nur dort auf Pro eskalieren, wo Entscheidungen zählen
  • PDFs, Bilder, Audio und Video native in einer einzigen Anfrage senden
  • Einzelne große Artefakte in den Long Context legen und RAG für große Korpora reservieren
  • Die Surface an den Einsatz anpassen: AI Studio, API, Gems, dann Vertex AI
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.