Die Gemini-Modellfamilie: Pro, Flash und wann Sie was einsetzen
# Die Gemini-Modellfamilie: Pro, Flash und wann Sie was einsetzen
Google liefert Gemini Pro für die schwerste, langsamste, reasoning-intensivste Arbeit und Gemini Flash für alles, was schnell und günstig sein muss, und beide sind von Grund auf nativ multimodal. Was einen Hobbyisten von jemandem unterscheidet, der zuverlässige KI-Features ausliefert, ist das Wissen, welches Modell wann und warum aufgerufen wird. Diese Entscheidung heißt *Model Routing*, und sie ist der größte Hebel, den Sie über Kosten, Latenz und Qualität von allem haben, was Sie auf Gemini bauen.
Zwei Stufen, eine Familie
Gemini ist eine Familie, kein einzelnes Modell. Die zwei Stufen, zu denen Sie ständig greifen werden:
- Gemini Pro ist das Schwergewicht. Am besten bei mehrstufigem Reasoning, schwierigem Code, dichten Dokumenten, mehrdeutigen Anweisungen und Aufgaben, bei denen ein falscher Schritt alles Weitere vergiftet. Höhere Latenz, höherer Preis pro TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →.
- Gemini Flash ist das Arbeitspferd. Ausgelegt auf Durchsatz und niedrige Kosten. Es bewältigt den Großteil des realen Produktionstraffics: Klassifikation, Extraktion, Zusammenfassung, Routing, einfaches Entwerfen und Chat. Es gibt außerdem eine noch leichtere Flash-Stufe (Modelle im Flash-Lite-Stil) für die günstigsten Jobs mit hohem Volumen.
„Nativ multimodal“ ist der Teil, den die meisten zu wenig nutzen. Beide Stufen akzeptieren Text, Bilder, Audio, PDFs und Video *in derselben Anfrage*, nicht über ein aufgesetztes Vision-Modul. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Flash einen Screenshot und eine Frage geben, und es liest beides als einen Input. Das werden Sie ständig nutzen.
Beide Stufen teilen außerdem Geminis prägendes Merkmal: ein sehr großes Kontextfenster. Wir reden je nach Modellversion von Hunderttausenden bis über einer Million TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →. Das reicht, um eine komplette Codebase, einen langen Vertrag oder stundenlange Transkripte in einen einzigen Prompt zu packen. Langer Kontext ändert Ihre Architektur: Manchmal schlägt „einfach das ganze Dokument in den Prompt“ eine komplizierte Retrieval-PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →. (Mehr zu diesem Tradeoff weiter unten.)
Prüfen Sie aktuelle Modell-IDs, Kontextgrenzen und Preise immer in der Gemini-Modelldokumentation, denn Versionsnamen und Limits ändern sich schnell.
Die Routing-Entscheidung, konkret
Hier das mentale Modell. Fragen Sie: Braucht diese Aufgabe Reasoning oder nur Verarbeitung?
Betrachten Sie zwei Jobs am selben Support-Ticket.
Job A: „Fasse dieses Ticket in zwei Sätzen für die Queue zusammen.“
Hohes Volumen, geringe Tragweite, keine Argumentationskette. Das ist Flash. Es läuft tausendmal am Tag und niemand liest den Output nochmal.
Job B: „Lies dieses Ticket, die drei vorherigen Tickets des Kunden, unser Rückerstattungs-PDF und die Bestellhistorie, entscheide dann, ob der Kunde Anspruch auf Rückerstattung hat, zitiere die exakte Policy-Klausel und entwirf die Antwort.“
Mehrere Quellen, eine korrekt anzuwendende Policy, eine Entscheidung mit Geld dahinter und ein Zitat, das stimmen muss. Das ist Pro.
Die Falle ist, für beides ein Modell zu nutzen. Job A an Pro zu schicken verbrennt Geld und erhöht die Latenz ohne Qualitätsgewinn. Job B an Flash zu schicken riskiert eine selbstbewusst falsche Rückerstattungsentscheidung. Routen Sie pro Aufgabe, nicht pro App.
Ein gängiges Produktionsmuster ist eine Flash-first-Kaskade: Flash versucht die Aufgabe, und Sie eskalieren nur dann zu Pro, wenn eine günstige Confidence-Prüfung fehlschlägt oder die Aufgabe als besonders kritisch markiert ist.
from google import genai
client = genai.Client() # liest GEMINI_API_KEY aus der Umgebung
def answer(question: str, complex_task: bool = False) -> str:
model = "gemini-2.5-pro" if complex_task else "gemini-2.5-flash"
resp = client.models.generate_content(
model=model,
contents=question,
)
return resp.text
print(answer("Summarize this ticket in two sentences: ..."))
print(answer("Decide refund eligibility and cite the policy clause: ...", complex_task=True))Dieses complex_task-Flag ist der Punkt, an dem echte Systeme interessant werden. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen es aus einem schnellen Flash-Klassifikator setzen, aus Metadaten (Ticketwert, Kundenstufe) oder aus einer Regex auf Schlüsselwörter wie „refund“ oder „legal“. Die Routing-Logik ist Ihr Produkt, kein nachträglicher Gedanke.
Gemini API in 100 Seconds
Langer Kontext vs. RAG: wann Sie Retrieval überspringen
RAG als Konzept kennen Sie bereits. Geminis langer Kontext erzwingt eine echte Architekturentscheidung, die Sie bei kleineren Modellen nicht hatten.
Wenn Ihr Wissen bequem ins Fenster passt und sich selten ändert, ist alles in den Prompt zu packen oft einfacher und genauer als eine Retrieval-Pipeline zu bauen. Kein Chunking, kein EmbeddingEmbeddingAn embedding is a numerical vector that represents data (text, images, or items) in a way that captures meaning, so similar items sit close together in space.Vollständige Definition ansehen →-Store, kein Relevanz-Tuning. Sie geben Pro den vollständigen 80-seitigen Vertrag und stellen Ihre Frage gegen das Ganze auf einmal.
Aber langer Kontext ist nicht gratis. Kosten skalieren mit Input-TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, und sehr lange Prompts erhöhen die Latenz. Die Faustregel lautet also:
- Ein Dokument oder ein kleines festes Korpus, das wiederholt befragt wird? Langer Kontext. Kombinieren Sie ihn mit Context Caching (die APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → erlaubt es, ein großes gemeinsames Präfix zu cachen, sodass Sie nicht bei jedem Call erneut für die Verarbeitung desselben Dokuments zahlen).
- Millionen von Dokumenten oder Inhalte, die sich ständig ändern? Dann gewinnt weiterhin RAG. Sie bekommen keine Wissensdatenbank in irgendein Fenster, und Sie wollen das auch nicht.
Die ehrliche Antwort für viele Produktionssysteme ist beides: RAG engt Millionen Dokumente auf die zehn relevantesten ein, und diese zehn übergeben Sie dann vollständig in das lange Kontextfenster statt aggressiv zu chunken. Langer Kontext macht Ihren Retrieval-Schritt weniger fragil.
Wo Sie Gemini tatsächlich betreiben
Dieselben Modelle tauchen über Googles Oberflächen hinweg auf. Wählen Sie die Oberfläche passend dazu, wie ernst die Arbeit ist.
Prototyping und schnelle Tools
Google AI Studio ist der Startpunkt. Web-UI mit Free-Tier, um Prompts zu testen, Flash und Pro nebeneinander zu vergleichen, Temperature und System Instructions zu justieren und den exakten APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →-Code für das Gebaute abzugreifen. Wenn ein Prompt in AI Studio funktioniert, exportieren Sie ihn per Klick.
Der Alltagsassistent
Die Gemini App ist der Assistent für Consumer und Workspace. Darin kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie Gems bauen: gespeicherte, wiederverwendbare Assistenten mit eigenen Anweisungen und (in unterstützten Tarifen) eigenen Referenzdateien. Denken Sie an ein Gem als verpackten System-Prompt plus Kontext, den auch Nicht-Entwickler erstellen und teilen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Ein Gem „Brand Voice Editor“ oder „Quarterly Report Analyst“ bedeutet, dass Ihr Team aufhört, immer wieder dieselben Anweisungen einzufügen.
In den Tools, die Sie ohnehin nutzen
Gemini in Google Workspace bringt die Modelle direkt in Docs, Gmail, Sheets, Slides, Meet und Drive. In Gmail entwerfen, ein Doc zusammenfassen, eine Tabelle in Sheets generieren, Meeting-Notizen in Meet bekommen. Für Automatisierung jenseits der UI kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie mit Apps Script Gemini aus einer Tabelle oder einem Workspace-Workflow heraus mit wenigen Zeilen aufrufen.
Wissenscheck
1. Was ist „Model Routing“ und warum ist es beim Bauen auf Gemini relevant?
2. Die Lektion baut die Routing-Entscheidung um eine Kernfrage herum auf. Welche ist das?
3. Ein Team betreibt einen Job mit geringer Tragweite und hohem Volumen, tausende Male pro Tag: Support-Tickets in zwei Sätzen für eine Queue zusammenfassen, die niemand nochmal liest. Welches Modell passt am besten und warum?
4. Wählen Sie ALLE Aussagen, die korrekt beschreiben, wie Geminis native Multimodalität und das große Kontextfenster Ihre Bauweise verändern.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE Aufgaben, die die Lektion als typische Gemini-Flash-Workloads benennt.
Wählen Sie alle richtigen Antworten aus.
Grounding, damit das Modell aufhört zu raten
Ein rohes Modell antwortet aus Trainingsdaten, die veralten und Fakten erfinden. Grounding with Google Search verbindet einen Gemini-APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →-Call mit Live-Suchergebnissen, und die Antwort kommt mit belegenden Links zurück, die Sie Nutzern zeigen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Schalten Sie es pro Anfrage ein, wenn Aktualität oder Überprüfbarkeit zählt (aktuelle Ereignisse, Preise, neue Dokumente). Lassen Sie es aus bei geschlossenen Aufgaben wie „schreib diesen Absatz um“.
from google import genai
from google.genai import types
client = genai.Client()
resp = client.models.generate_content(
model="gemini-2.5-flash",
contents="What were the headline announcements at the most recent Google I/O?",
config=types.GenerateContentConfig(
tools=[types.Tool(google_search=types.GoogleSearch())]
),
)
print(resp.text)Für Entwickler und Agents
- [Gemini API](https://ai.google.dev/gemini-api/docs): die direkte programmatische Schnittstelle, die Grundlage für alles, was Sie ausliefern.
- Gemini CLI: ein Open-Source-Agent, der in Ihrem Terminal läuft. Richten Sie ihn auf ein Repo und lassen Sie ihn erklären, refaktorieren oder mehrstufige Aufgaben auf Ihren Dateien ausführen.
- Gemini Code Assist: Completions und Chat in Ihrer IDE und auf GitHub, auf Basis von Gemini-Modellen.
- Agent Development Kit (ADK): ein Open-Source-Framework, um Multi-Agent-Systeme mit Tools, State und Orchestrierung zu bauen, statt Agent-Loops selbst zu stricken.
Für Produktionsmaßstab
Vertex AI ist der Enterprise-Weg auf Google Cloud: dieselben Gemini-Modelle mit IAM, Data-Residency-Kontrollen, höheren Quotas, Monitoring, Tuning und einem Weg, der den Einkauf zufriedenstellt. Die Faustregel: auf der Gemini APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → mit einem AI-Studio-Key prototypen, dann zu Vertex AI wechseln, wenn Sie Governance und Skalierung brauchen.
Eine echte Routing-Architektur
Setzen wir es zusammen. Stellen Sie sich einen internen „Deal Desk“-Assistenten vor, der Vertriebsverträge prüft.
1. Intake (Flash). Ein Nutzer lädt ein PDF hoch. Flash klassifiziert es: Vertrag, NDA oder Müll. Günstig, sofort, läuft auf allem.
2. Extraktion (Flash, multimodal). Bei Verträgen liest Flash das PDF direkt (kein separater OCR-Schritt) und zieht strukturierte Felder: Parteien, Wert, Laufzeit, anwendbares Recht.
3. Risikoprüfung (Pro, langer Kontext). Der vollständige Vertragstext plus Ihr Playbook-PDF gehen in Pro, das nicht-standardmäßige Klauseln markiert und jede davon erklärt, gegroundet auf Ihr Playbook. Das ist der Reasoning-Schritt, also rechtfertigt ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → den Pro-Preis.
4. Entwurf (Flash). Flash entwirft die Redline-Mail zurück an den Vertriebler auf Basis von Pros Ergebnissen.
5. Live-Fragen (Flash + Grounding). Der Vertriebler fragt „ist diese Gegenpartei in den Nachrichten?“, und ein gegroundeter Flash-Call antwortet mit Search-gestützten Links.
Ein Workflow, vier Modellaufrufe, und nur einer davon ist Pro. So sieht gutes Routing aus: teure Reasoning-Kapazität genau dort einsetzen, wo die Entscheidung zählt, und Flash das Volumen tragen lassen.
Key Takeaways
- Routen Sie pro Aufgabe, nicht pro App. Fragen Sie „Reasoning oder Verarbeitung?“ Reasoning und hohe Tragweite gehen an Pro; Volumen, Extraktion und Entwürfe an Flash. Setzen Sie standardmäßig auf eine Flash-first-Kaskade und eskalieren Sie nur bei Bedarf.
- Nutzen Sie native Multimodalität aus. Schicken Sie PDFs, Bilder und Audio direkt in dieselbe Anfrage, statt separate OCR- oder Transkriptionsschritte anzuflanschen. Flash bewältigt das meiste davon problemlos.
- Behandeln Sie langen Kontext als Architekturentscheidung. Packen Sie ein einzelnes Dokument direkt ins Fenster (mit Context Caching), statt RAG zu bauen, das Sie nicht brauchen, aber behalten Sie RAG für große oder sich schnell ändernde Korpora und kombinieren Sie beides.
- Passen Sie die Oberfläche an die Tragweite an. Prototypen in AI Studio, Features auf der Gemini APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → ausliefern, wiederverwendbare Assistenten als Gems verpacken und zu Vertex AI wechseln, wenn Sie Governance und Skalierung brauchen.
- Schalten Sie Grounding ein, wenn Wahrheit und Aktualität zählen, und lassen Sie es bei geschlossenen, in sich abgeschlossenen Aufgaben aus, um Latenz und Kosten zu sparen.
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Standardmäßig eine Flash-first-Kaskade nutzen und nur dort auf Pro eskalieren, wo Entscheidungen zählen
- PDFs, Bilder, Audio und Video native in einer einzigen Anfrage senden
- Einzelne große Artefakte in den Long Context legen und RAG für große Korpora reservieren
- Die Surface an den Einsatz anpassen: AI Studio, API, Gems, dann Vertex AI
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- KIReasoning-Modelle und wann Sie sie einsetzen: Der Hype ist der Praxis vorausReasoning-Modelle wie o3 von OpenAI und Gemini 2.0 Flash Thinking von Google haben Aufmerksamkeit erregt, weil sie Probleme sichtbar „durchdenken", bevor sie antworten. Der Konsens lautet, sie überall dort einzusetzen, wo Genauigkeit zählt. Diese Empfehlung ist auf eine Weise falsch, die Sie Geld kostet und Ihre Teams ausbremst.
- KIReasoning Models: ein praxisnahes Playbook, wann Sie sie einsetzenNicht jede Aufgabe profitiert von einem Reasoning Model, und wer es unterschiedslos einsetzt, verschwendet Zeit, Geld und Aufmerksamkeit. Dieses Playbook liefert Ihnen einen konkreten Entscheidungsprozess, um den richtigen Modelltyp dem richtigen Problem zuzuordnen.
- KIChatGPT, Claude oder Gemini: Was für den professionellen Einsatz wirklich zähltChatGPT, Claude und Gemini sind alle zu leistungsfähigen Plattformen gereift, aber sie setzen spürbar unterschiedliche Prioritäten. Wer diese Unterschiede versteht, statt einfach den bekanntesten Namen zu wählen, holt konstant bessere Ergebnisse heraus als der Gelegenheitsnutzer.