+160 XP

La famille de modèles Gemini : Pro, Flash, et quand utiliser chacun

Google propose Gemini Pro pour le travail le plus difficile, le plus lent, le plus exigeant en raisonnement, et Gemini Flash pour tout ce qui doit être rapide et peu coûteux, les deux étant nativement multimodaux dès la conception. Ce qui sépare un amateur de quelqu'un qui livre des fonctionnalités IA fiables, c'est de savoir lequel appeler, quand et pourquoi. Ce choix s'appelle le *model routing*, et c'est le plus grand levier dont vous disposez sur le coût, la latence et la qualité de tout ce que vous construisez sur Gemini.

Deux niveaux, une famille

Gemini est une famille, pas un modèle unique. Les deux niveaux que vous solliciterez en permanence :

  • Gemini Pro est le poids lourd. Meilleur sur le raisonnement en plusieurs étapes, le code difficile, les documents denses, les instructions ambiguës et les tâches où une étape fausse contamine tout le reste. Latence plus élevée, prix par token plus élevé.
  • Gemini Flash est le cheval de trait. Optimisé pour le débit et le faible coût. Il absorbe la grande majorité du trafic réel en production : classification, extraction, résumé, routing, rédaction simple et chat. Il existe aussi un niveau Flash encore plus léger (modèles de type Flash-Lite) pour les tâches à très gros volume et au coût minimal.

« Nativement multimodal » est l'aspect que l'on sous-exploite. **Les deux niveaux acceptent texte, images, audio, PDF et vidéo *dans la même requête*, pas via un module de vision rapporté**. Vous pouvez donner à Flash une capture d'écran et une question, il lit les deux comme une seule entrée. Vous vous en servirez constamment.

Les deux niveaux partagent aussi le trait distinctif de Gemini : une très grande fenêtre de contexte. On parle de plusieurs centaines de milliers à plus d'un million de tokens selon la version du modèle. De quoi déposer une base de code entière, un long contrat ou des heures de transcription dans un seul prompt. Le long contexte change votre architecture : parfois, « mettre tout le document dans le prompt » bat un pipeline de retrieval compliqué. (Plus de détails sur cet arbitrage ci-dessous.)

Vérifiez toujours les IDs de modèles, les limites de contexte et les tarifs actuels dans la documentation des modèles Gemini, car les noms de versions et les limites évoluent vite.

La décision de routing, concrètement

Voici le modèle mental. Demandez-vous : cette tâche exige-t-elle du raisonnement, ou juste du traitement ?

Prenons deux travaux sur le même ticket de support.

Travail A : « Résume ce ticket en deux phrases pour la file d'attente. »

Gros volume, faible enjeu, aucune chaîne de raisonnement. C'est du Flash. Cela tourne des milliers de fois par jour et personne ne relit la sortie.

Travail B : « Lis ce ticket, les trois tickets précédents du client, le PDF de notre politique de remboursement et l'historique de commandes, puis décide si le client est éligible à un remboursement, cite la clause exacte de la politique et rédige la réponse. »

Plusieurs sources, une politique à appliquer correctement, une décision avec de l'argent à la clé, et une citation qui doit être juste. C'est du Pro.

Le piège, c'est d'utiliser un seul modèle pour les deux. Envoyer le Travail A à Pro brûle de l'argent et ajoute de la latence sans gain de qualité. Envoyer le Travail B à Flash expose à une décision de remboursement fausse mais assurée. Routez par tâche, pas par application.

Un pattern courant en production est la cascade Flash-first : Flash tente la tâche, et vous escaladez vers Pro uniquement quand un contrôle de confiance peu coûteux échoue ou que la tâche est signalée à fort enjeu.

python
from google import genai

client = genai.Client()  # lit GEMINI_API_KEY depuis l'environnement

def answer(question: str, complex_task: bool = False) -> str:
    model = "gemini-2.5-pro" if complex_task else "gemini-2.5-flash"
    resp = client.models.generate_content(
        model=model,
        contents=question,
    )
    return resp.text

print(answer("Summarize this ticket in two sentences: ..."))
print(answer("Decide refund eligibility and cite the policy clause: ...", complex_task=True))

Ce drapeau complex_task est l'endroit où les vrais systèmes deviennent intéressants. Vous pouvez le définir à partir d'un classifieur Flash rapide, de métadonnées (valeur du ticket, segment client) ou d'une regex sur des mots-clés comme « remboursement » ou « juridique ». La logique de routing est votre produit, pas un détail de fin de projet.

Gemini API in 100 Seconds

Watch on YouTube

Long contexte vs RAG : quand se passer du retrieval

Vous connaissez déjà le RAG comme concept. Le long contexte de Gemini impose une vraie décision d'architecture que vous n'aviez pas avec des modèles plus petits.

Si votre base de connaissances tient confortablement dans la fenêtre et change rarement, tout mettre dans le prompt est souvent plus simple et plus précis que de construire un pipeline de retrieval. Pas de chunking, pas de base d'embeddings, pas de réglage de pertinence. Vous donnez à Pro le contrat complet de 80 pages et vous posez votre question sur l'ensemble d'un coup.

Mais le long contexte n'est pas gratuit. Le coût croît avec les tokens d'entrée, et les prompts très longs ajoutent de la latence. D'où la règle empirique :

  • Un document, ou un petit corpus fixe, interrogé de façon répétée ? Long contexte. Associez-le au context caching (l'API permet de mettre en cache un long préfixe partagé pour ne pas repayer le traitement du même document à chaque appel).
  • Des millions de documents, ou du contenu qui change en permanence ? Le RAG reste gagnant. Vous ne pouvez pas faire tenir une base de connaissances dans une fenêtre, et vous n'en avez pas envie.

La réponse honnête pour beaucoup de systèmes en production, c'est les deux : le RAG réduit des millions de documents aux dix plus pertinents, puis vous passez ces dix-là en entier dans la fenêtre de long contexte plutôt que de découper agressivement. Le long contexte rend votre étape de retrieval moins fragile.

Où faire tourner Gemini concrètement

Les mêmes modèles apparaissent sur toutes les surfaces de Google. Choisissez la surface en fonction du sérieux du travail.

Prototypage et outils rapides

Google AI Studio est le point de départ. Interface web en offre gratuite pour tester des prompts, comparer Flash et Pro côte à côte, régler la température et les instructions système, et récupérer le code API exact de ce que vous avez construit. Quand un prompt fonctionne dans AI Studio, vous cliquez pour l'exporter.

L'assistant du quotidien

L'application Gemini est l'assistant grand public et Workspace. À l'intérieur, vous pouvez créer des Gems : des assistants sauvegardés et réutilisables, avec leurs propres instructions et (sur les offres compatibles) leurs propres fichiers de référence. Voyez un Gem comme un system prompt packagé, plus du contexte, qu'un non-ingénieur peut créer et partager. Un Gem « Éditeur de voix de marque » ou « Analyste du rapport trimestriel » évite à votre équipe de recoller sans cesse les mêmes instructions.

Dans les outils que vous utilisez déjà

Gemini dans Google Workspace intègre les modèles directement dans Docs, Gmail, Sheets, Slides, Meet et Drive. Rédiger dans Gmail, résumer un Doc, générer un tableau dans Sheets, obtenir des notes de réunion dans Meet. Pour aller au-delà de l'interface en automatisation, Apps Script permet d'appeler Gemini depuis une feuille de calcul ou un workflow Workspace en quelques lignes de script.

Vérification des acquis

1. Qu'est-ce que le « model routing » et pourquoi est-ce déterminant quand on construit sur Gemini ?

2. La leçon articule la décision de routing autour d'une question centrale. Laquelle ?

3. Une équipe exécute une tâche à faible enjeu et fort volume, des milliers de fois par jour : résumer des tickets de support en deux phrases pour une file que personne ne relit. Quel modèle convient le mieux et pourquoi ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations qui décrivent correctement en quoi la multimodalité native et la grande fenêtre de contexte de Gemini changent la façon de construire.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les tâches que la leçon identifie comme charges de travail typiques de Gemini Flash.

Sélectionnez toutes les réponses correctes.

Le grounding pour que le modèle arrête de deviner

Un modèle brut répond à partir de ses données d'entraînement, qui vieillissent et inventent des faits. Le grounding avec Google Search connecte un appel à l'API Gemini à des résultats de recherche en direct, et la réponse revient avec des liens justificatifs que vous pouvez montrer aux utilisateurs. Activez-le requête par requête quand la fraîcheur ou la vérifiabilité comptent (actualité, prix, documents récents). Laissez-le désactivé pour des tâches fermées comme « réécris ce paragraphe ».

python
from google import genai
from google.genai import types

client = genai.Client()

resp = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="What were the headline announcements at the most recent Google I/O?",
    config=types.GenerateContentConfig(
        tools=[types.Tool(google_search=types.GoogleSearch())]
    ),
)
print(resp.text)

Pour les développeurs et les agents

  • [Gemini API](https://ai.google.dev/gemini-api/docs) : l'interface programmatique directe, la fondation de tout ce que vous livrez.
  • Gemini CLI : un agent open source qui tourne dans votre terminal. Pointez-le vers un repo et demandez-lui d'expliquer, de refactorer ou d'exécuter des tâches en plusieurs étapes sur vos fichiers.
  • Gemini Code Assist : complétions et chat dans votre IDE et sur GitHub, adossés aux modèles Gemini.
  • Agent Development Kit (ADK) : un framework open source pour construire des systèmes multi-agents avec outils, état et orchestration, au lieu de coder à la main des boucles d'agents.

Pour le passage à l'échelle en production

Vertex AI est la voie entreprise sur Google Cloud : les mêmes modèles Gemini avec IAM, contrôles de résidence des données, quotas supérieurs, monitoring, tuning, et un parcours qui satisfait les achats. Règle empirique : prototypez sur l'API Gemini avec une clé AI Studio, puis passez à Vertex AI quand vous avez besoin de gouvernance et d'échelle.

Une vraie architecture de routing

Rassemblons le tout. Imaginez un assistant interne de « deal desk » qui relit les contrats commerciaux.

  1. Réception (Flash). Un utilisateur dépose un PDF. Flash le classe : contrat, NDA ou déchet. Peu coûteux, instantané, appliqué à tout.
  2. Extraction (Flash, multimodal). Pour les contrats, Flash lit le PDF directement (sans étape d'OCR séparée) et en tire des champs structurés : parties, valeur, durée, droit applicable.
  3. Revue de risque (Pro, long contexte). Le texte intégral du contrat plus le PDF de votre playbook entrent dans Pro, qui signale les clauses non standard et explique chacune d'elles, en s'appuyant sur votre playbook. C'est l'étape de raisonnement, elle justifie le prix de Pro.
  4. Rédaction (Flash). Flash rédige l'email de redline au commercial à partir des conclusions de Pro.
  5. Questions en direct (Flash + grounding). Le commercial demande « est-ce que cette contrepartie est dans l'actualité ? » et un appel Flash groundé répond avec des liens issus de Search.

Un workflow, quatre appels de modèle, et un seul en Pro. Voilà à quoi ressemble un bon routing : dépenser la capacité de raisonnement coûteuse exactement là où la décision compte, et laisser Flash porter le volume.

À retenir

  • Routez par tâche, pas par application. Demandez « raisonnement ou traitement ? » Le raisonnement et les forts enjeux vont vers Pro ; le volume, l'extraction et la rédaction vont vers Flash. Par défaut, cascade Flash-first, avec escalade uniquement si nécessaire.
  • Exploitez la multimodalité native. Envoyez PDF, images et audio directement dans la même requête au lieu d'ajouter des étapes distinctes d'OCR ou de transcription. Flash s'en sort très bien sur la plupart de ces cas.
  • Traitez le long contexte comme un choix d'architecture. Mettez un document unique directement dans la fenêtre (avec context caching) plutôt que de construire un RAG dont vous n'avez pas besoin, mais gardez le RAG pour les corpus volumineux ou à évolution rapide, et combinez les deux.
  • Adaptez la surface aux enjeux. Prototypez dans AI Studio, livrez vos fonctionnalités sur l'API Gemini, packagez les assistants réutilisables en Gems, et passez à Vertex AI quand vous avez besoin de gouvernance et d'échelle.
  • Activez le grounding quand la véracité et la fraîcheur comptent, et laissez-le désactivé pour les tâches fermées et autonomes afin d'économiser latence et coût.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Adoptez par défaut une cascade Flash-first, avec escalade vers Pro uniquement là où les décisions comptent
  • Envoyez PDF, images, audio et vidéo nativement dans une seule requête
  • Placer les artefacts volumineux uniques directement dans le long context, en réservant le RAG aux grands corpus
  • Adaptez la surface à l'enjeu : AI Studio, API, Gems, puis Vertex AI
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.