La famille de modèles Gemini : Pro, Flash, et quand utiliser chacun
Google propose Gemini Pro pour le travail le plus difficile, le plus lent, le plus exigeant en raisonnement, et Gemini Flash pour tout ce qui doit être rapide et peu coûteux, les deux étant nativement multimodaux dès la conception. Ce qui sépare un amateur de quelqu'un qui livre des fonctionnalités IA fiables, c'est de savoir lequel appeler, quand et pourquoi. Ce choix s'appelle le *model routing*, et c'est le plus grand levier dont vous disposez sur le coût, la latence et la qualité de tout ce que vous construisez sur Gemini.
Deux niveaux, une famille
Gemini est une famille, pas un modèle unique. Les deux niveaux que vous solliciterez en permanence :
- Gemini Pro est le poids lourd. Meilleur sur le raisonnement en plusieurs étapes, le code difficile, les documents denses, les instructions ambiguës et les tâches où une étape fausse contamine tout le reste. Latence plus élevée, prix par tokentokenUn token est l'unité de base de texte que traitent les modèles de langage : le plus souvent un fragment de mot, un mot entier ou un signe de ponctuation, plutôt qu'un simple caractère.Voir la définition complète → plus élevé.
- Gemini Flash est le cheval de trait. Optimisé pour le débit et le faible coût. Il absorbe la grande majorité du trafic réel en production : classification, extraction, résumé, routing, rédaction simple et chat. Il existe aussi un niveau Flash encore plus léger (modèles de type Flash-Lite) pour les tâches à très gros volume et au coût minimal.
« Nativement multimodalmultimodalIA qui traite plusieurs types de contenu à la fois: texte, image, audio, vidéo et données, au lieu d'un seul format.Voir la définition complète → » est l'aspect que l'on sous-exploite. **Les deux niveaux acceptent texte, images, audio, PDF et vidéo *dans la même requête*, pas via un module de vision rapporté**. Vous pouvez donner à Flash une capture d'écran et une question, il lit les deux comme une seule entrée. Vous vous en servirez constamment.
Les deux niveaux partagent aussi le trait distinctif de Gemini : une très grande fenêtre de contexte. On parle de plusieurs centaines de milliers à plus d'un million de tokens selon la version du modèle. De quoi déposer une base de code entière, un long contrat ou des heures de transcription dans un seul prompt. Le long contexte change votre architecture : parfois, « mettre tout le document dans le prompt » bat un pipelinepipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète → de retrieval compliqué. (Plus de détails sur cet arbitrage ci-dessous.)
Vérifiez toujours les IDs de modèles, les limites de contexte et les tarifs actuels dans la documentation des modèles Gemini, car les noms de versions et les limites évoluent vite.
La décision de routing, concrètement
Voici le modèle mental. Demandez-vous : cette tâche exige-t-elle du raisonnement, ou juste du traitement ?
Prenons deux travaux sur le même ticket de support.
Travail A : « Résume ce ticket en deux phrases pour la file d'attente. »
Gros volume, faible enjeu, aucune chaîne de raisonnement. C'est du Flash. Cela tourne des milliers de fois par jour et personne ne relit la sortie.
Travail B : « Lis ce ticket, les trois tickets précédents du client, le PDF de notre politique de remboursement et l'historique de commandes, puis décide si le client est éligible à un remboursement, cite la clause exacte de la politique et rédige la réponse. »
Plusieurs sources, une politique à appliquer correctement, une décision avec de l'argent à la clé, et une citation qui doit être juste. C'est du Pro.
Le piège, c'est d'utiliser un seul modèle pour les deux. Envoyer le Travail A à Pro brbrLe pourcentage de visiteurs qui repartent après avoir vu une seule page, souvent le signe d'une pertinence insuffisante, d'un décalage d'intention ou d'une expérience utilisateur faible.Voir la définition complète →ûle de l'argent et ajoute de la latence sans gain de qualité. Envoyer le Travail B à Flash expose à une décision de remboursement fausse mais assurée. Routez par tâche, pas par application.
Un pattern courant en production est la cascade Flash-first : Flash tente la tâche, et vous escaladez vers Pro uniquement quand un contrôle de confiance peu coûteux échoue ou que la tâche est signalée à fort enjeu.
from google import genai
client = genai.Client() # lit GEMINI_API_KEY depuis l'environnement
def answer(question: str, complex_task: bool = False) -> str:
model = "gemini-2.5-pro" if complex_task else "gemini-2.5-flash"
resp = client.models.generate_content(
model=model,
contents=question,
)
return resp.text
print(answer("Summarize this ticket in two sentences: ..."))
print(answer("Decide refund eligibility and cite the policy clause: ...", complex_task=True))Ce drapeau complex_task est l'endroit où les vrais systèmes deviennent intéressants. Vous pouvez le définir à partir d'un classifieur Flash rapide, de métadonnées (valeur du ticket, segment client) ou d'une regex sur des mots-clés comme « remboursement » ou « juridique ». La logique de routing est votre produit, pas un détail de fin de projet.
Gemini API in 100 Seconds
Long contexte vs RAGRAGMéthode qui permet à un modèle d'IA de répondre à partir de vos propres documents, en récupérant les passages pertinents avant de générer une réponse.Voir la définition complète → : quand se passer du retrieval
Vous connaissez déjà le RAG comme concept. Le long contexte de Gemini impose une vraie décision d'architecture que vous n'aviez pas avec des modèles plus petits.
Si votre base de connaissances tient confortablement dans la fenêtre et change rarement, tout mettre dans le prompt est souvent plus simple et plus précis que de construire un pipeline de retrieval. Pas de chunking, pas de base d'embeddings, pas de réglage de pertinence. Vous donnez à Pro le contrat complet de 80 pages et vous posez votre question sur l'ensemble d'un coup.
Mais le long contexte n'est pas gratuit. Le coût crocroLe Conversion Rate Optimization (CRO) est la pratique systématique visant à augmenter le pourcentage d'utilisateurs qui réalisent une action souhaitée, en s'appuyant sur la data, les tests et la recherche utilisateur.Voir la définition complète →ît avec les tokens d'entrée, et les prompts très longs ajoutent de la latence. D'où la règle empirique :
- Un document, ou un petit corpus fixe, interrogé de façon répétée ? Long contexte. Associez-le au context caching (l'APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète → permet de mettre en cache un long préfixe partagé pour ne pas repayer le traitement du même document à chaque appel).
- Des millions de documents, ou du contenu qui change en permanence ? Le RAG reste gagnant. Vous ne pouvez pas faire tenir une base de connaissances dans une fenêtre, et vous n'en avez pas envie.
La réponse honnête pour beaucoup de systèmes en production, c'est les deux : le RAG réduit des millions de documents aux dix plus pertinents, puis vous passez ces dix-là en entier dans la fenêtre de long contexte plutôt que de découper agressivement. Le long contexte rend votre étape de retrieval moins fragile.
Où faire tourner Gemini concrètement
Les mêmes modèles apparaissent sur toutes les surfaces de Google. Choisissez la surface en fonction du sérieux du travail.
Prototypage et outils rapides
Google AI Studio est le point de départ. Interface web en offre gratuite pour tester des prompts, comparer Flash et Pro côte à côte, régler la température et les instructions système, et récupérer le code API exact de ce que vous avez construit. Quand un prompt fonctionne dans AI Studio, vous cliquez pour l'exporter.
L'assistant du quotidien
L'application Gemini est l'assistant grand public et Workspace. À l'intérieur, vous pouvez crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éer des Gems : des assistants sauvegardés et réutilisables, avec leurs propres instructions et (sur les offres compatibles) leurs propres fichiers de référence. Voyez un Gem comme un system prompt packagé, plus du contexte, qu'un non-ingénieur peut créer et partager. Un Gem « Éditeur de voix de marque » ou « Analyste du rapport trimestriel » évite à votre équipe de recoller sans cesse les mêmes instructions.
Dans les outils que vous utilisez déjà
Gemini dans Google Workspace intègre les modèles directement dans Docs, Gmail, Sheets, Slides, Meet et Drive. Rédiger dans Gmail, résumer un Doc, générer un tableau dans Sheets, obtenir des notes de réunion dans Meet. Pour aller au-delà de l'interface en automatisation, Apps Script permet d'appeler Gemini depuis une feuille de calcul ou un workflow Workspace en quelques lignes de script.
Vérification des acquis
1. Qu'est-ce que le « model routing » et pourquoi est-ce déterminant quand on construit sur Gemini ?
2. La leçon articule la décision de routing autour d'une question centrale. Laquelle ?
3. Une équipe exécute une tâche à faible enjeu et fort volume, des milliers de fois par jour : résumer des tickets de support en deux phrases pour une file que personne ne relit. Quel modèle convient le mieux et pourquoi ?
4. Sélectionnez TOUTES les affirmations qui décrivent correctement en quoi la multimodalité native et la grande fenêtre de contexte de Gemini changent la façon de construire.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les tâches que la leçon identifie comme charges de travail typiques de Gemini Flash.
Sélectionnez toutes les réponses correctes.
Le grounding pour que le modèle arrête de deviner
Un modèle brut répond à partir de ses données d'entraînement, qui vieillissent et inventent des faits. Le grounding avec Google Search connecte un appel à l'API Gemini à des résultats de recherche en direct, et la réponse revient avec des liens justificatifs que vous pouvez montrer aux utilisateurs. Activez-le requête par requête quand la fraîcheur ou la vérifiabilité comptent (actualité, prix, documents récents). Laissez-le désactivé pour des tâches fermées comme « réécris ce paragraphe ».
from google import genai
from google.genai import types
client = genai.Client()
resp = client.models.generate_content(
model="gemini-2.5-flash",
contents="What were the headline announcements at the most recent Google I/O?",
config=types.GenerateContentConfig(
tools=[types.Tool(google_search=types.GoogleSearch())]
),
)
print(resp.text)Pour les développeurs et les agents
- [Gemini API](https://ai.google.dev/gemini-api/docs) : l'interface programmatique directe, la fondation de tout ce que vous livrez.
- Gemini CLI : un agent open source qui tourne dans votre terminal. Pointez-le vers un repo et demandez-lui d'expliquer, de refactorer ou d'exécuter des tâches en plusieurs étapes sur vos fichiers.
- Gemini Code Assist : complétions et chat dans votre IDE et sur GitHub, adossés aux modèles Gemini.
- Agent Development Kit (ADK) : un framework open source pour construire des systèmes multi-agents avec outils, état et orchestration, au lieu de coder à la main des boucles d'agents.
Pour le passage à l'échelle en production
Vertex AI est la voie entreprise sur Google Cloud : les mêmes modèles Gemini avec IAM, contrôles de résidence des données, quotas supérieurs, monitoring, tuning, et un parcours qui satisfait les achats. Règle empirique : prototypez sur l'API Gemini avec une clé AI Studio, puis passez à Vertex AI quand vous avez besoin de gouvernance et d'échelle.
Une vraie architecture de routing
Rassemblons le tout. Imaginez un assistant interne de « deal desk » qui relit les contrats commerciaux.
- Réception (Flash). Un utilisateur dépose un PDF. Flash le classe : contrat, NDA ou déchet. Peu coûteux, instantané, appliqué à tout.
- Extraction (Flash, multimodal). Pour les contrats, Flash lit le PDF directement (sans étape d'OCR séparée) et en tire des champs structurés : parties, valeur, durée, droit applicable.
- Revue de risque (Pro, long contexte). Le texte intégral du contrat plus le PDF de votre playbook entrent dans Pro, qui signale les clauses non standard et explique chacune d'elles, en s'appuyant sur votre playbook. C'est l'étape de raisonnement, elle justifie le prix de Pro.
- Rédaction (Flash). Flash rédige l'email de redline au commercial à partir des conclusions de Pro.
- Questions en direct (Flash + grounding). Le commercial demande « est-ce que cette contrepartie est dans l'actualité ? » et un appel Flash groundé répond avec des liens issus de Search.
Un workflow, quatre appels de modèle, et un seul en Pro. Voilà à quoi ressemble un bon routing : dépenser la capacité de raisonnement coûteuse exactement là où la décision compte, et laisser Flash porter le volume.
À retenir
- Routez par tâche, pas par application. Demandez « raisonnement ou traitement ? » Le raisonnement et les forts enjeux vont vers Pro ; le volume, l'extraction et la rédaction vont vers Flash. Par défaut, cascade Flash-first, avec escalade uniquement si nécessaire.
- Exploitez la multimodalité native. Envoyez PDF, images et audio directement dans la même requête au lieu d'ajouter des étapes distinctes d'OCR ou de transcription. Flash s'en sort très bien sur la plupart de ces cas.
- Traitez le long contexte comme un choix d'architecture. Mettez un document unique directement dans la fenêtre (avec context caching) plutôt que de construire un RAG dont vous n'avez pas besoin, mais gardez le RAG pour les corpus volumineux ou à évolution rapide, et combinez les deux.
- Adaptez la surface aux enjeux. Prototypez dans AI Studio, livrez vos fonctionnalités sur l'API Gemini, packagez les assistants réutilisables en Gems, et passez à Vertex AI quand vous avez besoin de gouvernance et d'échelle.
- Activez le grounding quand la véracité et la fraîcheur comptent, et laissez-le désactivé pour les tâches fermées et autonomes afin d'économiser latence et coût.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Adoptez par défaut une cascade Flash-first, avec escalade vers Pro uniquement là où les décisions comptent
- Envoyez PDF, images, audio et vidéo nativement dans une seule requête
- Placer les artefacts volumineux uniques directement dans le long context, en réservant le RAG aux grands corpus
- Adaptez la surface à l'enjeu : AI Studio, API, Gems, puis Vertex AI
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- IAModèles de raisonnement : arrêtez de les utiliser par défautLes modèles de raisonnement comme o3 d'OpenAI ou Claude 3.7 Sonnet sont présentés comme la prochaine étape obligatoire pour quiconque veut des résultats sérieux avec l'IA. Cette réputation est partiellement méritée, mais elle pousse des professionnels à faire de mauvais choix d'outils au quotidien.
- IAModèles de raisonnement : comment choisir et les utiliser efficacementLes modèles de raisonnement comme o3 d'OpenAI ou Claude Sonnet 3.7 promettent des performances bien supérieures sur les tâches complexes, mais les déployer sans méthode génère des coûts élevés et des résultats décevants. Ce playbook vous donne une séquence concrète pour décider quand les utiliser et comment en tirer le meilleur parti.
- IAChatGPT, Claude, Gemini : comment choisir le bon outil selon la tâcheLes trois grands modèles de langage ne sont pas interchangeables. Comprendre leurs différences concrètes permet de gagner en précision, en temps et en qualité de résultat.