+170 XP

Multimodalité et long context : les superpouvoirs de Gemini

Donnez à Gemini un webinar enregistré de deux heures et un contrat de 300 pages dans le même prompt, puis demandez « à quel timestamp l'intervenant contredit-il la clause 14 ? » : il peut réellement répondre. Cette combinaison, multimodalité native plus fenêtre de contexte très large, c'est ce que Gemini fait et que la plupart des assistants simulent encore en découpant les inputs en morceaux.

Cette leçon porte sur l'usage délibéré de ces deux forces, et sur savoir quand elles valent leur coût.

Ce que signifie réellement « multimodalité native »

Gemini a été entraîné dès le départ pour traiter texte, images, audio et vidéo comme des tokens dans un seul et même modèle. C'est différent d'un modèle purement textuel raccordé à un système de vision ou de reconnaissance vocale séparé. Il n'y a pas d'étape de transcription invisible, pas de passe OCR séparée qui perd la mise en page.

Conséquence pratique : **Gemini raisonne *à travers* les modalités en une seule passe**. Il peut lire le graphique dans un PDF, le relier à une phrase trois pages plus loin, et remarquer que le ton audio d'un extrait vidéo ne correspond pas à la slide affichée.

Token désigne ici l'unité d'input. Texte, pixels et frames audio sont tous convertis en tokens. Une longue fenêtre de contexte signifie un large budget de tokens, et la fenêtre de Gemini (de l'ordre de plusieurs millions de tokens sur le palier Pro) est assez large pour contenir des livres entiers, des codebases ou des heures de média d'un coup.

Pourquoi c'est mieux que le chunk-and-retrieve pour certaines tâches

Vous connaissez déjà le RAG : découper les documents, embedder les chunks, récupérer les quelques passages pertinents. C'est encore le bon outil pour une base de connaissances de 10 000 documents. Mais **pour un *unique gros artefact* sur lequel vous voulez un raisonnement d'ensemble, le chunking vous pénalise activement**. Il casse les renvois croisés, perd la structure globale, et ne peut pas voir ce que vous ne saviez pas chercher.

Le long context permet de sauter complètement l'étape de retrieval dans ce cas. Mettez le document entier. Gemini voit tout, il peut donc répondre à des questions qui traversent le fichier complet.

Un exemple concret : interroger une longue vidéo

Admettons que vous ayez un all-hands ingénierie enregistré, 90 minutes, et un design doc en PDF. Vous voulez vérifier que l'intervention correspond au document.

Dans Google AI Studio, vous pouvez uploader les deux et simplement demander. Via l'API, voici la même chose avec le SDK google-genai :

python
from google import genai

client = genai.Client()

video = client.files.upload(file="all-hands.mp4")
doc = client.files.upload(file="design-doc.pdf")

response = client.models.generate_content(
    model="gemini-2.5-pro",
    contents=[
        video, doc,
        "Find every place the speaker describes the rollout plan. "
        "For each, give the timestamp and quote, then say whether it "
        "matches the design doc. Cite the doc page for any mismatch.",
    ],
)

print(response.text)

Vous obtenez des timestamps, des citations, des références de pages et un verdict. Pas de pipeline de transcription, pas de config de chunking, pas de vector store. Gemini a regardé la vidéo et lu le PDF ensemble.

Quelques points utiles ici :

  • Files API : les gros uploads passent par client.files.upload, qui stocke le fichier temporairement et vous renvoie une référence. À utiliser pour tout ce qui dépasse de petites images inline.
  • Timestamps : parce que Gemini traite la vidéo nativement, vous pouvez lui demander des références MM:SS et même demander « qu'y a-t-il à l'écran à 42:15 ? »
  • Choix du modèle : gemini-2.5-pro pour du raisonnement poussé sur de longs inputs, gemini-2.5-flash quand vous voulez de la vitesse et un coût plus bas et que la tâche relève plus de l'extraction que du raisonnement.

Long context and multimodal prompting with the Gemini API

Watch on YouTube

La même puissance dans l'app Gemini et Workspace

Vous n'avez pas besoin de l'API pour ça. Dans l'app Gemini, uploadez un PDF, une image ou de l'audio et posez vos questions. Dans Google Workspace, le reach est plus large :

  • Gemini dans Drive peut résumer un fichier et répondre à des questions sans l'ouvrir.
  • Gemini dans Docs et Gmail raisonne sur le document ou le thread où vous vous trouvez.
  • Gemini dans Meet traite la réunion elle-même pour produire notes et récapitulatifs.

Si vous faites ce type d'analyse multi-documents de façon répétée, construisez un Gem : une configuration de Gemini sauvegardée et réutilisable, avec vos propres instructions et (éventuellement) des fichiers de référence attachés. Voyez-le comme un expert enregistré. Un Gem « Contract Reviewer » avec votre checklist de clauses intégrée vous évite de retaper le cadrage chaque fois.

Là où le long context rapporte (et là où non)

Le long context est un outil, pas un réglage par défaut. Utilisez-le quand la valeur vient du fait de *tout voir d'un coup*.

Bons cas :

  • Q&A sur document entier : un gros contrat, un appel d'offres, un article de recherche ou une transcription où les réponses traversent les sections.
  • Analyse vidéo et audio : cours, interviews, enregistrements d'écran, appels support. « Où le client s'agace-t-il ? » est une vraie requête.
  • Raisonnement sur codebase : collez un module entier ou plusieurs fichiers et demandez une revue d'architecture ou une chasse au bug qui traverse les fichiers.
  • Vérification cross-modale : la vidéo de démo correspond-elle à la spec ? Le graphique correspond-il à la légende ?

Mauvais cas (utilisez RAG ou des outils à la place) :

  • Gros corpus : des milliers de documents. Le retrieval est moins cher et plus précis que de tout empiler dans le prompt.
  • Faits récents : la fenêtre du modèle contient *vos* données, pas l'actualité du jour. Pour de l'information courante, ancrez-la (section suivante).
  • Lookups répétitifs à haut volume : un million de tokens par appel coûte cher si vous le faites en continu. Cachez ou faites du retrieval.

Note sur le coût et la latence

Les gros inputs coûtent plus et tournent plus lentement, à peu près proportionnellement aux tokens traités. Deux façons de gérer ça :

  1. Context caching : si vous posez beaucoup de questions sur le *même* gros document, cachez-le une fois via l'API pour ne pas re-envoyer (et re-payer) l'input complet à chaque tour. Voir la documentation context caching de l'API Gemini.
  2. Calibrez le modèle : Flash pour l'extraction à l'échelle, Pro pour les passes de raisonnement vraiment difficiles.

Grounding : long context plus faits en direct

Le long context gère *vos* données. Pour les données du *monde*, combinez-le avec le grounding. Le grounding avec Google Search permet à Gemini de vérifier des affirmations contre des résultats en direct et de renvoyer des citations, ce qui combat directement l'hallucination.

Dans l'API, vous l'activez comme un outil :

python
from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-2.5-pro",
    contents="Summarize this report, then flag any claims that current "
             "public data contradicts.",
    config=types.GenerateContentConfig(
        tools=[types.Tool(google_search=types.GoogleSearch())]
    ),
)

print(response.text)

Gemini raisonne maintenant sur le long document que vous avez fourni *et* vérifie des affirmations précises contre le web en direct. Cet appariement, votre contexte privé plus des faits publics sourcés, est difficile à reproduire avec un assistant purement textuel.

Vérification des acquis

1. Que signifie fondamentalement la « multimodalité native » dans le contexte de Gemini ?

2. Pour une base de connaissances de 10 000 documents où vous devez répondre à des questions ciblées, quelle approche la leçon recommande-t-elle ?

3. Pourquoi le chunking d'un unique document volumineux pénalise-t-il activement certaines tâches ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations vraies sur le fonctionnement des tokens dans la fenêtre de contexte multimodale de Gemini.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUS les scénarios où combiner multimodalité native et long context apporte un avantage réel sur le chunk-and-retrieve.

Sélectionnez toutes les réponses correctes.

Choisir votre surface : app, AI Studio ou Vertex AI

La même capacité multimodale et long context apparaît dans toute la stack Google, à différentes altitudes. Choisissez selon ce que vous construisez.

App Gemini et Gems

Pour des workflows individuels et d'équipe sans code. Uploadez des fichiers, créez des Gems, utilisez l'intégration Workspace. C'est là que la plupart des professionnels commencent et là qu'une bonne partie du vrai travail se fait.

Google AI Studio et l'API Gemini

Pour prototyper et construire des produits. AI Studio est l'endroit le plus rapide pour tester un prompt multimodal, ajuster les réglages et récupérer le code équivalent. Quand vous êtes prêt, l'API Gemini (le SDK google-genai ci-dessus) le met en production. C'est la bonne couche pour les startups et les outils internes rapides.

Vertex AI

Pour la production à l'échelle entreprise : gouvernance, résidence des données, MLOps, IAM et intégration Google Cloud plus serrée. Mêmes modèles, enveloppe entreprise. Voir Vertex AI. Le modèle mental : AI Studio pour prototyper, Vertex AI pour exploiter là où conformité et échelle comptent.

Outils développeurs qui héritent de ces forces

  • Gemini CLI : pilotez Gemini depuis votre terminal, y compris sur des fichiers locaux. Multimodal et conscient du long context.
  • Gemini Code Assist : aide dans l'IDE capable de raisonner sur une grosse codebase plutôt que sur le seul fichier ouvert.
  • Agent Development Kit (ADK) : construisez des agents où le long context de Gemini alimente des workflows utilisant des outils.
  • Apps Script : branchez Gemini dans des automatisations Workspace (un script qui lit un PDF Drive et rédige un Doc).

Des patterns qui marchent

Quelques patterns qui produisent de bons résultats de façon fiable avec de gros inputs multimodaux.

Demandez de la structure. Quand vous extrayez depuis un gros fichier, demandez du JSON. Ça force la précision et c'est facile à consommer en aval :

python
config = types.GenerateContentConfig(
    response_mime_type="application/json",
    response_schema={
        "type": "object",
        "properties": {
            "findings": {
                "type": "array",
                "items": {
                    "type": "object",
                    "properties": {
                        "timestamp": {"type": "string"},
                        "quote": {"type": "string"},
                        "matches_doc": {"type": "boolean"},
                    },
                },
            }
        },
    },
)

Mettez la question après les données. Avec des inputs énormes, présentez d'abord les documents, puis posez la question. Le modèle prête attention à toute la fenêtre, mais une instruction claire à la fin garde la tâche nette.

Demandez des citations à chaque fois. « Cite la page ou le timestamp » n'est pas optionnel sur de longs inputs. Ça rend la réponse vérifiable et révèle quand le modèle devine.

Décomposez les longues vidéos. Pour un enregistrement de 2 heures, une première passe pour construire un plan horodaté, puis des relances ciblées sur des segments précis, bat souvent une seule question ouverte gigantesque.

Comment ça se compare aux autres assistants

Trois différences réelles, dites simplement :

  1. Vidéo et audio natifs dans le modèle, pas une transcription passée à un modèle textuel. Vous pouvez interroger ce qui est *montré* et *dit*, avec timestamps.
  2. Une fenêtre de contexte réellement large qui contient des livres entiers ou des codebases, donc vous pouvez sauter le chunking pour du raisonnement sur un artefact unique.
  3. Une portée profonde dans Workspace et Google Cloud, si bien que la même capacité tourne de l'app Gemini à Vertex AI sans ré-architecturer.

Ça ne fait pas du long context la réponse à tout. Les gros corpus réclament toujours du RAG. Mais pour « voici une chose unique, grosse, brouillonne, multimodale, raisonne sur l'ensemble », c'est là que Gemini est réellement en avance.

Points clés

  • Utilisez le long context pour un artefact unique et volumineux, le RAG pour les gros corpus. Mettez un contrat, une vidéo ou une codebase entière quand les réponses traversent le fichier ; faites du retrieval quand vous avez des milliers de documents.
  • Exploitez la multimodalité native. Demandez des timestamps sur la vidéo, des lectures de PDF conscientes de la mise en page, et des vérifications cross-modales (« la démo correspond-elle à la spec ? »). Aucun pipeline de transcription nécessaire.
  • Associez long context et grounding. Vos données privées vivent dans la fenêtre ; activez le grounding Google Search pour les faits en direct et les citations.
  • Adaptez le modèle et la surface à la tâche. Flash pour l'extraction bon marché à l'échelle, Pro pour le raisonnement difficile ; l'app Gemini pour travailler, AI Studio pour prototyper, Vertex AI pour déployer à l'échelle entreprise.
  • Exigez toujours des citations et une sortie structurée sur les longs inputs, et cachez les gros prompts répétés pour maîtriser le coût.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Envoyez PDF, images, audio et vidéo nativement dans une seule requête
  • Placer les artefacts volumineux uniques directement dans le long context, en réservant le RAG aux grands corpus
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.