+160 XP

Images, voix et vision

ChatGPT peut générer une image, lire la photo de votre tableau blanc ou une stack trace, et tenir une vraie conversation orale, le tout dans le même fil. Ce ne sont pas trois applications distinctes assemblées. Ce sont trois modes d'un seul modèle multimodal, et la compétence consiste à savoir lequel mérite sa place pour une tâche donnée. Nous allons passer en revue trois prompts concrets : une maquette d'UI, un debug à partir d'une capture d'écran et un brainstorm mains libres.

Générer des images : du prompt à la maquette

La génération d'images dans ChatGPT s'appuie sur le modèle nativement multimodal d'OpenAI, pas sur un module de diffusion séparé qu'il faudrait appeler par son nom. Vous décrivez ce que vous voulez en langage courant et vous itérez dans la même conversation, c'est là le vrai avantage : le modèle conserve le contexte d'une modification à l'autre.

Essayez ceci en tant que product designer qui esquisse une landing page :

Génère une maquette épurée d'une page de pricing SaaS. Trois offres (Starter, Pro, Team), thème clair, une seule couleur d'accent en teal, beaucoup de blanc, pas de lorem ipsum, utilise des noms d'offres et des puces de fonctionnalités réalistes. 16:9.

Puis itérez sans tout redécrire :

Même mise en page, mais mets en avant Pro comme offre « la plus populaire » et resserre l'espacement vertical.

Comme le modèle garde l'image précédente en contexte, les relances du type « maintenant en dark mode » ou « remplace le teal par de l'indigo » fonctionnent vraiment. C'est là que ChatGPT bat un outil d'image en one-shot : la conversation fait office d'historique de versions.

Deux limites pratiques à intégrer. D'abord, le texte généré à l'intérieur des images est bien meilleur qu'avant mais reste imparfait au pixel près : traitez les titres comme des placeholders, pas comme la copie finale. Ensuite, c'est une maquette, pas un fichier Figma. Vous obtenez un raster plat, pas des calques éditables. Servez-vous-en pour aligner une équipe sur une direction en quelques minutes, puis reconstruisez la direction retenue dans votre vrai outil de design.

Vous pouvez aussi fournir une image *en entrée* et demander une variation : uploadez la capture d'écran d'un concurrent et dites « conçois quelque chose dans cet esprit mais pour une audience de développeurs ». Le modèle raisonne sur les pixels uploadés, ce qui fait le pont avec le mode suivant.

Vision : lire des captures d'écran, des tableaux blancs et des erreurs

La vision est l'inverse de la génération. Vous donnez une image à ChatGPT et il la lit. C'est le mode le plus sous-utilisé par les professionnels, et c'est celui qui fait gagner le plus de temps.

Le cas d'usage imparable, c'est le debug à partir d'une capture d'écran. Supposons que votre terminal crache un mur de rouge et que vous n'ayez pas envie de le lire attentivement. Faites une capture, déposez-la et demandez :

Voici l'erreur de mon build. Quelle est la cause racine et le correctif le plus petit possible ? Pars du principe qu'on est sur Node 20.

ChatGPT lit la stack trace comme du texte, identifie le module en échec et pointe généralement la vraie cause plutôt que la première ligne (souvent du bruit). Pour de meilleurs résultats, associez l'image au fichier concerné. La vision plus un extrait collé bat chacun des deux pris séparément, parce que le modèle peut croiser ce qu'il voit avec ce que vous avez écrit.

Le cas du tableau blanc est tout aussi solide. Photographiez un schéma d'architecture brouillon après une réunion et demandez :

Transcris ce tableau blanc en un document markdown structuré : les boîtes sont des services, les flèches sont des flux de données. Signale tout ce qui est ambigu.

Il transformera flèches et gribouillis en une liste de composants propre et signalera les deux flèches qu'il n'a pas pu lire. Cette consigne « signale ce qui est ambigu » compte : elle empêche le modèle d'inventer avec aplomb les parties qu'il ne voit pas.

Quelques remarques sur la précision. La vision lit l'écriture manuscrite, les diagrammes, les graphiques, les interfaces et le texte dense, mais les photos en très basse résolution ou de travers dégradent les résultats : cadrez serré et photographiez bien en face. Pour les documents sensibles, souvenez-vous que l'image est envoyée au modèle comme n'importe quelle autre entrée ; traitez-la avec le même soin qu'un texte collé. Le récapitulatif officiel de ce que les modèles compatibles vision peuvent et ne peuvent pas faire se trouve dans le guide vision d'OpenAI.

Vision et analyse de données avancée

La vision devient nettement plus utile quand vous l'enchaînez avec l'Advanced Data Analysis (le sandbox Code Interpreter vu précédemment). Uploadez la capture d'un graphique issu d'un rapport PDF et **demandez à ChatGPT d'*extraire* les chiffres sous-jacents et de reconstruire le graphique correctement** :

Lis les valeurs des barres de ce graphique, mets-les dans un tableau, puis trace une version plus propre avec des barres triées et des axes légendés.

Le modèle lit l'image, écrit du Python pour recréer les données et l'exécute dans le sandbox. Vous obtenez une vraie figure téléchargeable plus les données derrière. C'est un workflow qu'aucun outil mono-usage ne vous donne.

Voix : conversation temps réel, mains libres

Le mode voix vous permet de parler à ChatGPT et de l'entendre répondre, avec une latence assez faible pour donner l'impression d'une conversation plutôt que d'un talkie-walkie. Sous le capot, ce sont les modèles realtime speech-to-speech d'OpenAI, et c'est pour cela qu'il peut être interrompu en pleine phrase et capter votre ton, pas seulement vos mots.

La voix brille partout où vos mains ou vos yeux sont occupés. Le cas canonique est le brainstorm mains libres :

Je pars marcher. Sois mon partenaire de réflexion. Je cherche un nom pour un produit d'analytics B2B. Propose-moi cinq directions, demande-moi ce qui résonne, et ne balance pas une liste énorme, reste conversationnel.

Cette dernière consigne, c'est tout l'enjeu de la voix. Par défaut, les modèles veulent énumérer. À l'oral, une liste de quinze éléments est inutile parce que vous ne pouvez pas la parcourir des yeux. Demandez explicitement des tours de parole courts, une idée à la fois, et la capacité à vous challenger. Traitez-le comme un collègue, pas comme une barre de recherche.

Deux éléments rendent la voix bien plus puissante qu'il n'y paraît :

  • Elle partage votre mémoire et vos custom instructions. Un brainstorm vocal connaît vos projets et vos préférences comme un chat écrit, il peut donc évoquer « le flow d'onboarding dont on a parlé » sans que vous ayez à réexpliquer.
  • Elle peut être combinée avec la caméra sur mobile. Vous pouvez pointer votre téléphone vers une machine, un menu ou un tableau blanc et poser la question à voix haute. C'est la fusion de la vision et de la voix : « Que signifie cet avertissement sur le dashboard ? » en regardant l'écran.

Quand vous avez fini de marcher, toute la conversation orale est là sous forme de texte dans le fil : vous pouvez basculer sur Canvas et demander à ChatGPT de transformer ce brainstorm décousu en un one-pager serré. **Le mode dans lequel vous *commencez* ne vous enferme pas**.

Advanced Voice Mode: What It Can Actually Do

Watch on YouTube

Choisir le bon mode

L'erreur est de les traiter comme des gadgets. Faites-les correspondre à la forme de la tâche :

  • Générez une image quand vous devez *extérioriser* une idée visuelle vite : une maquette, un brouillon de diagramme, un concept pour aligner les gens. Faible enjeu sur la précision au pixel.
  • Utilisez la vision quand l'information est *prisonnière des pixels* : une capture d'erreur, un tableau blanc, un graphique dans un PDF, la photo d'un formulaire. Vous convertissez de l'image en texte structuré ou en analyse.
  • Utilisez la voix quand vos *mains ou vos yeux sont occupés* ou quand penser à voix haute vaut mieux que taper : brainstorming, exposer un problème à voix haute, dicter dans les transports.

La plupart des workflows réels les enchaînent. Photographiez un tableau blanc (vision), discutez-en pendant une marche (voix), puis faites générer par ChatGPT un diagramme d'architecture au propre (image), le tout dans un seul fil qui se souvient de tout le parcours.

Vérification des acquis

1. Selon la leçon, quel est l'avantage clé de générer des images à l'intérieur d'une conversation ChatGPT plutôt qu'avec un outil d'image en one-shot ?

2. Comment la leçon caractérise-t-elle la relation entre génération d'images et vision ?

3. Pourquoi la leçon conseille-t-elle de traiter une maquette générée comme un point de départ plutôt que comme un livrable final ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les limites pratiques des images générées mises en avant par la leçon.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les affirmations qui reflètent fidèlement la vision de la leçon sur les capacités multimodales de ChatGPT.

Sélectionnez toutes les réponses correctes.

Amener le multimodal dans l'API

Tout ce qui précède est aussi disponible par programmation, et c'est ainsi que vous l'intégrez dans un produit plutôt que de le faire à la main. La Responses API accepte texte et images dans la même requête : le workflow de debug par capture d'écran devient une fonction que votre application peut appeler.

Voici le cas vision en code : envoyer une image plus une question et récupérer une analyse structurée.

python
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-4.1",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "What's the root cause of this build error? One sentence."},
            {"type": "input_image", "image_url": "https://example.com/build-error.png"},
        ],
    }],
)

print(response.output_text)

Vous pouvez passer une URL hébergée comme ci-dessus, ou un fichier local encodé en base64, ce que vous feriez pour la capture d'écran uploadée par un utilisateur. Le même motif de tableau input gère plusieurs images : une fonctionnalité « compare ces deux états d'UI » se résume à deux entrées input_image.

Pour la *génération* d'images depuis l'API, vous appelez l'outil de génération d'images (ou l'endpoint images dédié) plutôt que les modèles de chat, et vous récupérez des données d'image que vous pouvez stocker ou afficher. Combinez cela avec les structured outputs et vous pouvez construire un pipeline qui, par exemple, lit la photo d'un reçu et renvoie des lignes JSON propres avec un schéma garanti, sans parsing fragile.

La voix dans l'API a sa propre surface : les modèles realtime alimentent le speech-to-speech, tandis que des endpoints distincts de transcription et de text-to-speech couvrent les cas plus simples de « conversion audio pure ». Si vous n'avez besoin que d'une transcription, utilisez la transcription ; passez au realtime quand il vous faut un véritable agent vocal interactif. La décision reflète celle du côté ChatGPT : conversation complète contre conversion one-shot.

Un mot sur ce qui reste dans ChatGPT

Tout ne nécessite pas l'API. Si votre objectif est un workflow multimodal *personnel* et répétable, un Custom GPT avec des instructions claires (« Chaque fois que j'uploade un graphique, extrais les données, reconstruis-le proprement et donne-moi le tableau ») le capture sans une ligne de code. L'API sert quand vous livrez la capacité à d'autres personnes au sein d'un produit.

Points clés

  • Choisissez le mode selon l'endroit où se trouve l'information. Des pixels en entrée : vision ; une idée à sortir : génération d'image ; les mains occupées : voix. La plupart des workflows solides enchaînent les trois dans un seul fil.
  • Pour la vision, associez l'image à du contexte et demandez de signaler les ambiguïtés. Une capture plus un extrait de code, plus « dis-moi ce que tu n'arrives pas à lire », bat l'image seule et évite les hallucinations assurées.
  • En voix, exigez explicitement des tours de parole courts. Les modèles partent par défaut sur de longues listes, inutiles à l'oral. Dites-lui de donner une idée à la fois et de vous challenger.
  • Enchaînez la vision avec l'Advanced Data Analysis pour transformer la capture d'un graphique en vraies données téléchargeables et en une figure reconstruite proprement.
  • Utilisez la [Responses API](https://platform.openai.com/docs/api-reference/responses) avec `input_image` quand vous devez industrialiser le workflow capture-vers-analyse, et ajoutez les structured outputs pour du JSON fiable.

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.