+160 XP

Bilder, Sprache und Vision

# Bilder, Sprache und Vision

ChatGPT kann ein Bild generieren, ein Foto Ihres Whiteboards oder einen Stack Trace lesen und ein echtes gesprochenes Gespräch führen, alles im selben Thread. Das sind nicht drei zusammengeschraubte Apps. Es sind drei Modi eines multimodalen Modells, und die Kunst besteht darin, zu wissen, welcher Modus sich für eine bestimmte Aufgabe rechnet. Wir gehen drei konkrete Prompts durch: ein UI-Mockup, ein Screenshot-Debugging und ein Brainstorming ohne Hände.

Bilder generieren: vom Prompt zum Mockup

Die Bildgenerierung in ChatGPT läuft über OpenAIs nativ multimodales Modell, nicht über ein separates Diffusion-Add-on, das Sie namentlich aufrufen müssen. Sie beschreiben in normaler Sprache, was Sie wollen, und iterieren im selben Gespräch. Das ist der eigentliche Vorteil: Das Modell behält den Kontext über alle Änderungen hinweg.

Probieren Sie das als Produktdesigner, der eine Landingpage skizziert:

> Generiere ein cleanes Mockup einer SaaS-Pricing-Page. Drei Tiers (Starter, Pro, Team), helles Theme, eine einzige Akzentfarbe in Petrol, großzügiger Whitespace, kein Lorem Ipsum, realistische Plannamen und Feature-Bullets. 16:9.

Dann iterieren Sie, ohne alles neu zu beschreiben:

> Gleiches Layout, aber mach Pro zum hervorgehobenen "most popular"-Tier und straffe die vertikalen Abstände.

Weil das Modell das vorherige Bild als Kontext behält, funktionieren Folgeanweisungen wie „jetzt im Dark Mode“ oder „tausche Petrol gegen Indigo“ tatsächlich. Hier schlägt ChatGPT ein One-Shot-Bildtool: Das Gespräch ist die Versionshistorie.

Zwei praktische Grenzen sollten Sie sich einprägen. Erstens: Generierter Text innerhalb von Bildern ist deutlich besser als früher, aber noch nicht pixelgenau. Behandeln Sie Überschriften als Platzhalter, nicht als finale Copy. Zweitens: Das ist ein Mockup, kein Figma-File. Sie bekommen ein flaches Raster, keine editierbaren Ebenen. Nutzen Sie es, um ein Team in Minuten auf eine Richtung einzuschwören, und bauen Sie die gewählte Richtung dann in Ihrem echten Design-Tool nach.

Sie können ein Bild auch *hineingeben* und um eine Variation bitten: Laden Sie den Screenshot eines Wettbewerbers hoch und sagen Sie „entwirf etwas in diesem Geist, aber für ein Entwicklerpublikum“. Das Modell denkt über die hochgeladenen Pixel nach, und das ist die Brücke zum nächsten Modus.

Vision: Screenshots, Whiteboards und Fehler lesen

Vision ist die Umkehrung der Generierung. Sie geben ChatGPT ein Bild, und es liest es. Das ist der Modus, den die meisten Profis zu selten nutzen, und derjenige, der am meisten Zeit spart.

Der Killer-Use-Case ist Debugging aus einem Screenshot. Angenommen, Ihr Terminal spuckt eine Wand aus Rot aus und Sie haben keine Lust, sie sorgfältig zu lesen. Screenshot machen, reinziehen, fragen:

> Hier ist der Fehler aus meinem Build. Was ist die Root Cause und der kleinstmögliche Fix? Nimm Node 20 an.

ChatGPT liest den Stack Trace als Text, identifiziert das fehlerhafte Modul und zeigt meist auf die echte Ursache statt auf die oberste Zeile (die oft nur Rauschen ist). Für beste Ergebnisse kombinieren Sie das Bild mit der relevanten Datei. Vision plus ein eingefügtes Snippet schlägt beides einzeln, weil das Modell abgleichen kann, was es sieht, mit dem, was Sie geschrieben haben.

Der Whiteboard-Fall ist genauso stark. Fotografieren Sie nach einem Meeting eine chaotische Architekturskizze und fragen Sie:

> Übertrage dieses Whiteboard in ein strukturiertes Markdown-Dokument: Die Kästen sind Services, die Pfeile sind Datenflüsse. Markiere alles Unklare.

Es verwandelt Pfeile und Gekrakel in eine saubere Komponentenliste und weist auf die beiden Pfeile hin, die es nicht lesen konnte. Die Anweisung „markiere alles Unklare“ ist wichtig: Sie verhindert, dass das Modell die Teile, die es nicht sehen kann, selbstbewusst erfindet.

Ein paar Hinweise zur Genauigkeit. Vision liest Handschrift, Diagramme, Charts, UI und dichten Text, aber sehr niedrig aufgelöste oder schiefe Fotos verschlechtern die Ergebnisse. Also eng zuschneiden und frontal fotografieren. Bei sensiblen Dokumenten gilt: Das Bild wird wie jeder andere Input an das Modell geschickt, behandeln Sie es mit derselben Vorsicht wie eingefügten Text. Die offizielle Übersicht darüber, was die vision-fähigen Modelle können und was nicht, findet sich im OpenAI Vision Guide.

Vision plus Advanced Data Analysis

Vision wird deutlich nützlicher, wenn Sie es mit Advanced Data Analysis verketten (die Code-Interpreter-Sandbox, die Sie vorhin kennengelernt haben). Laden Sie den Screenshot eines Charts aus einem PDF-Report hoch und bitten Sie ChatGPT, die zugrunde liegenden Zahlen zu *extrahieren* und den Chart richtig neu zu bauen:

> Lies die Balkenwerte aus diesem Chart ab, schreibe sie in eine Tabelle und plotte dann eine saubere Version mit sortierten Balken und beschrifteten Achsen.

Das Modell liest das Bild, schreibt Python, um die Daten zu rekonstruieren, und führt es in der Sandbox aus. Sie bekommen eine echte, herunterladbare Abbildung plus die Daten dahinter. Diesen Workflow liefert Ihnen kein Single-Purpose-Tool.

Sprache: freihändig, in Echtzeit

Der Voice Mode lässt Sie mit ChatGPT sprechen und es antwortet gesprochen, mit so geringer Latenz, dass es sich wie ein Gespräch anfühlt und nicht wie ein Walkie-Talkie. Darunter arbeiten OpenAIs Realtime-Speech-to-Speech-Modelle, weshalb man es mitten im Satz unterbrechen kann und es Ihren Tonfall aufnimmt, nicht nur Ihre Worte.

Sprache glänzt überall, wo Ihre Hände oder Augen beschäftigt sind. Der Standardfall ist das freihändige Brainstorming:

> Ich gehe spazieren. Sei mein Denkpartner. Ich suche einen Namen für ein B2B-Analytics-Produkt. Wirf mir fünf Richtungen hin, frag mich, was resoniert, und schütte keine Riesenliste aus, bleib im Gesprächsmodus.

Diese letzte Anweisung ist bei Sprache das Entscheidende. Standardmäßig wollen Modelle aufzählen. Im Sprachmodus ist eine Liste mit fünfzehn Punkten nutzlos, weil Sie sie nicht scannen können. Bitten Sie explizit um kurze Redebeiträge, eine Idee pro Zug, und um die Erlaubnis zu widersprechen. Behandeln Sie es wie eine Kollegin, nicht wie ein Suchfeld.

Zwei Dinge machen Sprache viel mächtiger, als es zunächst wirkt:

  • Es teilt Ihr Memory und Ihre Custom Instructions. Ein Voice-Brainstorming kennt Ihre Projekte und Vorlieben genauso wie ein getippter Chat, kann also auf „den Onboarding-Flow, über den wir gesprochen haben“ verweisen, ohne dass Sie erneut erklären müssen.
  • Es lässt sich mobil mit der Kamera kombinieren. Sie können Ihr Handy auf eine Maschine, eine Speisekarte oder ein Whiteboard richten und laut danach fragen. Das ist Vision und Sprache verschmolzen: „Was bedeutet diese Dashboard-Warnung?“, während Sie auf den Bildschirm schauen.

Wenn Sie mit dem Spaziergang fertig sind, steht das gesamte gesprochene Gespräch als Text im Thread. Sie können also zu Canvas wechseln und ChatGPT bitten, aus dem ausschweifenden Brainstorming ein knappes One-Pager zu machen. Der Modus, in dem Sie *starten*, legt Sie nicht fest.

Advanced Voice Mode: What It Can Actually Do

Watch on YouTube

Den richtigen Modus wählen

Der Fehler ist, diese Dinge als Spielerei zu behandeln. Ordnen Sie sie der Form der Aufgabe zu:

  • Ein Bild generieren, wenn Sie eine visuelle Idee schnell *nach außen bringen* müssen: ein Mockup, ein Diagrammentwurf, ein Konzept, um Leute auszurichten. Geringe Anforderungen an Pixelpräzision.
  • Vision nutzen, wenn die Information *in Pixeln gefangen* ist: ein Fehler-Screenshot, ein Whiteboard, ein Chart in einem PDF, das Foto eines Formulars. Sie wandeln Bild in strukturierten Text oder Analyse um.
  • Sprache nutzen, wenn Ihre *Hände oder Augen belegt* sind oder wenn laut denken besser funktioniert als tippen: Brainstorming, ein Problem durchsprechen, Diktieren auf dem Weg zur Arbeit.

Die meisten echten Workflows verketten sie. Whiteboard fotografieren (Vision), beim Spaziergang darüber sprechen (Sprache), dann ChatGPT ein aufgeräumtes Architekturdiagramm generieren lassen (Bild), alles in einem Thread, der den ganzen Bogen erinnert.

Wissenscheck

1. Was ist laut Lektion der zentrale Vorteil davon, Bilder innerhalb eines ChatGPT-Gesprächs zu generieren, statt ein One-Shot-Bildtool zu nutzen?

2. Wie beschreibt die Lektion das Verhältnis zwischen Bildgenerierung und Vision?

3. Warum empfiehlt die Lektion, ein generiertes Mockup als Ausgangspunkt und nicht als finales Deliverable zu behandeln?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE praktischen Grenzen generierter Bilder, die die Lektion hervorhebt.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE Aussagen, die die Sicht der Lektion auf ChatGPTs multimodale Fähigkeiten korrekt wiedergeben.

Wählen Sie alle richtigen Antworten aus.

Multimodalität in die API bringen

Alles oben Genannte ist auch programmatisch verfügbar, und so bauen Sie es in ein Produkt ein, statt es von Hand zu machen. Die Responses API akzeptiert Text und Bilder in derselben Anfrage, sodass aus dem Screenshot-Debugging-Workflow eine Funktion wird, die Ihre App aufrufen kann.

Hier der Vision-Fall als Code: ein Bild plus eine Frage senden und strukturierte Analyse zurückbekommen.

python
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-4.1",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "What's the root cause of this build error? One sentence."},
            {"type": "input_image", "image_url": "https://example.com/build-error.png"},
        ],
    }],
)

print(response.output_text)

Sie können wie gezeigt eine gehostete URL übergeben oder eine base64-codierte lokale Datei, was Sie für den hochgeladenen Screenshot eines Nutzers tun würden. Dasselbe input-Array-Muster verarbeitet mehrere Bilder, ein Feature „vergleiche diese zwei UI-Zustände“ sind also einfach zwei input_image-Einträge.

Für die Bild*generierung* über die API rufen Sie das Image-Generation-Tool auf (oder den dedizierten Images-Endpoint) statt der Chat-Modelle, und Sie erhalten Bilddaten zurück, die Sie speichern oder anzeigen können. Kombinieren Sie das mit Structured Outputs, und Sie können eine Pipeline bauen, die etwa ein Belegfoto liest und saubere JSON-Positionen mit garantiertem Schema zurückgibt, ohne fragiles Parsing.

Sprache in der API ist eine eigene Fläche: Die Realtime-Modelle treiben Speech-to-Speech an, während separate Transkriptions- und Text-to-Speech-Endpoints die einfacheren Fälle „nur Audio umwandeln“ abdecken. Wenn Sie nur ein Transkript brauchen, nehmen Sie Transkription; greifen Sie zu Realtime, wenn Sie einen echten interaktiven Voice Agent brauchen. Die Entscheidung spiegelt die ChatGPT-Seite: vollständiges Gespräch versus One-Shot-Umwandlung.

Eine Anmerkung dazu, was in ChatGPT bleibt

Nicht alles braucht die API. Wenn Ihr Ziel ein wiederholbarer *persönlicher* multimodaler Workflow ist, hält ein Custom GPT mit klaren Anweisungen („Immer wenn ich einen Chart hochlade, extrahiere die Daten, baue ihn sauber neu und gib mir die Tabelle“) ihn ohne eine Zeile Code fest. Die API ist für den Fall, dass Sie die Fähigkeit innerhalb eines Produkts an andere Leute ausliefern.

Key Takeaways

  • Wählen Sie den Modus danach, wo die Information liegt. Pixel rein, dann Vision; Idee raus, dann Bild generieren; Hände belegt, dann Sprache. Die meisten starken Workflows verketten alle drei in einem Thread.
  • Bei Vision kombinieren Sie das Bild mit Kontext und lassen Unklarheiten markieren. Ein Screenshot plus ein Code-Snippet plus „sag mir, was du nicht lesen kannst“ schlägt das Bild allein und verhindert selbstbewusste Halluzination.
  • Fordern Sie im Sprachmodus explizit kurze Gesprächszüge. Modelle tendieren zu langen Listen, die laut gesprochen nutzlos sind. Sagen Sie, dass es eine Idee pro Zug liefern und Ihnen widersprechen soll.
  • Verketten Sie Vision mit Advanced Data Analysis, um aus einem Chart-Screenshot echte, herunterladbare Daten und eine saubere neu gebaute Abbildung zu machen.
  • Greifen Sie zur [Responses API](https://platform.openai.com/docs/api-reference/responses) mit `input_image`, wenn Sie den Workflow von Screenshot zu Analyse produktisieren wollen, und ergänzen Sie Structured Outputs für zuverlässiges JSON.

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.