Bilder, Sprache und Vision
# Bilder, Sprache und Vision
ChatGPT kann ein Bild generieren, ein Foto Ihres Whiteboards oder einen Stack Trace lesen und ein echtes gesprochenes Gespräch führen, alles im selben Thread. Das sind nicht drei zusammengeschraubte Apps. Es sind drei Modi eines multimodalen Modells, und die Kunst besteht darin, zu wissen, welcher Modus sich für eine bestimmte Aufgabe rechnet. Wir gehen drei konkrete Prompts durch: ein UI-Mockup, ein Screenshot-Debugging und ein Brainstorming ohne Hände.
Bilder generieren: vom Prompt zum Mockup
Die Bildgenerierung in ChatGPT läuft über OpenAIs nativ multimodales Modell, nicht über ein separates Diffusion-Add-on, das Sie namentlich aufrufen müssen. Sie beschreiben in normaler Sprache, was Sie wollen, und iterieren im selben Gespräch. Das ist der eigentliche Vorteil: Das Modell behält den Kontext über alle Änderungen hinweg.
Probieren Sie das als Produktdesigner, der eine Landingpage skizziert:
> Generiere ein cleanes Mockup einer SaaS-Pricing-Page. Drei Tiers (Starter, Pro, Team), helles Theme, eine einzige Akzentfarbe in Petrol, großzügiger Whitespace, kein Lorem Ipsum, realistische Plannamen und Feature-Bullets. 16:9.
Dann iterieren Sie, ohne alles neu zu beschreiben:
> Gleiches Layout, aber mach Pro zum hervorgehobenen "most popular"-Tier und straffe die vertikalen Abstände.
Weil das Modell das vorherige Bild als Kontext behält, funktionieren Folgeanweisungen wie „jetzt im Dark Mode“ oder „tausche Petrol gegen Indigo“ tatsächlich. Hier schlägt ChatGPT ein One-Shot-Bildtool: Das Gespräch ist die Versionshistorie.
Zwei praktische Grenzen sollten Sie sich einprägen. Erstens: Generierter Text innerhalb von Bildern ist deutlich besser als früher, aber noch nicht pixelgenau. Behandeln Sie Überschriften als Platzhalter, nicht als finale Copy. Zweitens: Das ist ein Mockup, kein Figma-File. Sie bekommen ein flaches Raster, keine editierbaren Ebenen. Nutzen Sie es, um ein Team in Minuten auf eine Richtung einzuschwören, und bauen Sie die gewählte Richtung dann in Ihrem echten Design-Tool nach.
Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen ein Bild auch *hineingeben* und um eine Variation bitten: Laden Sie den Screenshot eines Wettbewerbers hoch und sagen Sie „entwirf etwas in diesem Geist, aber für ein Entwicklerpublikum“. Das Modell denkt über die hochgeladenen Pixel nach, und das ist die BrBrThe percentage of visitors who leave after viewing only one page, often a signal of poor relevance, mismatched intent, or weak user experience.Vollständige Definition ansehen →ücke zum nächsten Modus.
Vision: Screenshots, Whiteboards und Fehler lesen
Vision ist die Umkehrung der Generierung. Sie geben ChatGPT ein Bild, und es liest es. Das ist der Modus, den die meisten Profis zu selten nutzen, und derjenige, der am meisten Zeit spart.
Der Killer-Use-Case ist Debugging aus einem Screenshot. Angenommen, Ihr Terminal spuckt eine Wand aus Rot aus und Sie haben keine Lust, sie sorgfältig zu lesen. Screenshot machen, reinziehen, fragen:
> Hier ist der Fehler aus meinem Build. Was ist die Root Cause und der kleinstmögliche Fix? Nimm Node 20 an.
ChatGPT liest den Stack Trace als Text, identifiziert das fehlerhafte Modul und zeigt meist auf die echte Ursache statt auf die oberste Zeile (die oft nur Rauschen ist). Für beste Ergebnisse kombinieren Sie das Bild mit der relevanten Datei. Vision plus ein eingefügtes Snippet schlägt beides einzeln, weil das Modell abgleichen kann, was es sieht, mit dem, was Sie geschrieben haben.
Der Whiteboard-Fall ist genauso stark. Fotografieren Sie nach einem Meeting eine chaotische Architekturskizze und fragen Sie:
> Übertrage dieses Whiteboard in ein strukturiertes Markdown-Dokument: Die KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →ästen sind Services, die Pfeile sind Datenflüsse. Markiere alles Unklare.
Es verwandelt Pfeile und Gekrakel in eine saubere Komponentenliste und weist auf die beiden Pfeile hin, die es nicht lesen konnte. Die Anweisung „markiere alles Unklare“ ist wichtig: Sie verhindert, dass das Modell die Teile, die es nicht sehen kann, selbstbewusst erfindet.
Ein paar Hinweise zur Genauigkeit. Vision liest Handschrift, Diagramme, Charts, UI und dichten Text, aber sehr niedrig aufgelöste oder schiefe Fotos verschlechtern die Ergebnisse. Also eng zuschneiden und frontal fotografieren. Bei sensiblen Dokumenten gilt: Das Bild wird wie jeder andere Input an das Modell geschickt, behandeln Sie es mit derselben Vorsicht wie eingefügten Text. Die offizielle Übersicht darüber, was die vision-fähigen Modelle kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen und was nicht, findet sich im OpenAI Vision Guide.
Vision plus Advanced Data Analysis
Vision wird deutlich nützlicher, wenn Sie es mit Advanced Data Analysis verketten (die Code-Interpreter-Sandbox, die Sie vorhin kennengelernt haben). Laden Sie den Screenshot eines Charts aus einem PDF-Report hoch und bitten Sie ChatGPT, die zugrunde liegenden Zahlen zu *extrahieren* und den Chart richtig neu zu bauen:
> Lies die Balkenwerte aus diesem Chart ab, schreibe sie in eine Tabelle und plotte dann eine saubere Version mit sortierten Balken und beschrifteten Achsen.
Das Modell liest das Bild, schreibt Python, um die Daten zu rekonstruieren, und führt es in der Sandbox aus. Sie bekommen eine echte, herunterladbare Abbildung plus die Daten dahinter. Diesen Workflow liefert Ihnen kein Single-Purpose-Tool.
Sprache: freihändig, in Echtzeit
Der Voice Mode lässt Sie mit ChatGPT sprechen und es antwortet gesprochen, mit so geringer Latenz, dass es sich wie ein Gespräch anfühlt und nicht wie ein Walkie-Talkie. Darunter arbeiten OpenAIs Realtime-Speech-to-Speech-Modelle, weshalb man es mitten im Satz unterbrechen kann und es Ihren Tonfall aufnimmt, nicht nur Ihre Worte.
Sprache glänzt überall, wo Ihre Hände oder Augen beschäftigt sind. Der Standardfall ist das freihändige Brainstorming:
> Ich gehe spazieren. Sei mein Denkpartner. Ich suche einen Namen für ein B2B-Analytics-Produkt. Wirf mir fünf Richtungen hin, frag mich, was resoniert, und schütte keine Riesenliste aus, bleib im Gesprächsmodus.
Diese letzte Anweisung ist bei Sprache das Entscheidende. Standardmäßig wollen Modelle aufzählen. Im Sprachmodus ist eine Liste mit fünfzehn Punkten nutzlos, weil Sie sie nicht scannen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Bitten Sie explizit um kurze Redebeiträge, eine Idee pro Zug, und um die Erlaubnis zu widersprechen. Behandeln Sie es wie eine Kollegin, nicht wie ein Suchfeld.
Zwei Dinge machen Sprache viel mächtiger, als es zunächst wirkt:
- Es teilt Ihr Memory und Ihre Custom Instructions. Ein Voice-Brainstorming kennt Ihre Projekte und Vorlieben genauso wie ein getippter Chat, kann also auf „den Onboarding-Flow, über den wir gesprochen haben“ verweisen, ohne dass Sie erneut erklären müssen.
- Es lässt sich mobil mit der Kamera kombinieren. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Ihr Handy auf eine Maschine, eine Speisekarte oder ein Whiteboard richten und laut danach fragen. Das ist Vision und Sprache verschmolzen: „Was bedeutet diese Dashboard-Warnung?“, während Sie auf den Bildschirm schauen.
Wenn Sie mit dem Spaziergang fertig sind, steht das gesamte gesprochene Gespräch als Text im Thread. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen also zu Canvas wechseln und ChatGPT bitten, aus dem ausschweifenden Brainstorming ein knappes One-Pager zu machen. Der Modus, in dem Sie *starten*, legt Sie nicht fest.
Advanced Voice Mode: What It Can Actually Do
Den richtigen Modus wählen
Der Fehler ist, diese Dinge als Spielerei zu behandeln. Ordnen Sie sie der Form der Aufgabe zu:
- Ein Bild generieren, wenn Sie eine visuelle Idee schnell *nach außen bringen* müssen: ein Mockup, ein Diagrammentwurf, ein Konzept, um Leute auszurichten. Geringe Anforderungen an Pixelpräzision.
- Vision nutzen, wenn die Information *in Pixeln gefangen* ist: ein Fehler-Screenshot, ein Whiteboard, ein Chart in einem PDF, das Foto eines Formulars. Sie wandeln Bild in strukturierten Text oder Analyse um.
- Sprache nutzen, wenn Ihre *Hände oder Augen belegt* sind oder wenn laut denken besser funktioniert als tippen: Brainstorming, ein Problem durchsprechen, Diktieren auf dem Weg zur Arbeit.
Die meisten echten Workflows verketten sie. Whiteboard fotografieren (Vision), beim Spaziergang darüber sprechen (Sprache), dann ChatGPT ein aufgeräumtes Architekturdiagramm generieren lassen (Bild), alles in einem Thread, der den ganzen Bogen erinnert.
Wissenscheck
1. Was ist laut Lektion der zentrale Vorteil davon, Bilder innerhalb eines ChatGPT-Gesprächs zu generieren, statt ein One-Shot-Bildtool zu nutzen?
2. Wie beschreibt die Lektion das Verhältnis zwischen Bildgenerierung und Vision?
3. Warum empfiehlt die Lektion, ein generiertes Mockup als Ausgangspunkt und nicht als finales Deliverable zu behandeln?
4. Wählen Sie ALLE praktischen Grenzen generierter Bilder, die die Lektion hervorhebt.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE Aussagen, die die Sicht der Lektion auf ChatGPTs multimodale Fähigkeiten korrekt wiedergeben.
Wählen Sie alle richtigen Antworten aus.
Multimodalität in die APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → bringen
Alles oben Genannte ist auch programmatisch verfügbar, und so bauen Sie es in ein Produkt ein, statt es von Hand zu machen. Die Responses API akzeptiert Text und Bilder in derselben Anfrage, sodass aus dem Screenshot-Debugging-Workflow eine Funktion wird, die Ihre App aufrufen kann.
Hier der Vision-Fall als Code: ein Bild plus eine Frage senden und strukturierte Analyse zurückbekommen.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-4.1",
input=[{
"role": "user",
"content": [
{"type": "input_text", "text": "What's the root cause of this build error? One sentence."},
{"type": "input_image", "image_url": "https://example.com/build-error.png"},
],
}],
)
print(response.output_text)Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen wie gezeigt eine gehostete URL übergeben oder eine base64-codierte lokale Datei, was Sie für den hochgeladenen Screenshot eines Nutzers tun würden. Dasselbe input-Array-Muster verarbeitet mehrere Bilder, ein Feature „vergleiche diese zwei UI-Zustände“ sind also einfach zwei input_image-Einträge.
Für die Bild*generierung* über die APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → rufen Sie das Image-Generation-Tool auf (oder den dedizierten Images-Endpoint) statt der Chat-Modelle, und Sie erhalten Bilddaten zurück, die Sie speichern oder anzeigen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Kombinieren Sie das mit Structured Outputs, und Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen eine PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen → bauen, die etwa ein Belegfoto liest und saubere JSON-Positionen mit garantiertem SchemaSchemaA schema is the formal blueprint that defines how data is structured, named, typed, and related within a database, file, or message.Vollständige Definition ansehen → zurückgibt, ohne fragiles Parsing.
Sprache in der APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → ist eine eigene Fläche: Die Realtime-Modelle treiben Speech-to-Speech an, während separate Transkriptions- und Text-to-Speech-Endpoints die einfacheren Fälle „nur Audio umwandeln“ abdecken. Wenn Sie nur ein Transkript brauchen, nehmen Sie Transkription; greifen Sie zu Realtime, wenn Sie einen echten interaktiven Voice Agent brauchen. Die Entscheidung spiegelt die ChatGPT-Seite: vollständiges Gespräch versus One-Shot-Umwandlung.
Eine Anmerkung dazu, was in ChatGPT bleibt
Nicht alles braucht die APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →. Wenn Ihr Ziel ein wiederholbarer *persönlicher* multimodaler Workflow ist, hält ein Custom GPT mit klaren Anweisungen („Immer wenn ich einen Chart hochlade, extrahiere die Daten, baue ihn sauber neu und gib mir die Tabelle“) ihn ohne eine Zeile Code fest. Die APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → ist für den Fall, dass Sie die Fähigkeit innerhalb eines Produkts an andere Leute ausliefern.
Key Takeaways
- Wählen Sie den Modus danach, wo die Information liegt. Pixel rein, dann Vision; Idee raus, dann Bild generieren; Hände belegt, dann Sprache. Die meisten starken Workflows verketten alle drei in einem Thread.
- Bei Vision kombinieren Sie das Bild mit Kontext und lassen Unklarheiten markieren. Ein Screenshot plus ein Code-Snippet plus „sag mir, was du nicht lesen kannst“ schlägt das Bild allein und verhindert selbstbewusste Halluzination.
- Fordern Sie im Sprachmodus explizit kurze Gesprächszüge. Modelle tendieren zu langen Listen, die laut gesprochen nutzlos sind. Sagen Sie, dass es eine Idee pro Zug liefern und Ihnen widersprechen soll.
- Verketten Sie Vision mit Advanced Data Analysis, um aus einem Chart-Screenshot echte, herunterladbare Daten und eine saubere neu gebaute Abbildung zu machen.
- Greifen Sie zur [Responses API](https://platform.openai.com/docs/api-reference/responses) mit `input_image`, wenn Sie den Workflow von Screenshot zu Analyse produktisieren wollen, und ergänzen Sie Structured Outputs für zuverlässiges JSON.
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- KIMultimodale KI im Arbeitsalltag: ein praktisches Playbook für Text, Bild, Sprache und VideoDie meisten Fachkräfte behandeln multimodale KI noch als Kuriosität und nicht als tägliches Werkzeug im Workflow. Dieses Playbook zeigt Ihnen, wie Sie Text-, Bild-, Sprach- und Videofunktionen für konkrete Geschäftsaufgaben kombinieren, und zwar ab dieser Woche.
- KIMultimodale KI erklärt: was es bedeutet, wenn ein Modell gleichzeitig sehen, hören und lesen kannMultimodale KI erlaubt es einem einzigen Modell, Text, Bilder, Audio und Video gemeinsam zu verarbeiten, statt jedes davon als separates Problem zu behandeln. Wer versteht, wie das funktioniert und wo es an Grenzen stößt, gestaltet KI-gestützte Workflows anders.