Glossar
KI

Inference

Auch: Model Inference, AI Inference, Inferencing, Inference serving, Inférence, Inférence de modèle, Modell-Inferenz

Der Moment, in dem ein trainiertes KI-Modell arbeitet: Es nimmt eine neue Eingabe und erzeugt eine Antwort, Vorhersage oder generierte Ausgabe.

Was es ist

Inference ist die Ausführungsphase eines KI-Modells. Beim Training lernt das Modell aus Daten; bei der Inference wendet es das Gelernte auf etwas Neues an. Jedes Mal, wenn ein Nutzer eine Frage in einen Chatbot eingibt und eine Antwort erhält, ist dieser eine Anfrage-und-Antwort-Zyklus eine Inference. Ein CMO begegnet der Inference, wenn eine Empfehlungs-Engine einen Besucher bewertet und das passende Angebot auswählt. Ein CFO begegnet ihr, wenn ein Betrugsmodell eine Transaktion in Echtzeit markiert. Das Modell verändert sich nicht mehr, es erzeugt Ausgaben.

Warum es wichtig ist

Inference ist der Punkt, an dem KI auf Ihre Gewinn- und Verlustrechnung trifft, denn es ist der Teil, den Sie wiederholt bezahlen. Training findet gelegentlich statt, aber Inference läuft bei jeder Nutzung, und die Kosten skalieren mit dem Volumen. Ein Modell, das günstig zu bauen ist, kann im Betrieb dennoch teuer sein, wenn täglich Millionen von Inferences laufen. Für Führungskräfte verändert das die Budgetdiskussion: Die eigentliche Frage lautet nicht nur "was kostet der Aufbau", sondern "was kostet jede Antwort, mal wie viele Antworten pro Monat". Inference bestimmt auch direkt die Kundenerfahrung. Langsame Inference bedeutet einen trägen Assistenten; unzuverlässige Inference bedeutet, dass falsche Empfehlungen bei Kunden landen. Latenz, Kosten pro Aufruf und Genauigkeit zum Zeitpunkt der Inference sind die Kennzahlen, die entscheiden, ob eine KI-Funktion in Produktion geht oder im Labor bleibt.

Wie es funktioniert

Zum Zeitpunkt der Inference sitzt das trainierte Modell hinter einer API oder ist in eine Anwendung eingebettet. Eine Anfrage trifft ein (ein Prompt, ein Bild, eine Reihe von Kundenattributen), das Modell verarbeitet sie und liefert ein Ergebnis, meist innerhalb von Millisekunden bis Sekunden. Je schwerer das Modell, desto mehr Rechenleistung verbraucht jede Inference, weshalb Teams Modellgröße gegen Geschwindigkeit und Kosten abwägen. Techniken wie Model Distillation und kleinere Kontextfenster existieren größtenteils, um Inference günstiger und schneller zu machen. Als Führungskraft begegnen Sie der Inference in der Preisgestaltung von Anbietern (oft pro Token oder pro Aufruf abgerechnet), in Latenz-Service-Levels und in der Kapazitätsplanung, wenn eine Funktion plötzlich beliebt wird.