6 A B C D E F G H I K L M N O P Q R S T U V W Z

Inference – Phasen der Modellnutzung

Inference – Phasen der Modellnutzung

Einfach erklärt

Inference bedeutet: Das fertig trainierte Modell wird benutzt, um auf neue Eingaben Antworten oder Vorhersagen zu liefern. Beim Training lernt das Modell; bei der Inference wendet es sein Wissen an.

Kurz: Eingabe vorbereiten → Modell rechnet vorwärts → Ausgabe interpretieren → bereitstellen/ausspielen.

Ganz einfache Beispiele

• Prüfung: Lernen passiert im Unterricht (Training). In der Prüfung beantwortest du Fragen – das ist Inference.

• Barista: Im Kurs übst du Cappuccino (Training). Im Café bereitest du jeden Drink auf Bestellung zu – Inference.

• Navigation: Karten und Verkehrsdaten dienen zum Lernen (Training). Die Routenberechnung auf deiner Anfrage ist Inference.

Professionelle Definition

Inference ist die Ausführungsphase eines trainierten Modells, in der neue, zuvor ungesehene Daten verarbeitet und Vorhersagen/Ausgaben erzeugt werden. Die Modellparameter bleiben fix; es findet kein Gewichtsupdate statt. Je nach Modell kann die Ausgabe deterministisch (z. B. Argmax) oder stochastisch (z. B. Sampling bei Sprachmodellen) sein.

Typische Phasen der Inference-Pipeline:

  1. Vorverarbeitung (Preprocessing): Eingabe in Modellformat bringen (z. B. Tokenisierung/Normalisierung, Resize/Crop bei Bildern, Feature-Engineering für Tabulardaten).
  2. Modellausführung (Forward Pass): Die vorbereiteten Daten werden durch das Modell geleitet; es entstehen Scores/Wahrscheinlichkeiten/Logits.
  3. Postprocessing: Umwandlung der Roh-Ausgabe in Labels, Text, Aktionen (z. B. Decoding bei LLMs, NMS bei Objekterkennung, Kalibrierung von Wahrscheinlichkeiten).
  4. Serving/Deployment: Bereitstellung als API, Batch-Job oder On‑Device (Latenz-, Durchsatz- und Kostenanforderungen bestimmen die Architektur).

Abgrenzungen und Praxisfälle:

  • Training vs. Inference: Training passt Gewichte an; Inference nutzt feste Gewichte.
  • Batch‑Inference: Viele Eingaben gemeinsam verarbeiten für Effizienz (z. B. nächtliche Scorings).
  • Online‑/Echtzeit‑Inference: Einzelanfragen sofort beantworten (z. B. Chatbots, Empfehlungen).
  • Edge‑Inference: Ausführung auf Endgeräten (Smartphone, Kamera) für geringere Latenz/Kosten und Datenschutz.
  • Serverless/Cloud Inference: Bedarfsorientiertes Skalieren von Rechenressourcen; Kaltstart‑Latenzen beachten.
  • Streaming‑/Token‑Weise Inference: Teilergebnisse früh liefern (z. B. Token‑Streaming bei LLMs) zur besseren UX.

Warum wichtig:

  • Macht KI anwendbar – vom Voice‑Assistent bis zur Qualitätsprüfung.
  • Bestimmt Antwortzeit (Latenz), Durchsatz, Kosten und Energiebedarf.
  • Kritisch für Produktionsqualität, Zuverlässigkeit und Sicherheit (Input‑Validierung, Monitoring).

Quellen

  1. Goodfellow, Bengio, Courville (2016) – Deep Learning (Kapitel zu Inference) https://www.deeplearningbook.org/
  2. NVIDIA – TensorRT: Optimierung für Inference https://developer.nvidia.com/tensorrt
  3. ONNX Runtime – High‑Performance Inference Engine https://onnxruntime.ai/
  4. PyTorch – TorchScript/JIT und Inference https://pytorch.org/docs/stable/jit.html
  5. Google Cloud – Serving & Deployment (Model Inference) https://cloud.google.com/ai-platform

Quellen

  1. Goodfellow, Bengio, Courville (2016) – Deep Learning (Kapitel zu Inference) https://www.deeplearningbook.org/
  2. NVIDIA – TensorRT: Optimierung für Inference https://developer.nvidia.com/tensorrt
  3. ONNX Runtime – High‑Performance Inference Engine https://onnxruntime.ai/
  4. PyTorch – TorchScript/JIT und Inference https://pytorch.org/docs/stable/jit.html
  5. Google Cloud – Serving & Deployment (Model Inference) https://cloud.google.com/ai-platform

Quellen

  1. Goodfellow, Bengio, Courville (2016) – Deep Learning — https://www.deeplearningbook.org/
  2. NVIDIA – TensorRT: Optimierung für Inference — https://developer.nvidia.com/tensorrt
  3. ONNX Runtime – High‑Performance Inference Engine — https://onnxruntime.ai/
  4. PyTorch – TorchScript/JIT und Inference — https://pytorch.org/docs/stable/jit.html
  5. Google Cloud – Serving & Deployment (Model Inference) — https://cloud.google.com/ai-platform