6 A B C D E F G H I K L M N O P Q R S T U V W Z

Knowledge Distillation

Knowledge Distillation – Wissensdestillation, Kurze Definition: Knowledge Distillation (KD) ist eine Methode, bei der ein großes, gut funktionierendes Lehrer‑Modell einem kleineren Schüler‑Modell beibringt, wie es ähnliche Vorhersagen machen kann. Ziel: nahezu gleiche Qualität bei deutlich weniger Rechenaufwand.

Alltagsbeispiel: Stell dir eine erfahrene Köchin vor (Lehrerin), die einem Azubi (Schüler) nicht nur das Rezept gibt, sondern auch die feinen Hinweise: „Probier ab, wenn es so riecht, ist es richtig.“ Der Azubi lernt schneller und kocht fast so gut – mit weniger Zutaten und Aufwand.

Warum wichtig (Praxisnutzen):

  • Spart Rechenkosten und Energie: kleinere Modelle laufen günstiger auf Servern und Edge‑Geräten.
  • Geringere Latenz → schnellere Antworten in Apps und Services.
  • Ermöglicht On‑Device‑AI (Smartphones, IoT), wo Speicher und Leistung begrenzt sind.

Ablauf in Phasen:

  1. Lehrer wählen – ein starkes, vortrainiertes Modell mit guter Qualität.
  2. Schüler entwerfen – kleineres Architektur‑Design (weniger Schichten/Parameter).
  3. Distillationssignale festlegen – der Schüler lernt nicht nur von harten Labels, sondern von weichen Zielen des Lehrers (z. B. Klassenwahrscheinlichkeiten, Zwischen‑Features, Attention‑Maps).
  4. Training des Schülers – kombiniere Standard‑Training (mit echten Labels) und Distillation‑Verlust (Annäherung an Lehrer‑Ausgaben).
  5. Evaluation & Tuning – Qualität, Größe, Latenz und Durchsatz messen; ggf. Architektur/Hyperparameter anpassen.

Wichtige Varianten:

  • Logit‑/Soft‑Label‑Distillation: Schüler imitiert Lehrer‑Wahrscheinlichkeiten.
  • Feature‑/Intermediate‑Distillation: Schüler lernt aus Zwischenrepräsentationen.
  • Self‑Distillation: Modell destilliert in sich selbst (z. B. spätere Schichten lehren frühere Varianten).
  • Ensemble‑to‑Single: Mehrere Lehrer → ein kompakter Schüler.

Abgrenzung:

  • Verwechselt mit: Quantisierung – Unterschied: Quantisierung reduziert Zahlenpräzision; KD überträgt Wissen zwischen Modellen.
  • Verwechselt mit: Pruning – Unterschied: Pruning entfernt Verbindungen/Neuronen; KD trainiert einen separaten kleineren Schüler.
  • Verwechselt mit: Transfer Learning/Fein‑Tuning – Unterschied: Übernahme von Gewichten/Anpassung auf neue Daten vs. Lernen vom Lehrer‑Verhalten.

Verwandte Begriffe (interne Links):

Häufige Fehler:

  • Zu kleiner Schüler → starke Qualitätsverluste.
  • Nur harte Labels nutzen → verpasst die „feinen Hinweise“ des Lehrers.
  • Falsche Temperatur/Verhältnis der Verluste → Schüler lernt instabil oder überpasst den Lehrer.
  • Kein praxisnahes Evaluations‑Set → gute Laborwerte, aber schwache Produktion.

Mini‑FAQ:

  • Brauche ich immer ein großes Lehrer‑Modell? – Ja, ein starker Lehrer ist der Kern des Ansatzes; je besser der Lehrer, desto besser meist der Schüler.
  • Kann ich KD mit Quantisierung/Pruning kombinieren? – Ja, oft erzielt die Kombination die besten Latenz‑/Kosten‑Vorteile bei guter Qualität.
  • Lernt der Schüler exakt dieselben Fehler? – Mit reinem Imitations‑Signal: teilweise ja. Mit Mischungen aus echten Labels und Distillation kann man das abmildern.

Praxistipps:

  • Starte mit Logit‑Distillation (weiche Ziele) und probiere moderate Temperaturen (z. B. 2–5) und ein ausgewogenes Loss‑Mischungsverhältnis.
  • Miss neben Accuracy auch Latenz, Speicher, Kosten pro Anfrage und Robustheit.
  • Teste mehrere Schüler‑Architekturen (Breite vs. Tiefe) – oft bringt etwas mehr Breite bessere Distillation.
  • Kombiniere KD mit Quantisierung/Pruning, wenn dein Ziel On‑Device‑Einsatz ist.

Quellen:

Weitere Informationen bei uns auf KI Kurse & Schulungen