Knowledge Distillation – Wissensdestillation, Kurze Definition: Knowledge Distillation (KD) ist eine Methode, bei der ein großes, gut funktionierendes Lehrer‑Modell einem kleineren Schüler‑Modell beibringt, wie es ähnliche Vorhersagen machen kann. Ziel: nahezu gleiche Qualität bei deutlich weniger Rechenaufwand.
Alltagsbeispiel: Stell dir eine erfahrene Köchin vor (Lehrerin), die einem Azubi (Schüler) nicht nur das Rezept gibt, sondern auch die feinen Hinweise: „Probier ab, wenn es so riecht, ist es richtig.“ Der Azubi lernt schneller und kocht fast so gut – mit weniger Zutaten und Aufwand.
Warum wichtig (Praxisnutzen):
- Spart Rechenkosten und Energie: kleinere Modelle laufen günstiger auf Servern und Edge‑Geräten.
- Geringere Latenz → schnellere Antworten in Apps und Services.
- Ermöglicht On‑Device‑AI (Smartphones, IoT), wo Speicher und Leistung begrenzt sind.
Ablauf in Phasen:
- Lehrer wählen – ein starkes, vortrainiertes Modell mit guter Qualität.
- Schüler entwerfen – kleineres Architektur‑Design (weniger Schichten/Parameter).
- Distillationssignale festlegen – der Schüler lernt nicht nur von harten Labels, sondern von weichen Zielen des Lehrers (z. B. Klassenwahrscheinlichkeiten, Zwischen‑Features, Attention‑Maps).
- Training des Schülers – kombiniere Standard‑Training (mit echten Labels) und Distillation‑Verlust (Annäherung an Lehrer‑Ausgaben).
- Evaluation & Tuning – Qualität, Größe, Latenz und Durchsatz messen; ggf. Architektur/Hyperparameter anpassen.
Wichtige Varianten:
- Logit‑/Soft‑Label‑Distillation: Schüler imitiert Lehrer‑Wahrscheinlichkeiten.
- Feature‑/Intermediate‑Distillation: Schüler lernt aus Zwischenrepräsentationen.
- Self‑Distillation: Modell destilliert in sich selbst (z. B. spätere Schichten lehren frühere Varianten).
- Ensemble‑to‑Single: Mehrere Lehrer → ein kompakter Schüler.
Abgrenzung:
- Verwechselt mit: Quantisierung – Unterschied: Quantisierung reduziert Zahlenpräzision; KD überträgt Wissen zwischen Modellen.
- Verwechselt mit: Pruning – Unterschied: Pruning entfernt Verbindungen/Neuronen; KD trainiert einen separaten kleineren Schüler.
- Verwechselt mit: Transfer Learning/Fein‑Tuning – Unterschied: Übernahme von Gewichten/Anpassung auf neue Daten vs. Lernen vom Lehrer‑Verhalten.
Verwandte Begriffe (interne Links):
- Model Compression
- Quantisierung
- Pruning
- Latenz & Durchsatz
- Inference
- Transfer Learning / Fein‑Tuning
Häufige Fehler:
- Zu kleiner Schüler → starke Qualitätsverluste.
- Nur harte Labels nutzen → verpasst die „feinen Hinweise“ des Lehrers.
- Falsche Temperatur/Verhältnis der Verluste → Schüler lernt instabil oder überpasst den Lehrer.
- Kein praxisnahes Evaluations‑Set → gute Laborwerte, aber schwache Produktion.
Mini‑FAQ:
- Brauche ich immer ein großes Lehrer‑Modell? – Ja, ein starker Lehrer ist der Kern des Ansatzes; je besser der Lehrer, desto besser meist der Schüler.
- Kann ich KD mit Quantisierung/Pruning kombinieren? – Ja, oft erzielt die Kombination die besten Latenz‑/Kosten‑Vorteile bei guter Qualität.
- Lernt der Schüler exakt dieselben Fehler? – Mit reinem Imitations‑Signal: teilweise ja. Mit Mischungen aus echten Labels und Distillation kann man das abmildern.
Praxistipps:
- Starte mit Logit‑Distillation (weiche Ziele) und probiere moderate Temperaturen (z. B. 2–5) und ein ausgewogenes Loss‑Mischungsverhältnis.
- Miss neben Accuracy auch Latenz, Speicher, Kosten pro Anfrage und Robustheit.
- Teste mehrere Schüler‑Architekturen (Breite vs. Tiefe) – oft bringt etwas mehr Breite bessere Distillation.
- Kombiniere KD mit Quantisierung/Pruning, wenn dein Ziel On‑Device‑Einsatz ist.
Quellen:
- Hinton, G., Vinyals, O., Dean, J. (2015): Distilling the Knowledge in a Neural Network. https://arxiv.org/abs/1503.02531
- Buciluă, C., Caruana, R., Niculescu‑Mizil, A. (2006): Model Compression. https://dl.acm.org/doi/10.1145/1150402.1150464
- Gou, J., Yu, B., Maybank, S., Tao, D. (2021): Knowledge Distillation: A Survey. https://arxiv.org/abs/2006.05525
- Sanh, V., Debut, L., Chaumond, J., Wolf, T. (2019): DistilBERT, a distilled version of BERT. https://arxiv.org/abs/1910.01108
- NVIDIA: Efficient Inference and Model Optimization (Triton/TensorRT docs overview). https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/overview.html
Weitere Informationen bei uns auf KI Kurse & Schulungen