Einfach erklärt
Model Interpretability (Modellinterpretierbarkeit) bedeutet: Nachvollziehbar machen, warum ein KI-/ML-Modell so entscheidet, wie es entscheidet. Wir wollen verstehen, welche Eingabefaktoren (Features) zu welcher Vorhersage geführt haben – statt nur blind der „Black Box“ zu vertrauen.
Kurz: Welche Teile der Eingabe haben wie stark zur Entscheidung beigetragen – und kann ein Mensch das verstehen?
Ganz einfache Beispiele
• Kredit-Scoring: Das Modell sagt „Kredit abgelehnt“. Interpretierbarkeit bedeutet: Warum? Z.B. „Zu niedriges Einkommen, zu viele offene Kredite, zu kurze Historie“. Das ist eine menschenlesbare Begründung statt nur einer Zahl.
• Medizinische Diagnose durch KI: Ein Modell markiert auf einem Röntgenbild einen Bereich als „auffällig“. Interpretierbarkeit heißt: Zeig mir bitte genau welche Region im Bild und welche Muster den Ausschlag gegeben haben – nicht nur das Wort „Tumor“.
• Spam-Filter: Die Mail wurde als Spam markiert. Interpretierbarkeit: „Viele typische Spam-Wörter + verdächtige Absenderdomain + 5 Links ohne Kontext“. Also klare, überprüfbare Gründe statt Magie.
Professionelle Definition
Model Interpretability ist die Fähigkeit, ein Modell oder seine Vorhersagen so darzustellen, dass ein Mensch die Ursachen, Einflussfaktoren und internen Entscheidungswege nachvollziehen kann. Ziel ist, transparente Gründe für Entscheidungen zu bekommen (z. B. „Feature X hat stark zu Output Y beigetragen“), anstatt nur das Endergebnis zu sehen. Dabei unterscheidet man oft zwischen globaler Interpretierbarkeit (Wie funktioniert das Modell insgesamt? Welche Features sind generell wichtig?) und lokaler Interpretierbarkeit (Warum hat das Modell für genau dieses einzelne Beispiel diese konkrete Entscheidung getroffen?).
Abgrenzungen und Praxisfälle:
- Interpretierbare Modelle (intrinsisch): Modelle, die von sich aus lesbar sind, z. B. lineare Modelle, logistische Regression, kleine Entscheidungsbäume oder Regel-Listen. Hier kann man direkt sagen, wie ein Feature das Ergebnis beeinflusst.
- Post-hoc Erklärungen für Black-Box-Modelle: Bei komplexen Netzen oder Ensembles (z. B. tiefe neuronale Netze, Gradient Boosting) erzeugt man nachträgliche Erklärungen, ohne das Modell selbst zu ändern. Beispiele: Feature Importance, Saliency-/Heatmaps, Konfidenzerklärungen.
- LIME (Local Interpretable Model-Agnostic Explanations): Baut um eine einzelne Vorhersage herum ein einfaches Ersatzmodell (z. B. kleine lineare Approximation) und zeigt, welche Eingabeteile die Entscheidung lokal getragen haben.
- SHAP (SHapley Additive exPlanations): Weist jedem Feature einen Beitragswert zu („Wie viel hat dieses Feature die Vorhersage nach oben oder unten verschoben?“). Nutzt Spieltheorie (Shapley-Werte) und funktioniert sowohl lokal pro Einzelfall als auch aggregiert global.
- Counterfactual / Was-wäre-wenn-Erklärungen: „Wenn dein Einkommen 10% höher wäre und keine offenen Schulden da wären, hätte das Modell Ja gesagt.“ Das macht Entscheidungsgrenzen sichtbar – und zeigt, was man ändern müsste.
- Attention-/Saliency-Maps (v.a. Vision & NLP): Markiert Textstellen, Tokens oder Bildregionen, die das Modell besonders stark genutzt hat. Gut, um visuell zu sehen, worauf das Modell geschaut hat.
- Regulatorische/ethische Nutzung: In Bereichen wie Kreditvergabe, Gesundheit, Personalentscheide oder Strafjustiz braucht man nachvollziehbare Gründe – u.a. wegen Fairness, Antidiskriminierung, Compliance und Haftbarkeit. Interpretierbarkeit / Explainability liefert diese Begründungen.
Warum wichtig:
- Vertrauen & Akzeptanz: Nutzer:innen, Kund:innen, Ärzt:innen, Auditor:innen wollen wissen: „Warum soll ich dieser Entscheidung glauben?“
- Debugging & Qualitätssicherung: Wenn ein Modell Blödsinn macht (z. B. „Hautfarbe wichtig für Kreditscoring“), muss man das sehen, sonst kann man es nicht reparieren.
- Fairness & Bias-Kontrolle: Interpretierbarkeit hilft aufzudecken, ob das Modell unfaire Muster gelernt hat (z. B. systematische Benachteiligung bestimmter Gruppen).
- Compliance & Haftung: In regulierten Domänen (Finanzen, Gesundheit, öffentlicher Sektor) muss man begründen können, warum eine automatisierte Entscheidung getroffen wurde – rechtlich nachvollziehbar, auditierbar.
- Wissensgewinn fürs Business: Interpretierbarkeit zeigt, welche Faktoren das Modell wirklich treiben. Das kann direkt in Strategie, Produktdesign oder Risikomanagement einfließen.
Praxis-Tipps
- Global + lokal prüfen: Nicht nur „welche Features sind wichtig im Schnitt?“ (global), sondern auch „warum genau diese einzelne Ablehnung / Freigabe?“ (lokal). Beides brauchen Stakeholder.
- Kritische Entscheidungen zuerst absichern: Höchste Erklärbarkeit dort verlangen, wo rechtliche, finanzielle oder menschliche Risiken groß sind (Kredit, Diagnose, Compliance).
- Nicht nur bunte Heatmaps: Visualisierung reicht nicht. Gute Interpretierbarkeit muss verständlich, prüfbar und konsistent sein. „Warum“ muss so formuliert sein, dass ein Fachmensch sie wirklich nutzen kann.
- Gegenfaktische Erklärungen nutzen: „Was müsste minimal anders sein, damit die Entscheidung anders ausfällt?“ Das ist extrem hilfreich für Transparenz gegenüber Endnutzer:innen.
- Dokumentieren & versionieren: Immer festhalten: verwendetes Modell, Erklärmethode (z. B. SHAP), Metriken, bekannte Limitationen. Das ist für Audits, Fairness-Reviews und spätere Rekonstruktion absolut zentral.
- Achtung Pseudo-Erklärung: Nicht jede „Erklärung“ ist korrekt. LIME/SHAP/etc. liefern Approximationen. Man sollte prüfen, ob die gezeigte Erklärung wirklich die Modelllogik widerspiegelt – sonst gibt man falsche Sicherheit.
Quellen
- Doshi-Velez, F.; Kim, B. (2017) – Towards a Rigorous Science of Interpretable Machine Learning (Definition von Interpretierbarkeit, Gründe & Bedarf in sicherheitskritischen Settings)
https://arxiv.org/abs/1702.08608 - IBM (2025) – What Is AI Interpretability? (Vertrauen, Debugging, Bias-/Fairness-Kontrolle, Compliance als Kernmotive)
https://www.ibm.com/think/topics/interpretability - Ribeiro, M. T.; Singh, S.; Guestrin, C. (2016) – “Why Should I Trust You?” Explaining the Predictions of Any Classifier (LIME: lokale surrogate Modelle für einzelne Entscheidungen)
https://arxiv.org/abs/1602.04938 - Lundberg, S. M.; Lee, S.-I. (2017) – A Unified Approach to Interpreting Model Predictions (SHAP: Shapley-basierte Beitragswerte pro Feature für lokale & globale Erklärungen)
https://arxiv.org/abs/1705.07874 - Molnar, C. – Interpretable Machine Learning (laufend aktualisiert) (Globale vs. lokale Erklärbarkeit, LIME, SHAP, Feature Importance, Surrogate Models)
https://christophm.github.io/interpretable-ml-book/ - EU-/Industrie-Perspektive auf Explainability & Transparenz (Vertrauen, Fairness, regulatorische Nachweispflichten in Domänen wie Kreditvergabe, Gesundheit, Finance; Explainability als Voraussetzung für Compliance)
https://www.lenovo.com/us/en/knowledgebase/understanding-validation-data-key-concepts-applications-and-best-practices/
https://www.ultralytics.com/glossary/real-time-inference
https://blog.cognitiveview.com/explainable-ai-why-ai-transparency-matters-for-compliance-and-trust/
Mehr dazu finden Sie in unseren KI Kursen & Schulungen und KI Speaker