Einfach erklärt
Model Explainability (Erklärbarkeit) bedeutet: Das Modell muss sagen können, warum es so entschieden hat. Nicht nur das Ergebnis („Kredit abgelehnt“), sondern die nachvollziehbaren Gründe dafür („zu hohes Ausfallrisiko wegen Einkommen X und Schulden Y“). Ziel: Entscheidungen für Menschen prüfbar machen statt „Black Box sagt so“.
Kurz: Ergebnis + Begründung, in menschlich verständlicher Form.
Ganz einfache Beispiele
• Kreditentscheidung: Die KI lehnt ein Darlehen ab. Explainability heißt: Sie zeigt die Schlüsselfaktoren (z. B. Einkommen, bestehende Schulden, fehlende Historie) und wie stark sie zur Ablehnung beigetragen haben – statt nur „Nein“.
• Medizinische Diagnose-KI: Ein Modell markiert einen Fleck im Hautbild als „hohes Risiko“. Explainability fordert: Zeig die betroffene Region (Heatmap/Saliency), sag welche visuellen Merkmale kritisch waren, und gib die Risikoeinstufung in Klartext an Ärzt:innen weiter.
• Betrugserkennung (Fraud Detection): Eine Zahlung wird blockiert. Explainability heißt hier: „Ungewöhnlicher Betrag + neue Geolokation + untypische Uhrzeit“ – also ein Audit-tauglicher Grund, warum die Transaktion angehalten wurde.
Professionelle Definition
Model Explainability ist die Fähigkeit eines KI-/ML-Systems, für jede Entscheidung nachvollziehbare, überprüfbare und menschenlesbare Gründe zu liefern. Eine erklärbare KI liefert (1) Evidenz für den Output („welche Faktoren haben wie gewirkt?“), (2) eine plausible Kausalerzählung in Form von Einflussbeiträgen einzelner Features oder Regionen, und (3) Erklärungen, die mit dem tatsächlichen internen Rechenweg konsistent sind (nicht frei erfunden). Damit wird sichtbar, wie das Modell im Einzelfall zu seinem Ergebnis kam, und ob es innerhalb seines vorgesehenen Einsatzbereichs arbeitet.
Abgrenzungen und Praxisfälle:
- Interpretability vs. Explainability: Interpretierbare Modelle (lineare Regression, kleine Entscheidungsbäume, klare Regeln) sind von Haus aus nachvollziehbar. Explainability kümmert sich zusätzlich um komplexe Black-Box-Modelle (Deep Learning, Gradient Boosting), indem sie nachträglich Gründe liefert.
- Globale Erklärungen: Beschreiben das Verhalten des Modells insgesamt: Welche Features sind im Mittel am wichtigsten? Wie verschiebt sich die Entscheidungsschwelle? Wofür „ist“ das Modell eigentlich sensibel?
- Lokale Erklärungen: Begründen eine einzelne Vorhersage: Warum wurde genau dieser Kunde als „Risiko hoch“ markiert? Warum genau dieses Bild als „bösartig“ eingestuft?
- LIME (Local Interpretable Model-Agnostic Explanations): Baut um eine konkrete Vorhersage herum ein kleines, einfaches Ersatzmodell und zeigt, welche Inputteile diese Vorhersage lokal getragen haben.
- SHAP (SHapley Additive exPlanations): Zerlegt die Vorhersage in Feature-Beiträge auf Basis spieltheoretischer Shapley-Werte. Jedes Feature bekommt einen Zahlenbeitrag: „Dieses Merkmal hat die Entscheidung stärker in Richtung Ja/Nein geschoben.“
- Saliency-/Attention-Maps: Markieren Bildregionen oder Text-Token, die das Modell besonders „wichtig“ fand. Gut bei Vision (Heatmaps) und NLP (Attention-Highlighting).
- Gegenfaktische Erklärungen: „Wenn dieses eine Feature leicht anders wäre (z. B. Einkommen +10%), hätte das Modell anders entschieden.“ Zeigt Entscheidungsgrenzen und macht sie für Menschen verhandelbar.
- Compliance-Fall: In regulierten Domänen (Finanz, Gesundheit, öffentliche Verwaltung) wird Explainability oft verpflichtend, weil Entscheidungen auditierbar, fair, begründbar und anfechtbar sein müssen.
Warum wichtig:
- Vertrauen & Akzeptanz: Menschen (Kund:innen, Ärzt:innen, Prüfer:innen, Aufsichtsbehörden) akzeptieren Entscheidungen eher, wenn klar ist, warum das Modell so entschieden hat – statt „Computer sagt nein“.
- Regulatorische Anforderungen: Finanzaufsicht, Datenschutz, medizinische Zulassung usw. verlangen Transparenz, Nachvollziehbarkeit und Rechenschaft. Ohne Explainability ist es schwer, Haftung und Fairness zu prüfen.
- Fairness & Bias-Kontrolle: Erklärungen decken auf, ob unerwünschte Merkmale (Ethnie, Geschlecht, Herkunft) indirekt die Entscheidung treiben. So lassen sich Diskriminierung und systematische Benachteiligung identifizieren und adressieren.
- Debugging & Modellverbesserung: Wenn die Erklärung zeigt, dass das Modell auf Nebengeräusche hört (z. B. Wasserzeichen im Bild statt Tumorgewebe), kann man Daten, Features oder Architektur gezielt korrigieren.
- Risikomanagement: Unternehmen wollen wissen, wann sie dem Modell trauen können – und wann nicht. Explainability macht sichtbar, ob das Modell innerhalb seines sicheren Einsatzbereichs operiert oder ob es „halluziniert“.
Praxis-Tipps
- Nicht nur „Was hat es gesagt?“, sondern „Warum?“ loggen: In kritischen Anwendungen (Kredit, Medizin, Betrug) immer die Erklärung zusammen mit der Entscheidung speichern. Das ist Audit-, Rechts- und Support-Gold.
- Global + lokal kombinieren: Management braucht oft globale Logik („Welche Treiber steuern unser Modell?“). Operative Teams oder Endkund:innen brauchen lokale Gründe („Warum wurde mein Antrag abgelehnt?“).
- SHAP/LIME nicht blind glauben: Diese Methoden sind Approximationen. Sie können irreführen, wenn das Modell extrem nichtlinear ist oder Features stark korrelieren. Immer Plausibilität checken – besonders vor regulatorischen Entscheidungen.
- Gegenfaktische Erklärungen aktiv nutzen: „Was müsste sich minimal ändern, damit die Entscheidung anders ausfällt?“ ist für Kund:innen verständlich und für Compliance oft hilfreich, weil es konkret, handlungsorientiert und überprüfbar ist.
- Dokumentation & Governance: Für jede produktive Modellversion festhalten: verwendete Erklärbarkeitsmethode, bekannte Limitationen, Fairness-/Bias-Bewertung, erlaubt/geprüftes Einsatzfeld. Das ist Standard in modernen AI-Governance- und Audit-Anforderungen.
- Risikobasierter Ansatz: Je höher das Risiko für Menschen (z. B. Medizin, Strafjustiz, Kredit), desto höher die Pflicht zur sauberen, menschenverständlichen Explanation. Für Low-Risk-Use-Cases (Produktvorschläge) reicht oft eine grobe Feature-Importance.
Quellen
- NIST (2021/2024) – Four Principles of Explainable AI (Erklärbare KI soll nachvollziehbare Gründe liefern, die der Mensch versteht; Konsistenz mit dem tatsächlichen Entscheidungsprozess)
https://nvlpubs.nist.gov/nistpubs/ir/2021/NIST.IR.8312.pdf - Ribeiro, M. T.; Singh, S.; Guestrin, C. (2016) – “Why Should I Trust You?”: Explaining the Predictions of Any Chttps://schweizer-ki-akademie.ch/ki-beratung-hub/lassifier (LIME, lokale Ersatzmodelle zur Erklärung einzelner Vorhersagen und zur Vertrauensprüfung)
https://arxiv.org/abs/1602.04938 - Lundberg, S. M.; Lee, S.-I. (2017) – A Unified Approach to Interpreting Model Predictions (SHAP: spieltheoretische Feature-Beiträge für lokale & globale Erklärungen)
https://arxiv.org/abs/1705.07874 - IBM / ISO 42001 / AI Governance (2024–2025) – Interpretability vs. Explainability; Explainability als Pflicht für Transparenz, Fairness, Verantwortlichkeit in regulierten Domänen
https://www.ibm.com/think/topics/interpretability
https://blog.stackaware.com/p/ai-transparency-explainability-interpretability-nist-rmf-iso-42001
Mehr dazu finden Sie in unseren KI Kursen & Schulungen und