Einfach erklärt

Erklärbarkeit bedeutet: Ein KI‑System soll verständlich zeigen, warum es eine Entscheidung trifft. Menschen müssen nachvollziehen können, welche Hinweise das System genutzt hat – zum Beispiel wichtige Merkmale im Text, im Bild oder in Zahlen.

Ganz einfache Beispiele:

• Kreditprüfung: Das System markiert die wichtigen Faktoren (Einkommen, Schulden, Zahlungshistorie) und zeigt, wie sie zur Entscheidung beigetragen haben.
• Medizinische Unterstützung: Bei einer Einschätzung markiert das System relevante Werte/Bildbereiche und erklärt in einfachen Worten, warum ein Risiko erhöht ist.
• Bewerbungs‑Vorsortierung: Das System zeigt, welche Qualifikationen ausschlaggebend waren – und blendet geschützte Merkmale aus.

Professionelle Definition

Erklärbarkeit in KI/ML umfasst Methoden und Modelle, die menschlich verständliche Begründungen für Vorhersagen/Entscheidungen liefern. Man unterscheidet u. a.:

• Intrinsisch interpretierbare Modelle (z. B. kleine Entscheidungsbäume, lineare Modelle mit sparsamen Merkmalen).
• Post‑hoc‑Erklärungen für komplexe Modelle (z. B. lokale Erklärungen einzelner Vorhersagen mit LIME/SHAP, saliency‑/Attributions‑Karten, Gegenfaktische Erklärungen, Surrogat‑Modelle).

Granularität: Lokal (für einen einzelnen Fall) vs. global (Modellverhalten im Ganzen).
Ziele: Nachvollziehbarkeit, Vertrauen, Fehleranalyse, Einhaltung von Vorgaben.
Herausforderungen: Treue zur wahren Modelllogik (Faithfulness), Stabilität/Reproduzierbarkeit, mögliche Widersprüche zwischen Methoden, Datenschutz und Abwägungen zwischen Genauigkeit und Einfachheit.

Quellen

• Wikipedia – Explainable artificial intelligence (Überblick, Ziele, Methoden)
https://en.wikipedia.org/wiki/Explainable_artificial_intelligence

• Ribeiro et al. (2016) – “Why Should I Trust You?”: LIME (lokale, modell‑agnostische Erklärungen)
https://www.kdd.org/kdd2016/papers/files/rfp0573-ribeiroA.pdf

• Lundberg & Lee (2017) – SHAP: A Unified Approach to Interpreting Model Predictions
https://proceedings.neurips.cc/paper/7062-a-unified-approach-to-interpreting-model-predictions.pdf

• Doshi‑Velez & Kim (2017) – Towards a Rigorous Science of Interpretable ML (Begriffe/Evaluationsrahmen)
https://arxiv.org/abs/1702.08608
https://arxiv.org/pdf/1702.08608

• DARPA – XAI‑Programm (Ziele der Erklärbarkeit in der Praxis)
https://www.darpa.mil/research/programs/explainable-artificial-intelligence