6 A B C D E F G H I K L M N O P Q R S T U V W Z

Kurz gesagt: Data Analytics ist die systematische Auswertung von Daten, um Fragen zu beantworten, Ursachen zu verstehen und Entscheidungen zu verbessern/automatisieren. Man unterscheidet häufig:

  • Descriptive (Was ist passiert?)
  • Diagnostic (Warum ist es passiert?)
  • Predictive (Was wird passieren?)
  • Prescriptive (Was sollen wir tun?)

Mini‑Beispiele: Dashboard zu Umsatz & Retouren (descriptive), Funnel‑Analyse für Kaufabbrüche (diagnostic), Nachfrage‑Forecast (predictive), Preisempfehlung/Optimierung (prescriptive).


1) Abgrenzungen

  • Business Intelligence (BI): Berichte/Dashboards, Monitoring, meist vergangenheitsbezogen.
  • Data Analytics: Analysen von descriptive bis prescriptive inkl. Statistik, Hypothesen‑/Experimentdesign.
  • Data Science: Umfasst Analytics + ML/Modellierung und oft Produktintegration.
  • Machine Learning (ML): Datengetriebene Modelle zur Mustererkennung/Prognose (Teilgebiet der Data Science).
  • MLOps/Analytics Engineering: Betrieb/Skalierung, Datenmodelle, Qualität, Automatisierung (ETL/ELT, CI/CD).

2) Prozessmodell (CRISP‑DM – modernisiert)

Iterativ mit enger Fach‑Einbindung:

  1. Business Understanding – Ziele/Fragen, KPIs, Erfolgskriterien.
  2. Data Understanding – Quellen, Zugang, erste Qualitätssicht, Explorative Analyse.
  3. Data Preparation – Bereinigung, Feature‑Engineering, Semantik (einheitliche Definitionen), Train/Test‑Splits.
  4. Modeling/Analysis – Statistik, ML, Regeln, Visual Analytics.
  5. Evaluation – Gütekriterien, Bias‑Checks, Robustheit, Gegencheck mit Fachseite.
  6. Deployment/Operations – Visualisierung, Reports, APIs/Batch‑Jobs, Monitoring & Drift‑Kontrollen.

Pipeline‑Sicht: Ingestion → Data Lake/Warehouse/Lakehouse → Transformation (ELT/ETL, z. B. dbt) → Semantische Schicht/Metrics LayerBI/Apps/Modelle.


3) Datenqualität & Governance

  • Qualitätsdimensionen: Richtigkeit, Vollständigkeit, Konsistenz, Aktualität, Eindeutigkeit, Validität.
  • Metadaten/Lineage: Datenkatalog, Glossar, Herkunft (End‑to‑End‑Nachvollziehbarkeit), Verantwortlichkeiten (Data Stewardship).
  • Zugriff/Schutz: Rollen, Least Privilege, Audit, Schlüsselmanagement, Pseudonymisierung/Anonymisierung.
  • Compliance/Ethik: GDPR/DSGVO, EU Data Governance Act (DGA), EU Data Act, Schweiz: nDSG; DPIA/DSFA, Zweckbindung, Fairness/Transparenz.

4) Methoden (Auswahl)

Statistik/Hypothesen: Stichproben, Konfidenzintervalle, Signifikanztests, Regressionsmodelle, ANOVA, Zeitreihen (ARIMA/ETS), Bayes.

ML/Pattern‑Mining: Klassifikation (LogReg, Bäume, Ensembles), Regression (GLM, GBMs), Clustering (k‑Means/DBSCAN), Dimensionalität (PCA/UMAP), Anomalieerkennung, Empfehlungssysteme.

Causal & Experimente: A/B‑Tests, Power‑Analyse, Randomisierung/Stratifizierung; Quasi‑Experimente (Diff‑in‑Diff, Matching); Instrumentvariablen.

Visual Analytics: Diagrammwahl, Ausreißer/Trends, Interaktive Filter; Daten‑Storytelling (Message‑first, klare Captions, Kontext).


5) Metriken & Validierung

  • Klassifikation: Accuracy, Precision, Recall, F1, ROC‑AUC, PR‑AUC.
  • Regression/Forecasts: RMSE, MAE, (s)MAPE, MASE; saisonale/kalenderbedingte Effekte beachten.
  • Experimente: Effektgröße/Lift, p‑Wert & Konfidenzintervalle, Fehler 1./2. Art, Stopp‑Regeln.
  • Datenqualität: DQ‑SLOs (z. B. „<0,5 % Nullwerte in ‚customer_id‘“), automatisierte Tests in Pipelines.

6) Plattform & Werkzeuge (neutral)

  • Sprachen/Abfragen: SQL, Python (pandas, statsmodels, scikit‑learn), R (tidyverse).
  • Speicher: Data Warehouse, Data Lake, Lakehouse (Spaltenformate, z. B. Parquet); OLAP‑Semantik/Metric‑Layer.
  • Transformation/Orchestrierung: ELT/ETL, Orchestrierung (z. B. Airflow), dbt‑Style Tests.
  • Analyse/Dev: Notebooks (Jupyter), IDEs, Git/DVC für Versionierung/Reproduzierbarkeit.
  • BI/Visualisierung: Dashboards, Self‑Service mit Governance (Freigabe‑/Review‑Prozess).
  • Monitoring: Daten‑/Modell‑Drift, Alerting, Kosten/Performance.

7) Quick‑Start für KMU (30/60/90 Tage)

Tag 0–30

  • 5–7 Kern‑KPIs definieren (z. B. Umsatz, Deckungsbeitrag, Churn, NPS).
  • Datenquellen anbinden; Datenkatalog + Glossar starten.
  • Ein Executive‑Dashboard (descriptive) mit QA‑Checks.

Tag 31–60

  • Gemeinsames Datenmodell (Sternschema) für Vertrieb/Marketing/Operations.
  • Qualitäts‑Tests in Pipeline (Eindeutigkeit, Datentypen, Referenzschlüssel).
  • 1 A/B‑Test sauber aufsetzen (Hypothese, Power, Metriken, Stopp‑Regeln).

Tag 61–90

  • 1 Predictive Use‑Case (z. B. Churn/Forecast) PoC → Shadow‑Mode → limited Rollout.
  • Daten‑/Modell‑Monitoring + Runbook (Alarme, Rollback, Re‑Train).
  • Governance‑Review (Zweckbindung, Rechtsgrundlage, DPIA/DSFA, Zugriffe).

8) Typische Use‑Cases

  • Sales/Marketing: Lead‑Scoring, Attributionsmodelle, Kundensegmentierung, Next‑Best‑Action.
  • Operations: Bestands‑/Bedarfs‑Forecasting, Routen‑/Personal‑Optimierung, Qualitätskontrolle.
  • Finance/Risk: Betrugserkennung, Cash‑Forecast, Kredit‑Scoring.
  • Produkt: Feature‑Nutzung, Churn‑Frühwarnung, Experiment‑Plattform.

Quellen

Prozess & Grundlagen

Datenqualität & Governance