Einfach erklärt
Mehrkopf‑Aufmerksamkeit bedeutet: Das Modell schaut gleichzeitig auf mehrere Arten nach wichtigen Stellen – so, als ob mehrere „Blicke“ parallel über den Text/Bild laufen. Jeder „Kopf“ achtet auf andere Beziehungen (z. B. Nähe, Fernbezug, Wortart). Am Ende werden die Ergebnisse kombiniert, damit die Vorhersage genauer wird.
Ganz einfache Beispiele:
• Satzbezug: Ein Kopf achtet auf direkte Nachbarn, ein anderer auf weit entfernte Bezüge (z. B. Pronomen → Bezugswort), ein dritter auf Satzzeichen/Struktur.
• Übersetzen: Ein Kopf verfolgt Wort‑zu‑Wort‑Paare, ein anderer Redewendungen, ein weiterer Satzbau.
• Bildbeschreibung: Ein Kopf schaut auf das Hauptobjekt, ein anderer auf den Hintergrund, ein dritter auf Kanten/Formen.
Professionelle Definition
Ausgehend von skalierter Punkt‑Aufmerksamkeit
[\mathrm{Attention}(Q,K,V)=\mathrm{softmax}!\left(\frac{QK^\top}{\sqrt{d_k}}\right)V,]
führt Mehrkopf‑Aufmerksamkeit (h) parallele Projektionen aus:
[\mathrm{head}_i=\mathrm{Attention}(QW_i^{Q},\ KW_i^{K},\ VW_i^{V}),\quad i=1,\dots,h,]
[\mathrm{MHA}(Q,K,V)=\mathrm{Concat}(\mathrm{head}_1,\dots,\mathrm{head}h),W^{O}.]
Hier sind (W_i^{Q},W_i^{K},W_i^{V},W^{O}) lernbar; jeder Kopf hat typischerweise Dimension (d_k=d_q=d_v=\tfrac{d{model}}{h}). Vorteile: Erfassung verschiedener Beziehungstypen parallel, besseres Signal/Gradientenfluss, expressivere Repräsentationen. In Transformern wird MHA in Selbst‑ und Kreuz‑Aufmerksamkeit eingesetzt (Encoder/Decoder).
Quellen
- Vaswani et al. (2017) – Attention Is All You Need (Definition und Nutzen von Multi‑Head Attention)
https://arxiv.org/abs/1706.03762 - Wikipedia – Transformer (machine learning) / Attention (machine learning) (Überblick, Formeln, Köpfe)
https://en.wikipedia.org/wiki/Transformer_(machine_learning)
https://en.wikipedia.org/wiki/Attention_(machine_learning) - PyTorch – MultiheadAttention (Dokumentation, Parameter wie num_heads, head_dim, proj‑Matrizen)
https://pytorch.org/docs/stable/generated/torch.nn.MultiheadAttention.html - CS224n (Stanford) – Lecture Notes: Self‑Attention and Transformers (Didaktische Herleitung von MHA)
https://web.stanford.edu/class/cs224n/ - The Illustrated Transformer (Jay Alammar) – Anschauliche Erklärung von Köpfen/Projektionen
https://jalammar.github.io/illustrated-transformer/