Einfach erklärt
Aufmerksamkeit ist eine Methode, mit der ein Modell bei jeder Vorhersage gezielt auf die wichtigsten Teile der Eingabe schaut. Statt alles gleich stark zu beachten, vergibt es Gewichte: Wichtige Wörter/Stellen zählen mehr, unwichtige weniger. So versteht das Modell Bezüge besser und trifft genauere Entscheidungen.
Warum ist das nützlich?
- Das Modell kann lange Abhängigkeiten erfassen (z. B. ein Wort bezieht sich auf ein viel früheres Wort).
- Es wählt relevante Informationen aus, statt sich zu „verzetteln“.
- Es lässt sich parallel berechnen (vor allem bei Selbst‑Aufmerksamkeit), was das Training beschleunigt.
Einfache Beispiele:
- Satz verstehen: In „Das Telefon klingelte, aber es lag im Wohnzimmer.“ lernt das Modell, dass „es“ auf „Telefon“ zeigt.
- Frage beantworten: Bei „Wer gewann das Spiel?“ richtet das Modell die Aufmerksamkeit auf Namen und das Wort „gewann“.
- Zusammenfassen: Beim Kurzfassen eines Textes werden besonders Schlüsselstellen stärker beachtet.
Professionelle Definition
Gegeben Abfragen (Q), Schlüssel (K) und Werte (V) berechnet skalierte Punkt‑Aufmerksamkeit (scaled dot‑product) die Ausgaben als
[\mathrm{Attention}(Q,K,V)=\mathrm{softmax}!\left(\frac{QK^\top}{\sqrt{d_k}}\right)V.]
Dabei liefern (QK^\top) die Ähnlichkeiten zwischen Abfragen und Schlüsseln; die Softmax erzeugt Gewichte, mit denen die Werte (V) gemittelt werden.
Selbst‑Aufmerksamkeit setzt (Q=K=V) (gleiche Sequenz), wodurch jedes Token Informationen von allen anderen Tokens derselben Sequenz bezieht. Mehrkopf‑Aufmerksamkeit (Multi‑Head) berechnet mehrere Projektionen parallel und fasst sie zusammen, um verschiedene Beziehungsarten gleichzeitig zu erfassen. In Transformern ersetzen Aufmerksamkeits‑Blöcke rekurrente/konvolutionale Schritte weitgehend und ermöglichen hohe Parallelität.
Alles zu diesem Thema finden Sie auf Grundlagen zur Künstlichen Intelligenz
Quellen
- Vaswani et al. (2017) – Attention Is All You Need (Transformer, skalierte Punkt‑Aufmerksamkeit, Mehrkopf‑Variante)
https://arxiv.org/abs/1706.03762 - Bahdanau, Cho, Bengio (2015) – Neural Machine Translation by Jointly Learning to Align and Translate (Ausrichtungs‑Aufmerksamkeit in Sequenz‑zu‑Sequenz‑Modellen)
https://arxiv.org/abs/1409.0473 - Luong, Pham, Manning (2015) – Effective Approaches to Attention‑based NMT (verschiedene Aufmerksamkeits‑Formen)
https://arxiv.org/abs/1508.04025 - Wikipedia – Attention (machine learning) (Überblick, Selbst‑Aufmerksamkeit, Transformer‑Bezug)
https://en.wikipedia.org/wiki/Attention_(machine_learning) - PyTorch – MultiheadAttention (Dokumentation, Schnittstellen und Details zur Implementierung)
https://pytorch.org/docs/stable/generated/torch.nn.MultiheadAttention.html