6 A B C D E F G H I K L M N O P Q R S T U V W Z

Einfach erklärt

Selbst‑Aufmerksamkeit heißt: Ein Modell schaut in einem Text/Bild gezielt auf die wichtigsten Stellen, wenn es etwas vorhersagen soll. Es verteilt Gewichte – Wichtiges zählt mehr, Unwichtiges weniger. So versteht es Bezüge über weite Strecken und trifft genauere Entscheidungen.

Ganz einfache Beispiele:

Satz verstehen: In „Das Telefon klingelte, aber es lag im Wohnzimmer.“ lernt das Modell, dass „es“ auf „Telefon“ zeigt.
Übersetzen/Zusammenfassen: Das Modell richtet die Aufmerksamkeit auf Schlüsselwörter und zusammenhängende Teile, statt alles gleich stark zu beachten.
Bildbeschreibung: Beim Beschreiben eines Bildes achtet es auf relevante Bildbereiche (z. B. Gesicht, Objekt), wenn das passende Wort erzeugt wird.

Professionelle Definition

Gegeben Abfragen (Q), Schlüssel (K) und Werte (V) berechnet skalierte Punkt‑Aufmerksamkeit (scaled dot‑product):
[\mathrm{Attention}(Q,K,V) = \mathrm{softmax}!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V.]
Die Softmax‑Gewichte sind Ähnlichkeiten zwischen (Q) und (K); damit wird über (V) gemittelt. Bei Selbst‑Aufmerksamkeit gilt (Q=K=V) (gleiche Sequenz). Mehrkopf‑Aufmerksamkeit (Multi‑Head) führt mehrere parallele Projektionen aus und konkateniert die Ergebnisse, um verschiedene Beziehungstypen gleichzeitig zu erfassen. In Transformern ersetzen Aufmerksamkeits‑Blöcke weitgehend Rekurrenz/Konvolution und ermöglichen hohe Parallelität.

Quellen

  1. Vaswani et al. (2017) – Attention Is All You Need (Transformer, skalierte Punkt‑/Mehrkopf‑Aufmerksamkeit)
    https://arxiv.org/abs/1706.03762
  2. Bahdanau, Cho, Bengio (2015) – Neural Machine Translation by Jointly Learning to Align and Translate (Ausrichtungs‑Aufmerksamkeit in Seq2Seq)
    https://arxiv.org/abs/1409.0473
  3. Wikipedia – Attention (machine learning) (Überblick, Selbst‑/Kreuz‑Aufmerksamkeit, Transformer‑Bezug)
    https://en.wikipedia.org/wiki/Attention_(machine_learning)
  4. Choromanski et al. (2021) – Rethinking Attention with Performers (lineare/skalierbare Varianten)
    https://arxiv.org/abs/2009.14794
  5. PyTorch – MultiheadAttention (Dokumentation, Schnittstellen/Details)
    https://pytorch.org/docs/stable/generated/torch.nn.MultiheadAttention.html