Einfach erklärt
Cross‑Attention bedeutet: Zwei Datenquellen schauen aufeinander, damit relevante Teile zueinanderfinden. Eine Quelle stellt Fragen (Queries), die andere liefert Hinweise (Keys) und Inhalte (Values). Das Modell gewichtet, welche Hinweise wichtig sind, und mischt daraus die passenden Inhalte.
Beispiele:
- Übersetzen (Transformer): Der Decoder „fragt“ mit Queries nach passenden Wörtern im Encoder‑Satz (Keys/Values). So findet er bedeutungsrelevante Stellen im Quellsatz. Einstieg & Praxis: Kurs‑ & Schulungs‑Hub.
- Bildgenerierung (Stable Diffusion/SDXL): Text‑Tokens (Queries) richten sich auf Bild‑Merkmale (Keys/Values in den Bild‑/Latent‑Features). Dadurch prägt der Text Form, Farbe, Position im Bild. Umsetzung in Projekten via KI‑Workflows & Automatisierung.
- Multimodal (Audio‑→ Text): Ein Text‑Decoder kann über Cross‑Attention auf akustische Merkmale eines gesagten Satzes zugreifen, um Transkription zu erzeugen. Passende Agentik‑/Orchestrierungsgrundlagen: KI‑Agenten & Workflows.
Merke: Self‑Attention blickt in dieselbe Sequenz; Cross‑Attention blickt über Kreuz in eine andere Repräsentation.
Professionelle Definition
Cross‑Attention ist ein Aufmerksamkeits‑Mechanismus zwischen zwei Repräsentationen (Quell‑ und Zielsequenz/Modalität). Für Queries (Q) aus der Zielrepräsentation und Keys/Values (K,V) aus der Quellrepräsentation werden Aufmerksamkeitsgewichte berechnet, typischerweise per Skalierter Punktprodukt‑Attention:
[\operatorname{Attention}(Q,K,V) = \operatorname{softmax}!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V.]
Im Encoder‑Decoder‑Transformer (Vaswani et al., 2017) bildet Cross‑Attention den Informationsfluss Encoder→Decoder. In Latent‑Diffusionsmodellen (Rombach et al., 2022) koppeln Cross‑Attention‑Layer Text‑Embeddings an bildseitige U‑Net‑Features und steuern so konditionierte Bildsynthese (Text→Bild, Inpainting, Outpainting).
Quellen
- Vaswani et al., 2017 – „Attention Is All You Need“ (Transformer, Encoder‑Decoder‑Cross‑Attention):
https://arxiv.org/abs/1706.03762 - Rombach et al., 2022 – „High‑Resolution Image Synthesis with Latent Diffusion Models“ (Cross‑Attention zur Text‑Konditionierung):
https://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf - Wikipedia (de) – „Aufmerksamkeitsmechanismus (Maschinelles Lernen)“ (Übersicht, Formeln; Cross‑/Self‑Attention):
https://de.wikipedia.org/wiki/Aufmerksamkeitsmechanismus_(Maschinelles_Lernen)