Einfach erklärt
– Blick nur nach vorn (keine Zukunftsinfos) Causal Masking sorgt dafür, dass ein Modell beim Erzeugen von Text nur auf die Vergangenheit schaut und nicht in die Zukunft spickt. Jede Position darf nur frühere oder aktuelle Tokens sehen. So bleibt die Generierung schrittweise, fair und realistisch.
Kurz: Bisherige Tokens sichtbar → zukünftige Tokens ausblenden → sauberes, autoregressives Vorhersagen.
Ganz einfache Beispiele
• Diktat Zeile für Zeile: Du schreibst Wort für Wort und darfst nicht vorblättern. Was als Nächstes kommt, bleibt verborgen.
• Kalender‑Tage: Am 10. des Monats kennst du nur Tage 1–10. Was am 11. passiert, ist verdeckt. Entscheidungen basieren auf Vergangenheit.
• Spannungsroman: Beim Lesen kennst du nur bisherige Kapitel. Die kommenden Seiten sind zugeklappt. Du rätst das nächste Ereignis ohne Spoiler.
Professionelle Definition
Causal Masking (auch Look‑Ahead Mask, Future Mask) ist eine strikte, untere Dreiecksmatrix‑Maske auf den Attention‑Scores der Scaled Dot‑Product Attention. Für eine Sequenzlänge (T) erhält Position (t) nur Zugriff auf Schlüssel 0..t. Mathematisch wird dies durch eine Additionsmaske umgesetzt, die verbotene Elemente mit großen negativen Werten (z. B. (-10^4) oder (-\infty)) versieht, sodass deren Softmax‑Gewichte ≈ 0 werden. Das erzwingt Autoregressivität und verhindert Informationsleckage aus der Zukunft.
Eigenschaften und Varianten: