Einfach erklärt
(BPE) Byte‑Pair Encoding zerlegt Wörter in kleine Bausteine (Teil‑Wörter) und baut daraus einen Wortschatz auf, der häufige Stücke enthält. Seltene Wörter werden so aus bekannten Teilen zusammengesetzt. Das hilft Modellen, neue oder seltene Wörter zu verarbeiten.
Ganz einfache Beispiele:
• Aus „lesen“ und „Leser“ und „Lesung“ lernt BPE häufige Teile wie „Les“ und „en“/„er“/„ung“.
• Das seltene Wort „Leser:innen“ kann dann als Les + er + : + innen zerlegt werden – das Modell versteht es über die Bausteine.
• Für Sprachen mit Zusammensetzungen (z. B. Deutsch) oder neuen Fachwörtern bleibt der Text zerlegbar, statt in lauter „unbekannt“-Tokens zu enden.
Professionelle Definition
BPE ist ein häufigkeitsbasierter Tokenisierungs‑Algorithmus. Startpunkt ist eine Zeichen‑ (oder Byte‑)Sequenz; wiederholt wird das häufigste Paar benachbarter Symbole gemergt und als neues Symbol in den Wortschatz aufgenommen. Nach (N) Merges entsteht ein Subword‑Vokabular fester Größe.
Algorithmus (vereinfacht):
- Zerlege das Trainingstext‑Korpus in Einzelsymbole (Zeichen/Bytes).
- Zähle alle benachbarten Paare und merge das häufigste.
- Wiederhole Schritt 2, bis die gewünschte Vokabulargröße erreicht ist.
- Tokenisieren neuer Texte: Greedy längstmögliche Subwords aus der Merge‑Liste verwenden.
Varianten und Praxis:
• Subword‑BPE für NMT (Sennrich et al., 2016) – arbeitet auf Unicode‑Zeichen.
• Byte‑Level BPE (z. B. GPT‑2) – arbeitet auf Bytes; deckt alle Zeichen ab, robust gegenüber neuen Symbolen/Emojis.
• Verwandte Verfahren: Unigram Language Model‑Tokenisierung (alternative, probabilistische Subword‑Methode).
Quellen
- Gage (1994) – A New Algorithm for Data Compression (ursprüngliche BPE‑Idee aus der Kompression)
https://dl.acm.org/doi/10.1145/177910.177914 - Sennrich, Haddow, Birch (2016) – Neural Machine Translation of Rare Words with Subword Units (BPE für NMT)
https://arxiv.org/abs/1508.07909
https://www.aclweb.org/anthology/P16-1162/ - Wikipedia – Byte Pair Encoding (Überblick, Algorithmus, Subword‑Tokenisierung)
https://en.wikipedia.org/wiki/Byte_pair_encoding - Radford et al. (2019) – Language Models are Unsupervised Multitask Learners (GPT‑2, Byte‑Level BPE)
https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf - Kudo (2018) – Subword Regularization / Unigram Language Model (verwandte Tokenisierung, Vergleich)
https://arxiv.org/abs/1804.10959