Einfach erklärt
(Unterwort‑Tokenisierung)WordPiece zerlegt Wörter in kleine Wortstücke. So können Computer unbekannte oder seltene Wörter trotzdem verarbeiten: Das System erkennt die Bausteine und setzt sie wieder zusammen. Ähnliche Wörter teilen sich oft ähnliche Bausteine und sind damit für das Modell nah verwandt.
Ganz einfache Beispiele:
• Unbekanntes Wort: „Kaffeemaschine“ → „Kaffee“ + „##maschine“. Das Modell versteht den Sinn, obwohl es das ganze Wort nie sah.
• Beugungen: „laufend“, „läuft“, „lauf“ teilen „lauf“. Das hilft beim Verstehen trotz Form‑Wandel.
• Namen/Komposita: Lange Namen oder zusammengesetzte Wörter werden in stabile Teile zerlegt, die immer wieder vorkommen.
Professionelle Definition
WordPiece ist ein datengetriebenes Unterwort‑Verfahren: Aus einem Korpus wird ein Vokabular von Teil‑Token gelernt, das die Wahrscheinlichkeit der Trainingsdaten maximiert (sprachmodellbasiert). Bei der Tokenisierung nutzt WordPiece typischerweise Longest‑Match‑First: Für ein Wort wird das längste passende Teil‑Token gesucht, dann der Rest analog zerlegt. In großen Sprachmodellen (z. B. BERT) dient WordPiece als Standard‑Tokenisierung.
Abgrenzung/Bezug:
• BPE (Byte‑Pair Encoding): sehr ähnlich (häufigkeitsbasierte Zusammenführung); WordPiece nutzt üblicherweise eine sprachmodell‑basierte Auswahl.
• SentencePiece: Werkzeug, das WordPiece‑/BPE‑/Unigram‑Modelle direkt aus Rohtext trainieren kann (ohne vorheriges Wort‑Splitten).
Quellen
- Devlin et al. (2019) – BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding (BERT nutzt WordPiece)
https://arxiv.org/pdf/1810.04805
https://aclanthology.org/N19-1423.pdf - Wu et al. (2016) – Google’s Neural Machine Translation System (GNMT) (Wordpiece‑Modell für offene Vokabulare)
https://arxiv.org/abs/1609.08144
https://arxiv.org/pdf/1609.08144 - Schuster & Nakajima – Japanese and Korean Voice Search (früher Einsatz von WordPiece‑ähnlicher Segmentierung)
https://research.google.com/pubs/archive/37842.pdf - Google Research Blog (2021) – A Fast WordPiece Tokenization System (Algorithmik/Implementierung, Longest‑Match‑First)
https://research.google/blog/a-fast-wordpiece-tokenization-system/ - Kudo & Richardson (2018) – SentencePiece: A simple and language‑independent subword tokenizer (Bezug zu WordPiece/BPE/Unigram)
https://arxiv.org/abs/1808.06226
https://aclanthology.org/D18-2012/