Einfach erklärt

SentencePiece – Methode zur Textzerlegung ohne Wörterbuch, SentencePiece zerlegt Texte in kleine Bausteine (Subwords), bevor sie in ein KI‑Modell gehen. Es arbeitet nicht mit einem festen Wörterbuch, sondern lernt aus Daten häufige Zeichenfolgen: ganze Wörter, Wortteile oder einzelne Zeichen. Das funktioniert auch bei Sprachen ohne Leerzeichen.

Kurz: Text rein → Bausteine lernen → Text als Zahlen ausgeben → Modell versteht’s.

Ganz einfache Beispiele

Lego-Baukasten: Ein Satz wird in kleine Steine zerlegt. Manche Steine sind Wörter, andere Wortteile. Beim Erzeugen setzt das Modell die Steine wieder zusammen.

Wörter-Puzzle: SentencePiece merkt sich Teile, die oft gemeinsam auftreten (z. B. „ing“, „tion“) und nutzt sie als eigene Bausteine.

Kochrezept: Statt jedes Gericht separat zu lernen, merkt sich der Koch Basiszutaten. Daraus entstehen neue Gerichte. SentencePiece lernt Grundzutaten der Sprache.

Professionelle Definition

SentencePiece ist ein unsupervised Tokenizer und Text-Encoder, der Texte in Subword-Einheiten zerlegt, ohne ein vorgegebenes Wörterbuch zu benötigen. Entwickelt von Google, dient es der einheitlichen Textvorverarbeitung für neuronale Sprachmodelle.

Funktionsweise:

  1. Behandelt den Trainingskorpus als Zeichenfolge (statt Wortfolge).
  2. Lernt ein Vokabular automatisch (typisch Unigram oder Byte-Pair Encoding) basierend auf Häufigkeiten und Wahrscheinlichkeiten.
  3. Tokenisiert deterministisch und kann Texte verlustfrei rekonstruieren, da Leerzeichen ein eigenes Symbol sind.

Vorteile:

  • Kein manuelles Wörterbuch nötig.
  • Funktioniert für alle Sprachen und Unicode.
  • Einheitliche, reproduzierbare Tokenisierung.
  • Integriertes Pre-/Post-Processing (Normalisierung, Decoding).

Praxis-Tipps

  • Für mehrsprachige Modelle sehr geeignet, da es mit allen Schriftzeichen umgehen kann.
  • Unigram liefert oft robustere Modelle als BPE, da wahrscheinlichkeitsbasiert.
  • Nutze die offiziellen Bibliotheken, um eigene Tokenizer auf deinem Datensatz zu trainieren.
  • Speichere das trainierte Tokenizer-Modell (.model und .vocab) zusammen mit dem KI‑Modell.
  • Teste die Tokenisierung an Beispielen, um Zerlegungen zu verstehen und Vokabulargröße zu justieren.

Quellen

  1. Kudo, T. & Richardson, J. (2018) – SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing
    https://arxiv.org/abs/1808.06226
  2. Google Research – SentencePiece Official Repository (GitHub)
    https://github.com/google/sentencepiece
  3. Hugging Face – Tokenizer Summary: SentencePiece
    https://huggingface.co/docs/transformers/main/en/tokenizer_summary#sentencepiece
  4. Taku Kudo – Artikel & Ressourcen
    https://medium.com/@taku_kudo
  5. Goodfellow, Bengio, Courville (2016) – Deep Learning (Kapitel zu Textrepräsentationen)
    https://www.deeplearningbook.org/

Weiterführende Informationen finden Sie hier

KI Fachvorträge