6 A B C D E F G H I K L M N O P Q R S T U V W Z

Chain-of-Thought Reasoning

Einfach erklärt

Chain-of-Thought Reasoning (CoT) bedeutet: Wir bringen ein KI-Sprachmodell dazu, seine Gedankenschritte ausdrücklich aufzuschreiben, anstatt nur sofort das Endergebnis zu liefern. Also nicht nur „Antwort: 47“, sondern „Schritt 1 … Schritt 2 … daher Antwort: 47“.

Das macht die Antworten oft logischer, überprüfbarer und genauer – vor allem bei Aufgaben mit mehreren Teilschritten (Mathe, Logik, Planung, Analyse).

Kurz: „Denk laut nach“ → bessere Kontrolle über das Modell.

Ganz einfache Beispiele

• „Denk Schritt für Schritt“: Statt das Modell nur zu fragen „Was ist die Antwort?“, sagst du: „Erkläre deinen Denkweg Schritt für Schritt.“ Das Modell listet erst die Überlegungen, dann die Lösung. Das ist klassische Chain-of-Thought.

• Mehrere Gedankengänge, dann Abstimmung: Du lässt das Modell denselben Fall mehrfach durchdenken und dann die konsistenteste Schlussfolgerung wählen. Das nennt man Self-Consistency: Es gewinnt die Antwort, die am meisten mit den eigenen (verschiedenen) Begründungen übereinstimmt.

• Planen wie ein Schachspieler: Bei schwierigeren Aufgaben (Planung, Strategie, Puzzle) lässt du das Modell verschiedene mögliche Lösungswege parallel skizzieren, bewertet diese Wege selbst, verwirft schlechte Varianten und verfolgt die beste weiter. Das ist Tree-of-Thoughts – nicht nur eine lineare Kette, sondern ein ganzer Entscheidungsbaum.

Professionelle Definition

Chain-of-Thought Reasoning bezeichnet ein Bündel von Prompting- und Inferenz-Techniken, mit denen man große Sprachmodelle (LLMs) so steuert, dass sie strukturierte Zwischenschritte, Teilargumente, Plausibilitätsprüfungen und Begründungen explizit generieren. Ziel ist es, komplexe Probleme zuverlässiger zu lösen und die Antworten für Menschen nachvollziehbar zu machen, ohne das Modell neu trainieren zu müssen.

Wichtige Varianten und Bausteine:

  • Few-shot Chain-of-Thought: Man zeigt dem Modell im Prompt ein oder mehrere Beispiele, bei denen die Lösung inklusive sauber dokumentierter Zwischenschritte steht. Das Modell lernt: „Ich soll auch so denken.“
  • Zero-shot Chain-of-Thought: Statt Beispiele zu liefern, reicht oft ein Auslöser wie „Let’s think step by step.“ am Ende der Frage. Viele moderne LLMs beginnen dann automatisch, ihren Denkweg zu strukturieren und kommen dadurch zu besseren Antworten.
  • Self-Consistency: Das Modell erzeugt mehrere unterschiedliche Chain-of-Thought-Erklärungen für dieselbe Aufgabe, und wir nehmen die Antwort, die am häufigsten vorkommt. Idee: Wenn verschiedene plausible Denkpfade auf dasselbe Ergebnis zeigen, ist dieses Ergebnis wahrscheinlicher korrekt.
  • Tree-of-Thoughts (ToT): Anstatt nur eine Begründungslinie runterzuschreiben, lässt man das Modell mehrere mögliche Teilpläne als „Äste“ explorieren, bewertet Teilschritte, verwirft schlechte Äste und verfolgt die besten weiter. Das ähnelt einer Problemlösungs-Suche (Planen, Zurückspringen, Alternativen prüfen) statt stumpfem linearen Durchrechnen.
  • Plan-and-Solve / Deliberate Reasoning: Das Modell wird erst gezwungen, einen Plan grob zu formulieren (Welche Schritte brauche ich?), und darf dann erst lösen. So trennt man „Strategie aufstellen“ und „Schritte ausführen“ – ähnlich wie bei guter menschlicher Problemlösung.

Warum wichtig:

  • Höhere Genauigkeit bei komplexen Aufgaben: Mathe-Wortaufgaben, Symbol-Logik, mehrstufige Planungsfragen oder Wissensverkettung werden deutlich besser gelöst, wenn das Modell nicht einfach rät, sondern seine Zwischenschritte explizit herleitet.
  • Transparenz & Nachvollziehbarkeit: Statt „Black Box sagt: Antwort ist X“ bekommt man eine prüfbare Begründung. Das hilft bei Qualitätssicherung, Audits, Compliance und Debugging.
  • Kontrolle & Steuerung: Wer promptet, steuert die Denkstrategie. Man kann das Modell aktiv dazu bringen, Optionen gegeneinander abzuwägen, Warnsignale zu markieren oder vorsichtiger zu argumentieren – also LLM-Verhalten gezielt lenken, ohne Modellgewichte zu ändern.
  • Zuverlässigere Endantworten: Verfahren wie Self-Consistency (mehrere Denkpfade, Mehrheitsentscheid) und Tree-of-Thoughts (systematische Suche statt spontane Intuition) reduzieren tendenziell Ausrutscher und „Halluzinations-Schnellschüsse“ – auf Kosten von mehr Rechenzeit.
  • Planung & Agency: Bei Aufgaben, wo das Modell mehrere Schritte nacheinander ausführen soll (Plan erstellen, Teilziele lösen, Ergebnis zusammenführen), sind strukturierte Reasoning-Techniken der Kern dafür, dass es wie ein Assistent mit Arbeitsplan agieren kann – nicht nur wie ein Chatbot.

Praxis-Tipps

  • Sag explizit, wie gedacht werden soll: Formulierungen wie „Erkläre Schritt für Schritt deinen Lösungsweg, bevor du die finale Antwort nennst“ aktivieren Chain-of-Thought Verhalten (Zero-shot CoT).
  • Lass mehrere Lösungen prüfen: Für heikle Aufgaben (Finanzen, Regulierung, Security) lass das Modell mehrere Gedankengänge generieren und wähle die konsistenteste Antwort (Self-Consistency). Das erhöht die Robustheit – besonders bei Rechen-/Logikthemen.
  • Nutze „Plan zuerst, dann lösen“: Bitte zuerst um einen Aktionsplan („Gib mir die Schritte, die du machen wirst“), dann um die eigentliche Ausführung Schritt für Schritt. Das verhindert, dass das Modell planlos reinspringt.
  • Für komplexe Aufgaben: Baum statt Linie: Wenn es nicht nur eine richtige Taktik gibt (z. B. kreative Ideensuche, Spielstrategie, Fehlersuche in großen Systemen), nutze Tree-of-Thoughts: „Liste mehrere mögliche Ansätze, bewerte sie kurz, entscheide dich für den besten, arbeite ihn aus.“
  • Kosten im Blick behalten: Mehr Kette = mehr Tokens = mehr Rechenaufwand. Self-Consistency und Tree-of-Thoughts sind teurer (mehr Varianten, längere Antworten). Diese Techniken gezielt dort einsetzen, wo Fehler richtig wehtun.

Quellen

  1. Wei, J. et al. (2022): Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. Zeigt, dass „Denke in Schritten“-Beispiele die logische/arithmetische Leistung großer Sprachmodelle drastisch verbessern.
    https://arxiv.org/abs/2201.11903
  2. Kojima, T. et al. (2022): Large Language Models are Zero-Shot Reasoners. Zeigt, dass schon der Satz „Let’s think step by step.“ reicht, um ohne Beispiele deutlich bessere Reasoning-Qualität zu bekommen (Zero-shot CoT).
    https://arxiv.org/abs/2205.11916
  3. Wang, X. et al. (2022): Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. Mehrere unterschiedliche Gedankengänge generieren, dann per Mehrheitsentscheid die stabilste Antwort wählen; stark bessere Resultate, aber höherer Rechenaufwand.
    https://arxiv.org/abs/2203.11171
  4. Yao, S. et al. (2023): Tree of Thoughts: Deliberate Problem Solving with Large Language Models. Statt linearer Kette wird ein Suchbaum aus möglichen Gedankenpfaden aufgebaut, bewertet und exploriert – gut für Planung, Strategie, Puzzle-Lösen.
    https://arxiv.org/abs/2305.10601
  5. PromptingGuide.ai (laufend gepflegt, 2024/2025): Chain-of-Thought, Zero-shot CoT, Tree-of-Thoughts. Praktische Prompt-Muster („Let’s think step by step“, Mehrpfad-Exploration, Entscheidungsbaum) zur Steuerung von LLMs.
    https://www.promptingguide.ai/techniques/cot
    https://www.promptingguide.ai/techniques/tot
  6. Helicone (2025): Tree-of-Thought Prompting als Strategie, LLMs systematisch mehrere Alternativen generieren, bewerten und zurückverfolgen zu lassen; Fokus auf komplexe, mehrschrittige Aufgaben, nicht nur einfache Q&A.
    https://www.helicone.ai/blog/tree-of-thought-prompting
  7. Taubenfeld, A. et al. (2025): Confidence-Informed Self-Consistency (CISC). Verfeinert Self-Consistency, indem mehrere Reasoning-Pfade erzeugt werden, aber die Abstimmung kosteneffizienter und konfidenzgewichteter erfolgt.
    https://aclanthology.org/2025.findings-acl.1030.pdf