Einfach erklärt
Thinking Models sind große Sprach- oder Multimodal-Modelle, die speziell für komplexes, mehrstufiges Denken (Reasoning) optimiert sind. Im Unterschied zu „normalen“ LLMs generieren sie vor der eigentlichen Antwort intern einen ausführlichen Denkprozess, eine Art Kette von Zwischenschritten oder „Gedanken“ und geben danach nur eine verdichtete, aufbereitete Antwort an die Nutzer:innen aus.
Technisch heißt das:
- das Modell erzeugt zunächst interne Thought-Tokens (Chain-of-Thought, Skizzen, Pläne),
- bewertet bzw. überarbeitet diese Zwischenergebnisse,
- und generiert dann auf Basis dieses Denkprozesses die endgültige Ausgabe.
Viele Anbieter (OpenAI, Google, DeepSeek u. a.) unterscheiden inzwischen explizit zwischen schnellen Standardmodellen und Thinking-/Reasoning-Modellen, die mehr Zeit und Rechenleistung einsetzen, dafür aber bessere Ergebnisse bei schwierigen Aufgaben liefern.
Beispiele
- OpenAI – GPT‑5.x „Thinking“ Modelle
OpenAI beschreibt in System Cards und Produktankündigungen eigene „Thinking“-Varianten (z. B. gpt‑5‑thinking), die mehr interne Rechenschritte für komplexe Aufgaben nutzen. Nutzer:innen können in Chat-Oberflächen bzw. APIs zwischen schnellen Hauptmodellen und Thinking-Modellen wählen oder eine „Thinking Time“ bzw. Tiefe einstellen.
https://openai.com/index/gpt-5-system-card/
https://openai.com/index/introducing-gpt-5-2/
https://www.techradar.com/ai-platforms-assistants/chatgpt/you-can-now-toggle-gpt-5s-thinking-time-for-faster-or-smarter-answers-heres-how-to-do-it - OpenAI o1 / o3 – Reasoning-/Thinking-Modelle
In Blogartikeln und Analysen werden o1/o3 als neue Generation von Reasoning- bzw. Thinking-Modellen beschrieben, die schwierige mathematische, logische oder Programmieraufgaben durch längere interne Denkprozesse besser lösen als klassische Chat-Modelle.
https://blog.lewagon.com/skills/openai-o1-and-o3-explained-how-thinking-models-work/ - Google Gemini „Thinking models“ / Deep Think
Google beschreibt Gemini‑„Thinking models“ so, dass sie zunächst vollständige Gedanken erzeugen, um die Qualität der finalen Antwort zu verbessern, und anschließend eine Zusammenfassung dieses Denkprozesses ausgeben. Entwickler:innen können dabei über einen „thinking budget“ steuern, wie viel reasoning eingesetzt werden soll (z. B. bei Gemini 2.5 Flash oder Gemini 3 Deep Think).
https://ai.google.dev/gemini-api/docs/thinking
https://www.businessinsider.com/latest-google-gemini-2-5-flash-has-thinking-budget-2025-4 - DeepSeek, Ollama, Hybrid-Reasoning-Modelle
Verschiedene Anbieter (z. B. DeepSeek, Ollama) und Forschungsarbeiten sprechen explizit von Thinking Models oder Large Hybrid-Reasoning
Professionelle Definition
In der aktuellen NLP-/LLM-Literatur bezeichnet man als Thinking Models (oft auch Reasoning Models, Large Reasoning Models oder Thinking Language Models):
Große generative Modelle, die so trainiert und/oder konfiguriert sind, dass sie vor der Ausgabe eine explizite Phase interner Gedanken (Reasoning-Traces, Thought-Tokens, Chain-of-Thought) durchlaufen, um schwierige Aufgaben durch mehrstufiges Schlussfolgern, Planen und Überprüfen besser zu lösen.
Charakteristisch ist:
- eine trennbare Denkphase (intern, meist nicht oder nur in Auszügen sichtbar),
- gefolgt von einer Kommunikationsphase (Antwort an den Menschen oder nachgelagertes System),
- sowie die Möglichkeit, die „Menge“ an Denken zu steuern (z. B. Thinking-Budget, Thinking-Time, Reasoning-Tiefe).
Forschungsarbeiten zu „Thinking Language Models“ und „Large Reasoning Models“ beschreiben typischerweise Trainings- und Steuerungsmethoden, mit denen diese interne Denkkomponente explizit modelliert und beeinflussbar gemacht wird (z. B. Vektoren zur Steuerung von Backtracking, Unsicherheitsäußerung oder Planungstiefe).
Typische Merkmale
- Explizite interne Gedankenphase
Das Modell generiert intern „Gedanken“ (z. B. Schritt-für-Schritt-Argumente, Zwischenrechnungen, Hypothesen), bevor es eine Antwort formuliert. - Mehr Rechenaufwand, höhere Qualität bei schwierigen Aufgaben
Thinking Models nutzen mehr Token und Rechenzeit und erreichen vor allem bei komplexen Aufgaben (Mathematik, Programmierung, Logik, Planung) messbare Qualitätsgewinne gegenüber schnellen Standardmodellen. - Steuerbare Denk-Tiefe („Thinking Budget“ / „Thinking Time“)
Einige APIs bieten Schalter, mit denen sich einstellen lässt, wie intensiv der Denkmodus genutzt wird – wichtig für die Balance zwischen Kosten, Latenz und Qualität. - Reasoning-orientiertes Training
Anstelle oder zusätzlich zur reinen Next-Token-Prediction werden z. B. Chain-of-Thought-Beispiele, Rückmeldungen zur Qualität der Gedanken oder spezielle Reinforcement-Learning-Schemata verwendet, um „gute Denkprozesse“ zu verstärken. - Teil eines Modell-Portfolios
Thinking Models werden meist als spezialisierte Variante neben schnelleren „Instant“- oder „Flash“-Modellen angeboten.
Anwendungsfälle
- Komplexe Wissens- und Analyseaufgaben
Recherche, rechtliche oder medizin-nahe Fragestellungen (ohne menschliche Expertise zu ersetzen), technische Analysen, Dateninterpretation. - Mathematik & formale Logik
Lösen anspruchsvoller Mathematikaufgaben, Wettbewerbsaufgaben, formaler Beweise und Logik-Puzzles. - Programmierung & Debugging
Mehrschrittige Code-Analyse, Refactoring, Fehlersuche und Erklärung von Programmverhalten. - Planung & Entscheidungsunterstützung
Szenarioanalyse, Planungsschritte, Abwägen von Optionen inklusive expliziter Darstellung von Annahmen und Zwischenschritten. - Agentensysteme & Tool-Use
Thinking Models als „Planungskomponente“ in Agenten, die Tools aufrufen, Zwischenziele definieren und Ergebnisse kritisch prüfen.
Grenzen und Herausforderungen
- Kein echtes Bewusstsein oder „Denken wie Menschen“
Auch wenn der Begriff „Thinking“ anderes suggeriert: Die Modelle führen algorithmische Text- und Symbolmanipulation durch. Sie haben weder Bewusstsein, Gefühle noch echtes Verständnis – vielmehr simulieren sie funktionale Aspekte von Denken. - Rechenkosten und Latenz
Die Denkphase macht Thinking Models deutlich teurer und langsamer als Standardmodelle. Daher werden sie meist nur gezielt für schwierige Aufgaben eingesetzt. - „Illusion of Thinking“
Studien zeigen, dass Thinking Models zwar bei mittelkomplexen Aufgaben deutlich besser sind, bei sehr komplexen Problemen aber weiterhin an kognitive Grenzen stoßen. Die ausführlichen Gedanken können eine Scheingenauigkeit vermitteln, obwohl das Endergebnis falsch ist. - Steuerung & Sicherheit
Längere Denkprozesse bieten mehr Angriffsfläche für Prompt-Injektionen, Jailbreaks oder schleichende Fehler. Forschung arbeitet an Methoden, um Reasoning-Trajektorien zu steuern, zu prüfen und sicherer zu machen. - Transparenz & Erklärbarkeit
Obwohl Thinking Models interne Gedanken erzeugen, werden diese aus Sicherheits- und UX-Gründen oft nur teilweise oder gar nicht gezeigt. Es bleibt eine Herausforderung, nützliche Einsicht in den Denkprozess zu geben, ohne Missbrauch oder Überforderung zu riskieren.
Verhältnis zu verwandten Begriffen
- Reasoning Models / Large Reasoning Models (LRMs)
In vielen Texten werden Thinking Models und Reasoning Models synonym verwendet. Beide betonen, dass explizites, mehrstufiges Schlussfolgern im Modell verankert ist. - Chain-of-Thought (CoT)
CoT beschreibt die Prompting- und Trainingsmethode, bei der Schritt-für-Schritt-Lösungen erzeugt werden. Thinking Models gehen darüber hinaus, indem sie CoT als festen Bestandteil der Modellarchitektur und des Trainings etablieren. - Standard-LLMs / Instant-Modelle / Flash-Modelle
Schnellere Varianten, die für einfache Aufgaben optimiert sind und oft wenig oder keine explizite interne Denkphase nutzen. - System‑1/System‑2-Analogie
Thinking Models werden in populären Texten oft mit langsamem, deliberativem „System 2“-Denken verglichen, während schnelle LLMs eher „System 1“ entsprechen. Diese Analogie ist hilfreich, aber nicht identisch mit psychologischen Theorien.
KI Kurse und Schulungen um die richtigen Modelle zu Nutzen
Die Richtigen Modelle in der KI Automatisation nutzten.