Chain-of-Thought (CoT, Gedankenverkettung) ist eine Prompt-Technik: Statt das Modell direkt antworten zu lassen, schreibt es zuerst seine Zwischenschritte auf und nennt die Schlussfolgerung erst am Ende. Bei einer Textaufgabe listet es erst "Unbekannte definieren, Gleichung aufstellen, lösen", statt nur eine Zahl zu nennen. Diese Pflicht zum "erst den Weg zeigen" verbessert die Trefferquote bei komplexen Problemen oft deutlich.
Das Kernprinzip: erst die Schritte, dann die Antwort
Große Sprachmodelle erzeugen Token für Token, und frühere Ausgaben werden zum Kontext für spätere. Genau das nutzt Chain-of-Thought: Einmal niedergeschriebene Zwischenschritte werden zur Grundlage der finalen Antwort. Solide Schritte, und die Antwort "überspringt" seltener entscheidende Zwischenschritte.
Von Beispielen zum Ein-Satz-Auslöser
Ursprünglich war CoT Few-Shot: Zwei bis drei "Frage + schrittweise Lösung"-Beispiele im Prompt, und das Modell löst neue Aufgaben im gleichen Format. 2022 zeigten Kojima et al. in "Large Language Models are Zero-Shot Reasoners", dass Beispiele nicht nötig sind — ein angehängtes "Let's think step by step" genügt, damit das Modell selbst schrittweise vorgeht. Dieses Zero-Shot-CoT hob die Genauigkeit auf dem Mathe-Benchmark GSM8K von etwa 10 % auf etwa 40 %. Beispiele passen zu Aufgaben mit ungewöhnlichem Format oder viel Notation; der Ein-Satz-Auslöser ist schneller, wenn keine Beispiele zur Hand sind.
Sieg durch Abstimmung: Self-Consistency-Decoding
Self-Consistency (Selbstkonsistenz) erweitert CoT: Das Modell löst dieselbe Aufgabe viele Male per Chain-of-Thought, jedes Mal auf möglicherweise anderem Weg, und die häufigste Antwort gewinnt. Dass mehrere unabhängige Ketten denselben Fehler machen, ist unwahrscheinlich — die Abstimmung filtert Zufallsfehler heraus. Der Preis: ein Vielfaches an Rechenaufwand.
Nicht dasselbe wie ein "Reasoning-Modell"
Chain-of-Thought ist eine Prompt-Methode für jedes große Sprachmodell; "Reasoning-Modelle" (wie o1 oder DeepSeek-R1) sind speziell trainierte Modelltypen, denen schrittweises Denken in Fleisch und Blut übergegangen ist. Normale Modelle brauchen CoT als Erinnerung ans schrittweise Denken, Reasoning-Modelle können es von Natur aus — ihnen zusätzlich CoT aufzuerlegen, bringt meist wenig.
Vier Grenzen, die man vorher kennen sollte
Erstens: hohe Token-Kosten, denn jeder Schritt muss erzeugt werden — schwere Aufgaben kosten ein Mehrfaches an Token. Zweitens: Reasoning-Halluzinationen — die Schritte können tadellos wirken, während die Schlussfolgerung falsch ist; Modelle sind gut darin, Text zu erzeugen, der wie Reasoning aussieht, also brauchen Schlüsselschritte menschliche Prüfung. Drittens: begrenzter Nutzen bei kleinen Modellen — der Effekt hängt stark von der Grundfähigkeit ab, zu kleine Modelle irren auch mit Schritten häufig. Viertens: Fehlerakkumulation in langen Ketten — je mehr Schritte, desto höher die Fehlerwahrscheinlichkeit, und ein falscher Schritt kann alles Folgende kippen.
Zwei verbreitete Missverständnisse
Erstens: Mit CoT "denkt" das Modell wirklich. Nein — CoT lenkt das Modell nur dazu, schrittweisen Text zu erzeugen; es sagt weiterhin per Wahrscheinlichkeit das nächste Token vorher, ohne menschlichen Logikprüfmechanismus. Zweitens: Die angezeigte Kette sei der "wahre Gedankengang" und damit ein Beleg für Erklärbarkeit. Das ist gefährlich — die gezeigten Schritte sind für den Nutzer erzeugter Text, nicht der tatsächliche interne Rechenprozess. Studien fanden Fälle, in denen das Modell erst die Schlussfolgerung festlegte und die Schritte nachträglich erfand: reine nachträgliche Rechtfertigung.
Wo sich der Versuch lohnt
Mathematik, logisches Schließen, mehrstufige Planung und Q&A mit Belegpflicht sind CoTs Revier. Kreatives Schreiben, Plaudern und simple Faktenabfragen verschwenden damit meist nur Token: Je strenger die geforderte Herleitung, desto mehr lohnt sich CoT; je offener und subjektiver die Antwort, desto entbehrlicher ist es.
Chain-of-Thought macht aus "erst denken, dann sprechen" eine wiederholbare Operation. Seine Grenzen und Missverständnisse zu kennen, ist oft wichtiger, als die Anwendung zu kennen.