思维链(Chain-of-Thought,简称 CoT)是一种提示技巧:不让模型直接给答案,而是先让它把中间推理步骤写出来,最后才给结论。解数学题时,模型会先列出"设未知数、列方程、求解",而不是直接报数字。这种"先写过程"的约束,常能明显提高复杂问题的正确率。
核心做法:先写步骤,再给答案
大语言模型逐个生成词元,先前的输出会成为后面的上下文。中间步骤一旦落字,就成了最终答案的依据;步骤扎实,答案就不容易"跳步"出错。
从示例示范到一句话触发
最初的思维链是 few-shot 做法:提示词里给两三个"问题+分步解答"的例子,模型照着格式解新题。Kojima 等人 2022 年在《Large Language Models are Zero-Shot Reasoners》中证明,示例并非必需——问题后加一句"Let's think step by step",模型就能自己展开推理,这就是 zero-shot CoT,在数学推理集 GSM8K 上准确率从约 10% 提到约 40%。格式特殊、符号复杂的任务适合给示例;没有现成示例时,一句话触发更快。
投票取胜:自洽性解码
自洽性(self-consistency)是思维链的延伸:让模型解同一道题很多遍,每次路径可能不同,最后取出现最多的答案。多条独立链条同时犯同一个错的概率低,投票能过滤偶然失误;代价是算力成倍增加。
它和"推理模型"不是一回事
思维链是提示方法,任何大语言模型都能用;"推理模型"(如 o1、DeepSeek-R1)是专门训练的模型类型,分步思考是它的本能。普通模型靠思维链"提醒"分步想,推理模型天生就会——给后者再加思维链,收益通常不大。
用之前要知道的四个限制
一是 token 成本高,步骤都要输出,复杂题多花几倍 token。二是推理幻觉:步骤看似头头是道,结论却可能是错的,模型擅长生成"像推理的文本",关键步骤仍需人工核对。三是小模型收益有限,效果依赖模型底子,规模太小的模型分步写了也常错。四是长链误差累积,步骤越多出错概率越高,一步错可能步步错。
两个最常见的误解
误解一:用了思维链,模型就在"真正推理"了。不对,它只是引导模型生成分步文本,模型依然按概率预测下一个词,没有人脑那样的逻辑验证机制。误解二:展示的思维链就是模型"真实的想法",能当可解释性证据。这很危险——展示的步骤是写给用户看的文本,不等于内部真实计算过程;研究发现模型有时先定结论再编步骤,步骤只是事后合理化。
哪些场景值得一试
数学计算、逻辑推理、多步规划、需引用依据的问答,是思维链最擅长的领域。创意写作、闲聊、简单事实查询则基本是浪费 token:问题越需要严密推导越值,答案越开放主观越没必要。
思维链把"想清楚再说"变成了可复制的操作;记住它的边界和误解,往往比记住用法更重要。