2024 年的 GPT-4 答一道数学竞赛题,正确率大约只有 9%。到了 2024 年底 OpenAI o1 发布,这个数字涨到 79%;开源的 DeepSeek R1 也不相上下,约 80%。

不是模型又大了几十倍,而是它们学会了一件事:在开口回答之前,先安静地"想"一会儿。

从"系统 1"到"系统 2"

心理学家卡尼曼把人的思考分成两种:系统 1 是快、直觉、自动化的(脱口而出"2+2=4");系统 2 是慢、深思熟虑、逻辑严密的(心算"17×24")。

过去的大模型本质上都是"系统 1"思考者。它们靠海量预训练数据喂出的"语感",一个词一个词地往下预测。如果第一步就走错,它们没法回头,只能顺着错误的逻辑继续"胡说八道"——也就是幻觉。

推理模型(o1、R1、Gemini 思考模式、Claude 扩展思考等)第一次把"系统 2"带进了 AI。它们被训练成:意识到自己卡住了,会主动回溯,换一条路再试,并在给出最终答案前反复验证自己的逻辑。

那个"安静地想一会儿"的过程,模型在后台生成了大量用户看不见的"思维链(CoT)"Token。它们充当了一个巨大的工作记忆缓冲区——在内部推演、自我纠错,最后只把整理好的答案交给你。

怎么教会模型"思考"

人脑的内部思考过程不可见,没法直接喂给模型。所以研究者用了强化学习(RL):给模型一道极难的数学题,配一个自动验证器(比如一段 Python 脚本,只检查最终答案对不对)。做对了给奖励,做错了给惩罚。

经历数百万次试错后,模型会自发学会一个习惯:在不确定的地方多写一句"让我再仔细检查一遍",最终获奖的概率就更高。

DeepSeek R1 把这个故事推到了极致。它先用纯 RL(没有任何人类写好的解题过程)训练,模型经历了著名的"顿悟时刻(Aha! Moment)"——自己学会了写超长推理轨迹、自我反思、纠错。之后再用最干净的一批推理样本做冷启动,得到既聪明又好读的 R1。

一个关键发现是:R1 在 671B 参数下,靠 MoE 每次只激活约 37B,既保证了超长推理轨迹,又压住了推理成本。

测试时算力:比"堆参数"更便宜的杠杆

过去十几年,让 AI 变聪明的唯一办法是"训练时算力"——买十万张卡、苦训半年。推理模型的出现,宣告了测试时算力(Test-Time Compute)时代的到来。

核心洞察很简单:你不必只在训练时买智能,也可以在提问的那一刻、按问题难度"再买一次"。遇到人类专家要花 10 小时的难题,你大可以让模型"去思考 30 分钟",它在推理阶段消耗海量算力,遍历一棵庞大的逻辑搜索树,给出深思熟虑的答案。

研究有个很锋利的结论:在基础模型已经"接近答案"的问题上,最优分配的测试时算力,可以击败一个参数量大 14 倍的模型(FLOPs 匹配比较)。换句话说,推理算力有时能替代参数——这也是为什么一个更小、更便宜的推理模型能在数学上打赢大得多的普通模型。

但边界也很清楚:测试时算力只能放大模型已经具备的潜力,不能凭空创造它从未拥有的能力。 在模型根本够不着的问题上,你再怎么让它"多想"也没用。

好钢用在刀刃上

推理模型不是万能的,它的代价是又慢又贵

有实测显示,同一个模型开着推理,token 消耗能是不开推理的二十多倍——而你是按 token 付费的。早期推理模型一道题要等 30–120 秒;到 2026 年初快一点的已压到 3–15 秒,但仍远慢于标准模型的即时回复。

所以工程上的经验很直白:别用推理模型去翻译、总结、闲聊。 这些"系统 1"任务上,它们不仅慢、贵,效果往往还不如小模型。把推理算力留给编程、高等数学、复杂逻辑推演——这才是刀刃。

行业正在走向一个更优雅的形态:不再是"推理模型"和"普通模型"两个物种,而是同一个模型按问题自行决定想多深。需要快答就秒回,遇到硬骨头就多想几分钟。当"让 AI 想多久"成了一根可以随手拨动的旋钮,我们才真正第一次拥有了"按需调节智能强度"的计算机。