过去几年,我们对大语言模型的评价标准几乎只有一个:快。输入问题,越快吐出答案越好。但最近一年,风向变了——一批被称为「推理模型」的新模型开始反其道而行之,它们不急着回答,而是先「想一会儿」。
这种「慢思考」的标志性动作,是模型在给出最终答案之前,先生成一段长长的中间推理过程。它会把问题拆解、尝试不同的思路、自我纠错,然后再收敛到一个答案。OpenAI 的 o 系列、DeepSeek 的 R1,都是这条路线上的代表。
为什么「想」比「快」更重要
因为很多问题,尤其是数学、编程、逻辑推理这类有明确对错的问题,靠「第一反应」是答不对的。人类做题时需要打草稿,模型也一样。
过去,模型把「草稿」和「答案」混在一起一口气生成。现在把它们分开:先打草稿,再写答案。仅仅这个变化,就让模型在不少硬核任务上的准确率大幅提升。
算力从「训练」挪到了「推理」
这背后有一个重要的概念:测试时计算。以前提升模型能力,主要靠训练阶段投入更多算力;现在,我们把一部分算力挪到「回答问题的那一刻」,让模型在推理时也花力气去思考。
这意味着,能力的提升不再完全依赖更大的训练规模。一条新的路径出现了:模型规模可以不大,但多给它一些思考时间,它也能解出更难的题。
这也改变了我们的使用方式
对于普通用户,推理模型的体验是复杂的。简单的问题,它的「思考」显得啰嗦;难的问题,它的「思考」又确实有用。学会判断什么时候该让模型慢慢想、什么时候该让它直接答,正在成为新的使用技巧。
更值得留意的是,「思考过程」本身变得可见、可读。这让模型的推理不再是一个黑箱,也带来新的问题:我们该如何看待这些中间过程?它们是真实的思考,还是一种流畅的表演?这些问题,暂时还没有答案。
可以肯定的是,「慢思考」不会是一阵风。它改变了模型能力的上限,也悄悄改变了我们对「智能」这件事的想象。