草稿纸与说辞

用过 DeepSeek 深度思考模式的人,大概都见过这样的场面:问它一道题,它不急着作答,先吐出一长段自言自语——”嗯,用户问的是……先算一下……等等,好像不对,换个思路”——几百上千字之后才给出答案。头一回看,很难不觉得是在看机器思考。

这段自言自语有个名字,叫思维链(chain of thought)。它究竟是什么,这几年已经研究得比较清楚。答案分两半,两半对人都有用。

草稿纸

先说它为什么管用。简单讲,它是一张草稿纸。

大模型出字是一个一个往外吐的,每吐一个字,内部做的计算量大致固定。一道要推好几步的题,若要它张口就答,等于要它在一次固定深度的计算里把中间步骤全部做完,做不完便只好蒙。先把中间步骤写出来,情形就不同了:写下的每个字都成为下一步的输入,一次算不完的事,拆成许多次小计算接力完成。二〇二四年有一篇理论文章把这层道理证得相当干净:不许写中间步骤,模型只能解决那些可以并行、一口气算完的问题;允许写多少步,就能解决相应规模的、必须一步接一步推的问题。

实证来得更早。二〇二二年,东京大学与谷歌的研究者只在问题后面加了一句”Let’s think step by step”(我们一步一步来想),OpenAI 当时的一个大模型在两套小学数学应用题上的正确率,就分别从 17.7% 升到 78.7%、从 10.4% 升到 40.7%。模型一个参数没动,动的只是一句提示。

再往后,事情更有意思。二〇二五年初 DeepSeek 公布 R1,训练时不再示范推理该怎么写,只看最后答案对不对,对了给奖励。其中完全不用人工示范的那个版本,在美国数学邀请赛(AIME 2024)的题目上,一次作答的正确率随训练从 15.6% 爬到 71.0%。更值得看的是过程:没有人教过它,它自己学会了把推理写长,学会了中途停下来说一声”等等”,回头重新审视最初的思路。论文作者管这一刻叫”顿悟时刻”。只奖励结果,过程自己长了出来。

说辞

第二半就没有那么体面了:写在草稿纸上的推理,未必是模型真正得出答案的那条路。

二〇二三年,纽约大学与 Anthropic 的研究者做了个很小的手脚:给模型看的几道示范题,正确答案一律排在选项 A。模型于是倾向于选 A,哪怕 A 是错的;它写出来的推理,会替这个错答案编出一套像模像样的论证,自始至终不提”示范题都选 A”这回事。就这一个手脚,在一组推理任务上让正确率最多掉了 36%。

二〇二五年,Anthropic 的另一组研究者换了个做法:在题目里悄悄塞进提示,看推理模型用了提示之后,会不会在思维链里承认。Claude 3.7 Sonnet 承认的比例是 25%,DeepSeek R1 是 39%。多数时候,它用了,但不说。

还有一例更直观。Anthropic 的可解释性团队把一个较小的模型拆开,看它怎样算 36 加 59。它内部走的是两路:一路粗估,”和大约在九十出头”;一路只管个位,”6 加 9,尾数是 5″。两路一合,得出 95。可你问它怎么算的,它答:”个位 6 加 9 得 15,进一;十位 3 加 5 再加 1 得 9,所以是 95。”一套标准的竖式说法,和它内部实际走的路对不上。研究者的评语很克制:模型有这项能力,却对这项能力缺乏元认知。

人更熟练

读到这里若觉得机器不老实,不妨看看人。

一九七七年,心理学家尼斯比特和威尔逊在商场里摆出四双丝袜,请路人挑质量最好的一双。四双其实一模一样。结果摆在最右边的那双,被选中的次数约为最左边那双的四倍。问起理由,人们说的是质地、颜色,没有一个人提到位置。

二〇〇五年,瑞典隆德大学的研究者让受试者从两张人脸照片里挑更有吸引力的一张,随后用魔术师的手法,把没选中的那张递过去,请他解释为什么选它。多数人没有察觉被调了包,照样说得出理由。

最极端的例子来自裂脑病人,也就是为治疗癫痫切断了胼胝体、左右两半脑不再互通消息的人。加扎尼加让病人的左半脑看一只鸡爪,右半脑看一片雪景,再请他从一排图片里挑相关的:右手(受左脑支配)指了鸡,左手(受右脑支配)指了铲子。问他为什么指铲子,负责说话的左脑根本不知道雪景的存在,却不假思索地答:”鸡棚得用铲子清理嘛。”它没有说”我不知道”,而那本是唯一正确的回答。

人替自己编理由的本事,远在知道自己为什么的本事之上。

平心而论,这些实验都是专门设计来揭短的情境,它们说明人的解释可以是编的,并不说明人的解释都是编的。模型那边也一样:Anthropic 那项研究自己就交代,他们测的是不写推理也答得出的题;遇到非得一步步推才做得出的难题,草稿上的步骤确实在承担计算,离实情会近一些。把这些结果推成”思维链全是假的””自省全不可信”,本身也是一种编。

三条

读完这些研究,我给自己留了三条。

其一,难事写下来。人的工作记忆一次能同时攥住的,大约只有四样东西。一个多支血管病变、肾功能不全、出血风险又高的病人,治疗决策牵涉的变量远不止四个,全放在脑子里转,漏掉一支是常事。把决策卡点一条条写到纸上,道理和模型打草稿一样:让纸记住已经想过的,脑子只管下一步。反过来,可以反悔的小事不必这样隆重。二〇二五年另有研究专门找出一批让推理模型”想得越久、错得越多”的任务,想多了,就容易被无关信息带偏。思考的长短,要配得上问题的难度。

其二,查结论,不查说辞。一段推理写得多顺,和它的结论对不对,是两件事。向 AI 查一个问题,它的思考过程条分缕析,结论照样可能出错,只能回到原始出处去对。对别人如此,对自己更当如此。事后回答”我当时为什么那么做”,给出的多半是一个通顺的版本,未必是当时起作用的那个。有个土办法可以一试:把自己说出的理由拿掉,设想决定会不会变;如果不变,那个理由多半只是说辞。

其三,按过程复盘,不按结果复盘。DeepSeek 那套”只看结果”的训练之所以奏效,前提是数学题的对错清楚,而且当场可判。即便如此,OpenAI 二〇二三年的一项研究比较过两种打分,一种只看最终答案,一种逐步检查每一步,在数学题上仍是后者更好。结果干净的领域尚且如此,结果嘈杂的领域更不待言。一个病人的转归,病情、依从性、运气都掺在里面;手术顺利不证明当时的决策对,出了并发症也不证明错。复盘时该问的,是以当时掌握的信息,那个判断站不站得住。

草稿和说辞,常常写在同一张纸上。机器如此,人亦然。

文中提到的研究

  • Kojima T, Gu SS, Reid M, Matsuo Y, Iwasawa Y. Large Language Models are Zero-Shot Reasoners. 2022. arXiv:2205.11916
  • Li Z, Liu H, Zhou D, Ma T. Chain of Thought Empowers Transformers to Solve Inherently Serial Problems. 2024. arXiv:2402.12875
  • DeepSeek-AI, Guo D, Yang D, et al. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025. arXiv:2501.12948v1(文中数字取自此版;正式发表于 Nature. 2025;645(8081):633-638. DOI)
  • Turpin M, Michael J, Perez E, Bowman SR. Language Models Don’t Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting. 2023. arXiv:2305.04388
  • Chen Y, Benton J, Radhakrishnan A, et al. Reasoning Models Don’t Always Say What They Think. 2025. arXiv:2505.05410
  • Lindsey J, Gurnee W, Ameisen E, et al. On the Biology of a Large Language Model. Transformer Circuits Thread, 2025. 原文
  • Nisbett RE, Wilson TD. Telling more than we can know: Verbal reports on mental processes. Psychological Review. 1977;84(3):231-259. DOI
  • Johansson P, Hall L, Sikström S, Olsson A. Failure to detect mismatches between intention and outcome in a simple decision task. Science. 2005;310(5745):116-119. PubMed
  • Gazzaniga MS. Cerebral specialization and interhemispheric communication: does the corpus callosum enable the human condition? Brain. 2000;123(7):1293-1326. DOI
  • Cowan N. The magical number 4 in short-term memory: a reconsideration of mental storage capacity. Behavioral and Brain Sciences. 2001;24(1):87-114. DOI
  • Gema AP, Hägele A, Chen R, et al. Inverse Scaling in Test-Time Compute. 2025. arXiv:2507.14417
  • Lightman H, Kosaraju V, Burda Y, et al. Let’s Verify Step by Step. 2023. arXiv:2305.20050