跳到主要内容

让它想清楚再答 — 把草稿纸还给它

这一章讲三件事: 为什么「让它把过程写出来」这么一个土办法能大幅提高正确率; 书里那六种「高级技巧」各自在做什么;以及书把其中三种讲错了,错在哪。 这一章是全书技术含量最高的一章,也是最值得花时间的一章—— 因为它讲的不是话术,是这台机器唯一的一种「多想一会儿」的办法。

1. 先看现象:同一道题,问法不同,对错不同

你大概见过这种事:

  • 问「一顿饭 50 块,加 15% 小费一共多少钱」——它可能张口就给个错数;
  • 换成「一顿饭 50 块,加 15% 小费一共多少钱?先算小费是多少,再加起来」——它就对了。

同一个模型、同一道题、同一秒钟,只因为你多加了半句话。

这看起来像玄学,但它有一个非常朴素的解释,而且这个解释是本章的全部内容。

2. 顶层全景:它写出来的字,就是它仅有的草稿纸

回到第 01 章那个循环:它每写一小块,都会把「已有文字 + 刚写的这块」重新读一遍, 再算下一块。

这句话反过来看,就是本章的钥匙:

直接要答案:
[题目] → 它必须在「吐出第一个字」的那一瞬间就把整道题算完

└─ 它没有内部草稿纸,一次算不完就只能蒙一个像答案的数

让它先写过程:
[题目] → 「小费 = 50 × 0.15 = 7.5」 → 重新读一遍 → 「50 + 7.5 = 57.5」
↑ ↑
第一步的结果落在纸上 第二步是在读着第一步的结果算的

图说:每多写一行,它就多了一次「看着上一步的结果算下一步」的机会。
写出来的字,是它唯一能存中间结果的地方。

这就是本章所有技巧的共同原理: 它没有藏在内部的思考过程,它的「想」就发生在它写出来的字里。 所以「让它多想一会儿」的唯一办法,是「让它多写几行」。

记住这一句,下面六种技巧你都能自己推出来。

3. 核心原理:六种技巧,一条主线

3.1 思维链:让它先写过程,再写答案

它解决什么问题: 需要好几步才能算出来的题,它一步跨不过去。

怎么做,两种写法:

写法长什么样什么时候用
加一句话在问题后面加「让我们一步一步想」最省事,先试这个
给带步骤的例子给一两道同类题,连解题过程一起写出来你对步骤的格式有要求时

书对这一条的描述是:鼓励 AI 一步步处理问题,把复杂问题拆成更小的逻辑步骤1。 这个描述是对的。

它的正式名字叫思维链(英文 chain-of-thought,常缩写成 CoT):

思维链就是让模型在给出最终答案之前,先把中间的推理步骤写出来。 名字里的「链」指的就是那一串前后相扣的中间步骤。

为什么有效: 就是第 2 节那张图——每一步都只需要它跨一小步, 而上一步的结果已经写在纸上了。

这一条有证据,而且证据很硬(书里一条都没给):

论文做了什么结果
2022 年 5 月,Kojima 等2只加一句「Let's think step by step」小学数学应用题正确率 10.4% → 40.7%
2022 年 1 月,Wei 等3给八道带解题过程的例子在当时最好的数学题成绩上刷新纪录

注意第一行的分量: 那不是换了模型、不是加了数据,只是多打了五个英文单词。

3.2 但书的例子举错了

书给思维链配的例子是1:

「解释通货膨胀对小企业的影响。先定义通货膨胀,然后讨论它对运营成本的影响, 最后提出缓解办法。」

这是一个写作提纲,不是思维链。

差别在哪:

思维链书那个例子
目的让它算对一个答案让文章按这个结构展开
中间步骤的作用后一步要用到前一步的结果三段之间互不依赖,顺序换了也行
属于第 02 章的哪个部件不属于——这是新东西③ 格式,就是规定输出结构

判断(我们的,不是书里的): 把「规定文章结构」和「让它一步步算」混为一谈, 会让读者在真正需要思维链的场合(算数、多条件筛选、逻辑推演)想不起来用它, 反而在写文章的时候到处加「一步一步想」。 判据很清楚:后一步要不要用到前一步算出来的东西? 要,才是思维链。 如果错,会错在: 如果「让它按结构展开」在某些任务上也确实提高了正确率 (而不只是让格式变好看),那这条界线就没有实践意义,只是术语洁癖。

3.3 自洽:同一题问好几遍,取多数

自洽就是「几遍答案对得上」的意思——名字说的正是这个做法的判据。

它解决什么问题: 思维链会走错路。走错一次,答案就错。

怎么做: 同一道题,独立地问它好几遍(靠温度带来的随机性,每遍走的路不一样), 然后看哪个答案出现次数最多,就取那个——这一步叫多数表决。

同一道题问 5 遍:
第 1 遍 → …推导… → 答案 57.5
第 2 遍 → …另一条路… → 答案 57.5
第 3 遍 → …走岔了… → 答案 65
第 4 遍 → …又一条路… → 答案 57.5
第 5 遍 → …再一条路… → 答案 57.5

多数表决:57.5

图说:每条路都可能走岔,但走岔的方式各不相同,而走对的路都通向同一个答案。
所以「最多人到达的那个答案」大概率是对的。
(65 这个走岔的答案是为演示编的,不是真实数值。)

为什么有效: 错误是分散的,正确是集中的。 一道复杂题往往有多条路能通向同一个正确答案,但走错时错得千奇百怪。

证据: 2022 年那篇论文在五个基准上都测出了提升—— 小学数学应用题那一项 +17.9%,是五个里最大的一个;最小的一项是 +3.9%,差出四倍多4

代价必须说清楚:问 5 遍就是 5 倍的钱和 5 倍的等待时间。 所以它适合「答错代价很高、而且答案是个能比对的短东西」的场合(一个数、一个分类标签), 不适合让它写文章——五篇文章没法「多数表决」。

3.4 书把自洽也讲错了

书对自洽的定义写得基本对:让 AI 生成多个独立的回答,选出现得最多或最一致的那个5但它配的例子直接违背了自己的定义:

「计算一顿 50 美元的饭加 15% 小费的总价。给出三种不同的计算方法。6

这是在一次回答里让它把同一道题算三遍,不是独立地问三遍。

为什么这个差别是致命的:

✗ 一次回答里写三种方法:
[题目] → 方法一(得数 57.5)→ 方法二 → 方法三

后面两种是「读着方法一的结果」写的 —— 它们不独立。
方法一要是算错了,后面两种会顺着错下去。

✓ 独立问三遍:
[题目] → 第 1 次回答 (互相看不见)
[题目] → 第 2 次回答 (互相看不见)
[题目] → 第 3 次回答 (互相看不见)

图说:自洽的全部力量来自「独立」二字。不独立,多数表决就没有意义 ——
三个抄同一份答案的人举手,不代表这答案对。

判断(我们的,不是书里的): 这个例子的错法很典型—— 它把一个需要在提示词之外做的事(重复调用 + 统计),写成了一句提示词。 本章 3.7 那一节也是同样的错法。 一条能自动判断的判据:这个技巧需不需要「跑不止一次模型」? 需要,那它就不可能只靠一句提示词实现。 如果错,会错在: 如果一次回答里的多条推理路径在实践中真的能起到近似的纠错作用, 那书的写法就是一个有效的廉价近似,只是名字用错了。

3.5 先造知识,再答题

它解决什么问题: 直接问一个需要背景知识的问题,它会边编背景边给结论,两头都不牢。

怎么做: 分成两步——第一步只要它把相关的背景知识写出来, 第二步再基于这些背景回答真正的问题7

补充(不在书里): 书给这一节起的名字是英文 generated knowledge prompting (直译:先生成知识再提问)。这不是作者自造的词——它出自 2021 年 10 月一篇同名论文, 第一作者是 Jiacheng Liu。

论文的做法和书里说的是同一件事:先让语言模型自己写出一段知识, 再把这段知识当成额外的输入去回答原来那个问题8书照例没有提这篇论文。

书给的例子是:先问「解释可再生能源的基本原理」, 再问「基于上面这些信息,给出企业转向可再生能源的五个办法」9

为什么有效: 还是那张草稿纸。第一步写出来的背景,在第二步会被当成输入重新读一遍—— 等于你在不查任何资料的情况下,把它自己脑子里的相关内容先摊到桌面上, 再让它对着桌面回答。

回到本章那道小费题,把这一招整个走一遍:

第一步,只要背景,先别算:

我要算一顿饭的小费。先别给答案,先把「小费怎么算」讲清楚: 按哪个金额算、含不含税、常见比例是多少。

它写出来的那段背景(节选四条):

· 小费一般按餐费乘一个比例算,通常按税前金额。
· 常见比例是 15%~20%;15% 属于「还行」,20% 属于「满意」。
· 若账单上已经收了服务费,通常就不再另付小费。
· 加州部分城市的餐饮税为 9.5%,小费仍按税前算。 ← 盯住这一行

第二步,基于这段背景再算:

基于上面这段,算:一顿饭 50 块,加 15% 小费一共多少钱?

→ 小费 = 50 × 0.15 = 7.5 → 50 + 7.5 = 57.5

答案还是 57.5,和 3.1 那次一模一样。这一招真正的收获不在答案上,在第一步那段背景上。

现在盯住画了记号的那一行:「加州部分城市的餐饮税为 9.5%」。 这个数是它顺口造出来的——而它长得和上面三条一模一样:同样笃定、同样没有出处、 同样排在一个整齐的列表里。

这一次它没害着你,因为小费按税前算,那一行压根没参与计算; 但你要是问的是「含税一共多少」,这一行就直接进了答案。 这就是这一招的全部价值:它把它编的东西摊到了桌面上,让你在它进入答案之前先看见。

(这段背景和那个 9.5% 都是为演示编的,不是真实数值,也不是任何一地的真实税率。)

它的边界必须说清楚(书没说):

这一步造出来的「知识」仍然是它编的。 它只能把已经在模型里的东西摊开, 不能变出模型里没有的东西。 摊开之后你能看见、能纠错,这是它的价值; 但它不解决「模型不知道」的问题。要解决那个,得从外面塞资料进来——第 04 章讲。

书自己也提醒了一句:往下走之前,先检查造出来的知识全不全10。这条提醒是对的, 但它把这件事说成了「检查完整性」,没有点破更重要的那件事:检查它是不是编的。

3.6 拆成多步:一次只让它做一件事

它解决什么问题: 第 02 章讲过,一条提示词里塞十个要求,它会挑着做。

怎么做: 把一个复杂请求拆成几个阶段,每一步都以上一步的结果为起点11。 书给的例子是:第一步「列出一个有效社交媒体策略的关键要素」, 第二步「说明每个要素怎么衡量成效」12

它和思维链的区别,是本章最容易搞混的一处,值得单列:

思维链拆成多步
谁在控制节奏模型自己,一口气写完,每一步之间你可以看、可以改
跑几次模型一次好几次
中间结果在同一段回答里你手上有,可以编辑后再传下去
什么时候用一道题需要几步算一件事需要几个阶段,而且你想在中间插手

书特别点了一句很实在的建议:允许用户在阶段之间介入,调整方向13这正是拆成多步唯一比思维链强的地方——控制权在你手里。

但书自己也在另一章埋了这个做法的风险: 如果每一步都过度依赖上一步的结果,错误会一路传下去14

所以拆成多步的正确用法是:每一步之间你要看一眼。 你不看,它就退化成一条更贵、更慢的思维链,而且错得更隐蔽—— 因为错误被分散到了好几次回答里,不像一段推理那样一眼能看出断点。

3.7 思维树:让它铺开几条路,再挑一条

它解决什么问题: 有些题不是「一步接一步」,而是「先试几个方向,发现不通就退回来换一个」。

书的描述是:让 AI 在定下最佳方案之前,先探索多种可能性15, 并建议鼓励它回头修改之前的分支16

它的正式名字叫思维树(英文 tree of thoughts,常缩写成 ToT)。 名字里的「树」指的是:每一步有好几个候选,每个候选下面又分出好几个,像树杈一样铺开。

证据很惊人: 2023 年那篇论文里,一个凑 24 点的游戏, 思维链只做对 4%,思维树做对 74%17

但这里书又犯了 3.4 那个错:

论文里的思维树书里描述的做法
谁在铺开分支外面的程序,一次只让模型生成一个候选让模型在一次回答里自己铺开
谁在打分单独跑一次模型给每个候选打分让它自己评
能不能真的回退能——程序记着树,可以回到任意节点不能,已经写出来的字收不回去
要跑几次模型几十到上百次一次

判断(我们的,不是书里的): 书里那句提示词 (「评估小企业的多种扩张策略,考虑各自的利弊」18) 拿到的是一份带利弊的方案对照表——那是个有用的输出,但它不是思维树, 是第 02 章的③格式部件。 真正的思维树是一套程序,不是一句话。 实用的结论:如果你是在对话框里打字,思维树对你不可用; 你能拿到的最好的近似,是 3.3 那个自洽——问几遍,自己挑。 如果错,会错在: 如果某个新模型内置了搜索与回退(在内部真的能试错回退), 那这条界线就会被抹掉,「一句提示词」也能拿到接近的效果。

3.8 让它自己检查、自己改——这一条要打个大问号

书的描述是:鼓励 AI 分析自己的回答,为准确性和完整性做修改19, 例子是「先总结 AI 对教育的影响,然后回顾一遍,指出还能再展开哪些地方」20

这个做法很流行,但它有一个不算小的反证,而且书完全没提:

补充(不在书里): 2023 年 Google DeepMind 一篇论文的标题就是结论—— 《大语言模型还不会自我纠错推理》。它测出来:在没有外部反馈的情况下, 模型很难改对自己的答案,有时候改完反而更差21

为什么会这样,可以从第 2 节推出来:

它凭什么判断自己第一版错了?
└─ 凭它自己那套规律 —— 和写出第一版用的是同一套规律
└─ 一套规律判断不了自己的错:它当初正是因为「觉得这样最像」才那么写的

图说:自己批改自己,用的是同一把尺子。尺子本身不准的地方,量几遍都不准。

还是那道小费题。「改完反而更差」长什么样,走一遍就看见了:

第 1 次问: 一顿饭 50 块,加 15% 小费一共多少钱?先算小费,再加起来。
它答: 小费 = 50 × 0.15 = 7.5 → 50 + 7.5 = 57.5 ← 对的

第 2 次问: 回顾一下你上面这个答案,检查有没有问题,并改进它。
它答: 「重新检查后我发现漏算了餐饮税。按 9.5% 的税率,
税后餐费 54.75,小费应按 54.75 × 0.15 = 8.21 算,
合计 62.96。」 ← 改错了

图说:第 2 次那句话没有给它任何新事实,它只好去找一个「看起来更周全」的角度。
而「更周全」和「更对」是两回事。
(62.96、54.75、9.5% 这几个数是为演示编的,不是真实数值。)

它错在哪:你从头到尾没提过税。 那个 9.5% 是它自己引进来的——正是 3.5 那一节里它编出来的同一个数。 它甚至没有察觉自己刚刚往一道纯算术题里塞了一个凭空的前提。

换成带外部反馈的第 2 次提问,同一道题:

第 2 次问: 这顿饭不含税,账单上也没有服务费。按这个前提再核一遍。
它答: 「按不含税、无服务费:50 × 0.15 = 7.5,合计 57.5。」 ← 守住了

两次「让它回顾」,写法几乎一样,结果一对一错。差别只有一样: 第二次你塞进了一条它原来没有的事实。

那什么时候「让它改」是有效的?判据只有一条:有没有外部反馈进来。

场景有效吗为什么
「回顾一下你刚才的答案,改进它」多半无效没有新信息进来
代码跑一遍,把报错贴回去让它改有效报错是外部事实
把查到的资料贴回去让它对照修正有效资料是外部事实
你指出具体哪句不对,让它改有效你是外部反馈
「按这份检查清单逐条核对」可能有效清单把「凭感觉」换成了「逐项检查」,算一种弱外部约束

判断(我们的,不是书里的): 这一条是全书六个技巧里唯一一个 我们建议按原样使用会浪费时间的。 书的写法(「回顾并改进」)属于表格第一行;要让它变得有用, 必须往里塞一样它原来没有的东西——报错、资料、你指出的错处、或者一份具体的检查清单。 如果错,会错在: 如果新一代模型的自查能力已经足够强(它们内部本来就在多想几轮), 那这条警告就过时了,代价是你白白多写了几句检查清单。

3.9 对照式提问:让它对着比

书列的最后一种是让 AI 指出两个概念的异同22,例子是「比较云存储和本地存储的优劣」23

说实话,这一条不算「高级技巧」,它就是第 02 章那个「用对动词」—— 把动词从「介绍」换成「对比」。

但它有一个真实的好处值得点出来,书没说:

对照会逼出它本来不会主动说的那一半。 单独问「云存储好在哪」,你会拿到一串优点; 问「云存储和本地存储各自什么时候更合适」,它必须给出云存储不合适的场景—— 而那半边往往才是你真正需要的。

同一招的另外两个用法(我们补的):

  • 「给我一个正例(符合的例子)和一个反例(不符合的例子)」——把边界逼出来;
  • 「什么情况下这条建议不成立」——把适用条件逼出来。

4. 一张选型表:什么时候用哪一个

这一章六种技巧,书是平铺着讲的,没有给选择顺序。补一张:

你的情况用哪个成本
一道要算几步的题思维链(先加那一句话)几乎为零
算错代价高,答案是个短东西自洽(问 N 遍取多数)N 倍
它明显在瞎编背景先造知识再答题,并且你要看那份背景两倍
一件事有好几个阶段,你想中途插手拆成多步几倍,但你有控制权
需要试几个方向再决定对话框里:自洽;写程序:思维树
想让它改进已有的回答只有在你能提供外部反馈时才做视情况
想逼出它没主动说的那一半对照式提问

还有一条压过上面所有行的规则:

补充(不在书里): 对 2024 年之后那批专门为多步思考训练的模型, OpenAI 的官方建议是不要再加「一步一步想」这类指示,因为它们内部已经在做了24

所以正确的顺序是:先直接问,不行再上技巧。 一上来就堆思维链、堆例子, 在新模型上可能既花钱又降低质量。

5. 作者的判断与证据

这一章对应的原书内容,六个技巧一条证据都没给,一篇论文都没引。

技巧书讲得对不对我们的处理
思维链描述对,例子错(拿写作提纲当思维链)补了两篇原论文和具体数字
自洽定义对,例子违背了自己的定义指出「独立」才是它的全部力量
先造知识再答题,但没说造出来的知识仍是编的;名字直接用了论文的,却没提论文补了原论文和边界
拆成多步,而且「允许中途介入」这条点得很好补了它与思维链的分工
思维树描述缩水,把一套程序写成了一句话补了原论文和 4% → 74%
自我反思有反证,书没提补了反证和「必须有外部反馈」的判据
对照式提问,但它其实不算高级技巧补了它真正的价值

判断(我们的,不是书里的): 这一章暴露了这本书的一个系统性问题—— 它是从二手材料整理来的技巧清单,作者本人未必逐个跑过。 三个例子和定义对不上的地方,恰恰都出现在「需要跑多次模型」的技巧上; 而那类技巧,你只在对话框里打字是体会不到的。 如果错,会错在: 如果作者确实跑过、只是为了让读者好上手而给了简化版例子, 那这就是取舍不是错误——但书里没有任何一处说明这是简化版,读者会当真。

6. 边界与局限

书没讲的为什么要紧
思维链在小模型上不管用原论文说这个能力是模型够大之后才出现的;拿一个小模型试思维链,你会以为技巧无效
多写几步会更贵更慢思维链、自洽、拆成多步都是拿钱和时间换正确率,书一次都没提成本
写出来的推理不等于真实的推理它写的步骤看起来合理,但未必是它得出答案的真实过程——所以不能把它的推理过程当审计证据
对新一代模型可能有反效果见第 4 节
自洽只能用于答案可比对的任务五篇文章没法多数表决

7. 可带走的

  1. 它没有内部草稿纸,写出来的字就是草稿纸——这是本章唯一要记的那句话;
  2. 思维链 = 让它先写过程再写答案;最省事的版本就是加一句「一步一步想」;
  3. 那一句话的效果是有硬数字的:一篇论文里数学题正确率 10.4% → 40.7%;
  4. 自洽 = 独立问 N 遍取多数;「独立」是全部力量所在,一次回答里写三种方法不算;
  5. 自洽的代价是 N 倍的钱和时间,只适合答案是个短东西的场合;
  6. 先造知识再答题,能把它编的背景摊出来给你看,但摊不出模型里没有的东西;
  7. 拆成多步的唯一优势是你能中途插手;你不插手,它就只是更贵的思维链;
  8. 思维树在对话框里做不到,它是一套要跑几十次模型的程序;打字的人用自洽代替;
  9. 让它「自己回顾改进」多半无效,除非你塞进外部反馈(报错、资料、你指出的错处、检查清单);
  10. 对照式提问的价值是逼出它不会主动说的那一半;
  11. 对新一代会自己多想几步的模型,先直接问,别一上来就堆技巧。

8. 原文地图

主题原书章原文位置
思维链的定义与例子Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:19(搜「step-by-step manner」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:21(搜「impact of inflation on small businesses」)
自洽的定义与例子Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:15(搜「multiple independent responses」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:17(搜「three different approaches to the calculation」)
先造知识再答题Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:35(搜「generate background context」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:39(搜「Based on the provided information」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:47(搜「Review generated knowledge for completeness」)
拆成多步Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:149(搜「smaller, more manageable stages」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:152(搜「key elements of an effective social media strategy」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:153(搜「measure the success of each element」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:161(搜「user intervention between stages」)
多步的错误传播风险Chapter 7: Common Pitfalls and Things to Keep in Mindtext/08-ch07-chapter-7-common-pitfalls-and-things-to-keep-in-.txt:116(搜「errors can propagate」)
思维树Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:187(搜「explore multiple possibilities」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:197(搜「revisit previous branches」)
自我反思Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:231(搜「analyze its own responses」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:233(搜「review and suggest areas for further elaboration」)
对照式提问Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:249(搜「differences and similarities」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:251(搜「cloud storage versus on-premises」)

Footnotes

  1. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 19 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:19,搜「step-by-step manner」)与第 21 段那个通货膨胀的例子(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:21,搜「impact of inflation on small businesses」)。 2

  2. 补充(不在书里):来源:《Large Language Models are Zero-Shot Reasoners》,Kojima 等,2022 年 5 月 https://arxiv.org/abs/2205.11916(查阅于 2026-08-25)。在 text-davinci-002 上,GSM8K 从 10.4% 到 40.7%,MultiArith 从 17.7% 到 78.7%。这种只加一句话、不给例子的写法,通常叫「零样本思维链」。

  3. 补充(不在书里):来源:《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,Wei 等,2022 年 1 月 https://arxiv.org/abs/2201.11903(查阅于 2026-08-25)。论文用一个 5400 亿参数的模型、八道带解题过程的例子,在 GSM8K 上刷新了当时的最好成绩。论文还指出这种能力要在模型足够大之后才出现。

  4. 补充(不在书里):来源:《Self-Consistency Improves Chain of Thought Reasoning in Language Models》,Wang 等,2022 年 3 月 https://arxiv.org/abs/2203.11171(查阅于 2026-08-25)。论文在五个基准上报告的提升幅度从 +3.9%(ARC-challenge)到 +17.9%(GSM8K,小学数学应用题)不等,另外三个是 SVAMP +11.0%、AQuA +12.2%、StrategyQA +6.4%。做法是把「每步都挑最高分」换成「多采样几条不同的推理路径,再对最终答案做多数表决」。

  5. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 15 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:15,搜「multiple independent responses」)。原文的定义里确实有 independent(独立)这个词。

  6. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 17 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:17,搜「three different approaches to the calculation」)。

  7. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 35 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:35,搜「generate background context」)。书给这一节的标题是「Generated Knowledge Prompting」,但没有给出处

  8. 补充(不在书里):来源:《Generated Knowledge Prompting for Commonsense Reasoning》,Jiacheng Liu 等,2021 年 10 月 https://arxiv.org/abs/2110.08387(查阅于 2026-08-25)。论文摘要把做法概括为「先从一个语言模型生成知识,再在回答问题时把这些知识作为额外输入提供进去」。

  9. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 39 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:39,搜「Based on the provided information」)。

  10. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 47 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:47,搜「Review generated knowledge for completeness」)。

  11. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 149 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:149,搜「smaller, more manageable stages」)。

  12. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 152 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:152,搜「key elements of an effective social media strategy」)与第 153 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:153,搜「measure the success of each element」)。书把这两句分别标成 Stage 1 和 Stage 2,它给的例子只有这两步,没有第三步。

  13. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 161 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:161,搜「user intervention between stages」)。

  14. 出处:「Chapter 7: Common Pitfalls and Things to Keep in Mind」第 116 段(text/08-ch07-chapter-7-common-pitfalls-and-things-to-keep-in-.txt:116,搜「errors can propagate」)。原文的建议是「不要在没有验证的情况下把复杂提示词串起来」(text/08-ch07-chapter-7-common-pitfalls-and-things-to-keep-in-.txt:122,搜「without verification」)。注意这条警告和第 3 章推荐拆成多步是同一本书里的两处,作者没有把它们对上。

  15. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 187 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:187,搜「explore multiple possibilities」)。

  16. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 197 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:197,搜「revisit previous branches」)。

  17. 补充(不在书里):来源:《Tree of Thoughts: Deliberate Problem Solving with Large Language Models》,Yao 等,2023 年 5 月 https://arxiv.org/abs/2305.10601(查阅于 2026-08-25)。在 Game of 24 这个凑 24 点的任务上,GPT-4 用思维链的成功率是 4%,用思维树是 74%。

  18. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 189 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:189,搜「multiple expansion strategies for a small business」)。

  19. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 231 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:231,搜「analyze its own responses」)。

  20. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 233 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:233,搜「review and suggest areas for further elaboration」)。

  21. 补充(不在书里):来源:《Large Language Models Cannot Self-Correct Reasoning Yet》,Huang 等,2023 年 10 月 https://arxiv.org/abs/2310.01798(查阅于 2026-08-25)。摘要的原话是,模型「在没有外部反馈的情况下很难自我纠正,有时候自我纠正之后表现甚至变差」。

  22. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 249 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:249,搜「differences and similarities」)。

  23. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 251 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:251,搜「cloud storage versus on-premises」)。

  24. 补充(不在书里):来源:OpenAI 官方文档《Reasoning best practices》 https://developers.openai.com/api/docs/guides/reasoning-best-practices(查阅于 2026-08-25)。原文:「避免思维链式的提示词:既然这些模型在内部就完成了推理,再让它们『一步一步想』或『解释你的推理过程』是多余的。」