跳到主要内容

不靠手写 — 让机器来写提示词

这一章讲三件事: 手写提示词的天花板在哪;把「自动优化」拆开是哪三个零件; 以及书里那五种带缩写的「自动化技巧」里,哪些是真的、哪些名不副实。 这一章是全书最能改变工作方式的一章—— 因为它把提示工程从「手艺」变成「能一口气跑几十遍、拿分数说话的事」。

1. 先看现象:你改了二十版,却说不清哪版最好

你为一个任务改了二十版提示词。今天用的是第 17 版,因为你觉得它最好。

现在回答三个问题:

  • 第 17 版比第 12 版好多少?好 5% 还是 50%?
  • 你是拿几个例子试出来的?三个?那第四个例子会不会翻车?
  • 明天换个模型,第 17 版还是最好的那版吗?

三个问题你大概都答不上来。 这不是你不够认真, 这是手写这条路本身的天花板:人一次只能记住几个例子的手感,而手感不是数字。

自动优化要解决的就是这一件事。

2. 顶层全景:自动优化必须有的三个零件

这是本章的骨架,书里完全没有。 任何一套「让机器写提示词」的东西, 拆开一定是这三样,少一个都转不起来:

┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ ① 候选生成器 │ ───► │ ② 打分器 │ ───► │ ③ 搜索策略 │
│ 造出一批不同 │ │ 给每条候选 │ │ 根据分数决定 │
│ 写法的提示词 │ │ 打一个分 │ │ 下一批怎么造 │
└──────────────┘ └──────────────┘ └──────────────┘
▲ │
└────────────────────────────────────────────────┘

图说:三个零件转成一个圈。造一批、打分、根据分数造下一批、再打分……
转几十轮之后,留下分最高的那条。

这三个零件里,②是绝对前提,而且它是全章唯一的难点。

为什么②才是难点

①只要一句话:让模型帮你换十种写法。 ③只要排序:照分数排,留高分的,在高分附近再变一变。

难的是②:你凭什么给一条提示词打分?

打分要有两样东西:

你需要长什么样从哪来
一批题30 到 200 个真实的输入从你的实际使用记录里捞
一把尺子怎么算这条输出算对见下

尺子分三档,能用上面的就别用下面的:

尺子长什么样什么时候能用
对答案标准答案存着,一字不差才算对分类、抽字段、翻译成固定格式
用程序判跑一下、验一下格式、查一下有没有该出现的词生成代码、生成 JSON、要求包含某些要点
让模型判拿另一次模型调用给输出打分写作、总结这类没有标准答案的任务

这三档怎么建、怎么防止第三档自己也不准,是第 07 章整章的内容。

判断(我们的,不是书里的): 这本书讲了五种「自动优化」的技巧, 却一次都没有提到它们共同的那个前提。

打分器——能给一条提示词打出一个分数的那套东西,也就是上面的零件②—— 就是那个前提。

漏掉它是致命的:没有②,①和③都是空转—— 你造出一百条候选,然后呢?还是靠你一条条看。 这时候你不是自动化了,你只是把手写二十版变成了手读一百版,更累。

如果错,会错在: 如果某个任务上「哪条更好」人一眼就能看出来、 而且样本很少(比如只为一次汇报调一句话),那不建打分器是对的取舍。 判据是:这条提示词要跑多少次? 跑几十次以上,建打分器就划算。

「打分器」这个叫法的来路要交代清楚:它是我们起的,不是通行术语。 论文里说的是评分函数(英文 score function)—— 3.2 那篇 APE 的摘要原话就是「最大化一个选定的 score function」。 两个说的是同一件事:一个能把输出变成分数的东西。 你拿「打分器」三个字去搜是搜不到的;要和别人讨论,就用「评分函数」。

3. 核心原理:从最省事到最重

3.1 最省事的一档:让模型帮你改提示词

书把这一条叫「元提示」,定义是:帮助用户改进自己写提示词能力的提示词1。 例子是:你写了「写一篇关于气候变化的文章」, 元提示问你「你怎么把这个请求说得更具体一点?」,你于是改成一个 500 字的具体题目2

这一节的建议有用,但书给的定义偏窄了。

书说的是「训练人」,而这个词在实践中通常指的是另一件事:

元提示,通常指的是「用提示词去生成或改写提示词」—— 也就是把提示词本身当成模型的产出物。 「元」这个字在中文里指的就是「关于它自己的那一层」: 元提示 = 关于提示词的提示词。

最实用的用法,三句话就能上手:

下面是我的提示词和它的三个失败例子。 请指出提示词里缺了哪些信息,并给出三个改进版本,每版只改一处,并说明改了哪一处。

【提示词】…… 【失败例子】……

注意最后半句「每版只改一处,并说明改了哪一处」—— 这正是第 02 章那条「一次只改一个部件」的规矩,你把规矩写进提示词,机器就替你守着。

这一档的位置很清楚:它只是第 2 节那个圈里的零件①。 打分还是你自己做。 但它已经能省掉一大半时间了,而且今天就能用。

3.2 让模型一口气造几十条候选,再挑分最高的

这是把零件①自动化到底:不是让它给你三个建议,而是一口气造几十条,然后按分数挑。

这套做法有正式的名字和论文,书没提:

补充(不在书里): 2022 年 11 月一篇论文叫《大语言模型是人类水平的提示工程师》, 提出的方法叫 APE(Automatic Prompt Engineer,自动提示工程师)。

做法是:把「指令」当成一个待优化的程序,用一个模型去生成一堆候选指令, 再用另一个模型评估效果。 结果是,在 24 个任务里的 19 个上,机器写的指令达到或超过了人写的3

一批题 + 答案


让模型看着「输入→输出」的例子,反推「什么样的指令会导致这种输出」
│ 造出 50 条候选指令

每条候选拿那批题跑一遍,算分


留下分最高的几条,在它们附近再造一批(换个说法、加一句、删一句)

▼ 转几轮
最终留一条

图说:这就是第 2 节那个圈的完整实现。整条流程里没有一处需要人来判断好坏 ——
因为「一批题 + 答案」在第一步就把尺子交出去了。

这个圈里跑的到底是什么,拿 3.1 那个任务当场走一遍。

任务: 给一条提示词和它的失败例子,让模型指出这条提示词缺了什么。 题集: 30 道这样的题,每道题的标准答案是「这条提示词缺的那几项」。

第一轮造出 50 条候选,挑其中三条摊开看:

候选它的原文那 30 道题上的得分
A「指出下面提示词缺了哪些信息。」0.58
B「你是提示词审阅者,逐条列出下面这条提示词没有交代的东西。」0.73
C「读完下面的提示词和失败例子,列出缺失项。」0.61

B 比 A 高 0.15,而 A 和 C 之间只差 0.03。 所以下一轮不再乱造,只在 B 附近找。

下一轮,在 B 身上只改一处:

候选它的原文得分
B′「你是提示词审阅者,逐条列出下面这条提示词没有交代的东西,并按重要性排序。」0.79

0.79 比 B 的 0.73 又高 0.06。 圈到这里转了两轮, 而从头到尾没有一个人读过任何一条候选的原文——人读的只有那 30 道题上的分。

(0.58 / 0.73 / 0.61 / 0.79 这四个分数是为演示编的,不是真实数值。 论文报告的是「24 个任务里的 19 个上机器写的达到或超过人写的」, 没有给出这样的逐条得分。)

3.3 进化式搜索:书里那一套借生物学的算法

先说名字。算法——就是一套固定的计算步骤:先做什么、再做什么,一步不含糊。 这一节讲的算法,步骤是从生物学借来的。

书管这一族叫「遗传算法」:模仿生物繁衍——留下好的、随机改一改、再互相拼一拼。

书对这一条的描述基本是对的: 生成多个变体、评估效果,通过选择、变异、交叉反复改进4

这里三个词要当场解释,它们借自生物学:

在提示词这里是什么意思
选择分高的留下,分低的淘汰
变异拿一条留下来的,随机改一处(换个词、加一句)
交叉拿两条留下来的,各取一半拼成新的一条

接着上一节那三条候选,当场把三个词各演示一遍:

选择: B(0.73)和 C(0.61)留下,A(0.58)淘汰

变异: B 「你是提示词审阅者,逐条列出下面这条提示词没有交代的东西。」
↓ 只加一句
B′ 「……没有交代的东西,并按重要性排序。」 → 0.79

交叉: 取 B 的前半:「你是提示词审阅者,」
+ 取 C 的后半:「读完下面的提示词和失败例子,列出缺失项。」

BC 「你是提示词审阅者。读完下面的提示词和失败例子,列出缺失项。」 → 0.71

图说:变异是在一条身上改一处,交叉是把两条各取一半拼起来。
这一轮拼出来的 BC 得 0.71,不如变异出来的 B′ 的 0.79 ——
所以下一轮留 B′,BC 被淘汰。
(这些分数是为演示编的,不是真实数值。)

为什么用这套办法而不是随便乱试: 因为提示词的写法多到试不完。 这套办法的价值是「在已经不错的那几条附近找」,而不是从头乱猜。

证据(书没给): 2023 年 9 月一篇叫 EvoPrompt 的工作正是这么做的—— 用模型来执行变异和交叉,拿一批题打分做选择。它在 31 个数据集上做了测试, 在其中一组难题上比人写的提示词高出最多 25%5

书对这一条的建议清单里有一句很实在的:把这个过程自动化,才能规模化6这句话是对的,但书没说自动化的前提还是那个打分器。

3.4 让模型自己当那个「找最优」的角色

这是比上一档更进一步的做法,书完全没有。

补充(不在书里): 2023 年 9 月的一篇论文提出 OPRO(Optimization by PROmpting)。 做法很妙:把「历史上试过的提示词 + 它们各自的得分」写成一段文字喂给模型, 然后让模型看着这张成绩单,自己提出下一条该试什么。 论文报告,这样找出来的提示词在小学数学题上比人写的高出最多 8%7

这一档的思路值得单独记一下:它把「搜索策略」这个零件也交给了模型。 你不需要设计变异规则,你只要把成绩单给它看。

3.5 还有一条更彻底的路:别再手写提示词字符串

这一条书里一个字都没有,但它是 2024 年之后真正在改变工程做法的东西。

补充(不在书里): 2023 年 10 月的 DSPy 提出的主张是: 不要再把提示词当成一长串写死在程序里的文字。

论文批评的对象叫提示词模板——就是那种靠反复试错试出来、 然后原样写死在代码里的长字符串; DSPy 把它们换成可以由工具「编译」出来、并且自动优化的模块8

说白了:

老做法: 你写一大段提示词字符串 → 效果不好 → 你手改这段字符串
新做法: 你只声明「输入是什么、输出是什么、中间几步」
└─ 提示词的具体措辞和例子,由工具照着你的打分器自动生成

图说:提示词从「你写的代码」变成了「工具编译出来的产物」。
你维护的是意图,不是措辞。

判断(我们的,不是书里的): 这一条是本章五种做法里对工程影响最大的, 而它恰好是书完全没有的。 它的门槛也最高:你必须先有打分器,而且要愿意让提示词变成不可读的中间产物。 对只在对话框里打字的人,这一条用不上;对要长期维护一个 AI 功能的团队, 这一条早晚要面对。 如果错,会错在: 如果模型强到「随便写写就够好」,那这一整套编译流程就是过度工程, 代价是团队多养了一套自己不需要的基础设施。

3.6 书里那两个查不到出处的名字

书还列了两种「技巧」,我们没能找到它们作为通行术语的出处。分开说:

第一个:QTM(Query Transformation Modules,查询转换模块)。 书说它用来把含糊的提示词改写得更清楚、更具体9, 例子是把「跟我讲讲气候变化」改成「给出一份关于气候变化的成因、影响与对策的完整报告」10

情况
这件事真不真真的,而且很常用
QTM 这个缩写不是通行术语,我们查不到公认出处,书也没给
通行的叫法在检索场景里叫查询改写(query rewriting / query transformation)
它真正的位置它属于第 04 章讲的 RAG 的一环:改的是「拿去检索的那句话」,不是「给模型的那条指令」

补充(不在书里): 这一族做法在检索场景里有一批固定的名字: 把原问题重写一遍再检索、把一个问题拆成几个子问题分别检索、 先退一步问一个更宽的问题再检索11

书那个例子有个更根本的问题:它其实就是第 02 章那条「把话说清楚」。 「跟我讲讲气候变化」→「给出成因、影响与对策的报告」, 动的是①动作和③格式两个部件,和「模块」「自动改写」没有关系。

第二个用到了一个新词,先把它说清楚:

分类器:一个专门把输入归到几个类别里的小模型。 给它一段文字,它回答「这属于哪一类」——比如「合规」还是「不合规」、「好评」还是「差评」。

书里这一条叫「分类器引导的提示词进化」,说的做法是 用 AI 分类器来评估和改进提示词,确保它们满足准确性、可读性或合规要求12

这一条我们的判断不一样:名字虽然也查不到公认出处,但它描述的东西是对的、而且重要—— 它讲的正是第 2 节那个零件②:打分器。

判断(我们的,不是书里的): 书把打分器这件事藏在一个自造的技巧名底下, 当成二十种并列技巧里的一种讲了六行。 而它其实是整个自动化的前提,应该排在所有技巧前面。 我们把它提到了第 2 节,就是这个原因。 如果错,会错在: 如果作者的本意确实只是「用一个分类模型做合规检查」 这样一个窄用途,那我们的重新定位就放大了他没有的意思—— 但从原文「评估并改进提示词」的措辞看,它就是打分器。

3.7 顺手一提:用提示词造训练数据

书还有一节,讲用提示词生成合成数据(机器造出来、用于训练别的模型的假数据)—— 给一个输入造出多种说法的变体13, 例子是把「今天天气不错」变成五种不同的说法14

这一节和「优化提示词」不是一回事,它是另一件事:给别的模型造训练材料。

  • 它的用处是真的: 你手上真实样本太少的时候,拿模型一口气造出一大批;
  • 它的坑书也提了一半:保证造出来的数据仍然贴合实际、也别造出偏斜的样本15;
  • 书没提的那一半: 造出来的东西再多,也超不出原模型见过的范围。 而如果一代一代这么传下去,损伤还会累积。

补充(不在书里): 2023 年 5 月一篇论文专门做了这件事—— 拿上一代模型造出来的数据去训下一代,如此反复。结果是: 原始数据里那条「尾巴」(少见的说法、少见的情况)会一代代消失,而且这种损伤不可逆。 论文给这个现象起的名字叫模型崩溃16

一句话记住:合成数据补的是「量」,补不了「原来就没有的那部分」。 你手上真实样本少的时候,拿它补一批很划算; 但别让造出来的数据变成下一轮训练的唯一口粮。

4. 核对一下书对「未来」的三条预测

书在讲未来趋势那一章列了三样「即将到来」的东西17这本书出版于 2025 年 1 月,而这三样在那之前都已经有了。逐条核:

书的预测实际情况
RLPO:用强化学习(不告诉它正确答案,只告诉它这次做得好不好,让它自己试出来)自动优化提示词2022 年 5 月就有了,叫 RLPrompt。而且它有一个书没提到的惊人发现:优化出来的提示词往往根本不成句子、像一串乱码,人读不懂——但换个模型照样管用18
元学习与自适应提示:让 AI 通过分析成功案例学会写更好的提示词这正是 3.2 那个 APE,2022 年 11 月的工作
跨领域迁移:一个领域的提示词调一调用到另一个领域这本来就是第 04 章那件事:提示词不改模型,所以换领域本来就只是改文字

上面那个「强化学习」,就是训小狗那个路子:做对了给零食,做错了不给, 让它自己试出该怎么做。

判断(我们的,不是书里的): RLPrompt 那个「乱码提示词也管用」的发现, 是这一整章里最值得记住的一条,而它恰好在书里完全没有出现。 它的意义在于:「提示词要写得像人话」这个前提,在纯粹追求分数的时候是不成立的。 这也解释了为什么 3.5 那条路(让工具去编译提示词)是合理的—— 人可读和效果好,本来就是两个目标。 如果错,会错在: 如果那类乱码提示词在新一代模型上不再有效 (模型被训得更「听人话」了),那这条发现就只属于那一代模型, 「人可读」和「效果好」重新合一。

5. 作者的判断与证据

说法性质
遗传算法式的优化,而且描述准确;零引用
元提示有用,但定义偏窄(书说的是「教人」,通行含义是「用提示词生成提示词」)
QTM做法真、名字查不到公认出处;而且位置错了(属于检索,不属于写指令)
分类器引导的进化描述对,但被埋没了——它是整个自动化的前提
用提示词造数据,但漏了「一代代自己喂自己会崩」这一半
RLPO / 元学习 / 迁移当成未来三条都不是未来,书出版时都已存在

全章仍然是零引用。

6. 边界与局限

缺什么说明
打分器五种技巧一次都没提「你得先能打分」——这是本章最大的洞
成本自动优化要跑几百上千次模型。书一个字没提这要花多少钱
过度拟合在 30 道题上调到最优的提示词,换一批题可能就不行了。要留一批「调的时候不看」的题来验
DSPy 这一路完全没有
模型换代就要重调提示词是跟着模型的。换个模型,你调了三个月的那条可能就不是最优了

最后一条要展开,因为它决定了你该不该做这件事:

自动优化的产物有保质期。 你花两周把提示词调到最优, 三个月后模型升级,这条提示词可能既不是最好的、也不再是必要的 (新模型也许随便写写就够好)。 所以真正该沉淀下来的不是那条提示词,是那套打分器和那批题—— 它们不会因为换模型而作废,反而正好用来判断新模型值不值得换。

7. 可带走的

  1. 手写的天花板是「你说不清哪版更好」——不是不够认真,是人记不住手感;
  2. 自动优化拆开只有三个零件:造候选、打分、按分数搜索;
  3. 打分器是绝对前提,没有它,自动化只会让你从手写二十版变成手读一百版;
  4. 打分的尺子三档:对答案 > 用程序判 > 让模型判,能用上面的别用下面的;
  5. 最省事的一档今天就能用:把提示词和失败例子贴给模型,让它每版只改一处;
  6. APE:让模型造几十条候选再按分挑,论文里 24 个任务中有 19 个达到或超过人类;
  7. 进化式搜索 = 选择 + 变异 + 交叉,在已经不错的那几条附近找,不是乱猜;
  8. OPRO:把成绩单给模型看,让它提下一条该试什么;
  9. DSPy 那条路是别再手写字符串,让工具照着打分器编译出提示词——门槛最高,影响最大;
  10. 有一个反常识的发现:纯追求分数优化出来的提示词常常是人读不懂的乱码,却照样管用;
  11. 书里的 QTM 名字查不到出处,那件事真实存在,通行叫法是「查询改写」,而且属于检索那一环;
  12. 该沉淀下来的不是提示词,是打分器和那批题——提示词会随模型作废,它们不会。

8. 原文地图

主题原书章原文位置
遗传算法式优化Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:93(搜「selection, mutation, and crossover」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:105(搜「Automate the optimization process」)
查询转换模块Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:111(搜「Query transformation modules」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:115(搜「causes, effects, and solutions to climate change」)
分类器引导的进化Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:131(搜「AI classifiers to evaluate and refine prompts」)
元提示Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:329(搜「refining their own prompt-writing skills」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:333(搜「make this request more specific」)
用提示词造数据Chapter 3 Advanced Techniques for Prompt Generationtext/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:304(搜「generating synthetic data」) · text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:325(搜「prevent dataset biases」)
三条「未来」预测Chapter 8: Future Trends in Prompt Engineeringtext/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:15(搜「Reinforcement Learning for Prompt Optimization」) · text/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:23(搜「learn how to create better prompts」) · text/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:29(搜「fine-tuned and adapted for use in another domain」)
自动化提示词设计与评估Chapter 8: Future Trends in Prompt Engineeringtext/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:75(搜「automatically suggest optimized prompts」) · text/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:81(搜「automate the assessment of prompt effectiveness」)

Footnotes

  1. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 329 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:329,搜「refining their own prompt-writing skills」)。

  2. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 333 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:333,搜「make this request more specific」)。

  3. 补充(不在书里):来源:《Large Language Models Are Human-Level Prompt Engineers》,Zhou 等,2022 年 11 月 https://arxiv.org/abs/2211.01910(查阅于 2026-08-25)。论文把指令当成「程序」,在候选指令池里搜索;在 24 个自然语言处理任务里的 19 个上,自动生成的指令达到或超过人类标注者写的指令。

  4. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 93 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:93,搜「selection, mutation, and crossover」)。

  5. 补充(不在书里):来源:《EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers》,Guo 等,2023 年 9 月 https://arxiv.org/abs/2309.08532(查阅于 2026-08-25)。在 31 个数据集上测试,在 BIG-Bench Hard 那组难题上比人写的提示词高出最多 25%。

  6. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 105 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:105,搜「Automate the optimization process」)。同一份清单里还有一句「用相关性、清晰度、参与度这类评分指标来评估效果」(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:101,搜「scoring metrics」)——这是全书离「打分器」最近的一句话,但它只是一行建议,没有展开。

  7. 补充(不在书里):来源:《Large Language Models as Optimizers》(即 OPRO),Yang 等,2023 年 9 月 https://arxiv.org/abs/2309.03409(查阅于 2026-08-25)。摘要原话是,OPRO 优化出来的最佳提示词「在 GSM8K 上比人工设计的提示词高出最多 8%」。

  8. 补充(不在书里):来源:《DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines》,Khattab 等,2023 年 10 月 https://arxiv.org/abs/2310.03714(查阅于 2026-08-25)。论文批评的对象是「硬编码的提示词模板,也就是靠反复试错发现的长字符串」。

  9. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 111 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:111,搜「Query transformation modules」)。

  10. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 115 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:115,搜「causes, effects, and solutions to climate change」)。

  11. 补充(不在书里):来源:LangChain 官方博客《Query Transformations》,LangChain 团队,2023 年 10 月 24 日 https://www.langchain.com/blog/query-transformations(查阅于 2026-08-25)。文中列出的做法包括:重写后再检索、退一步问一个更宽的问题、把多轮对话压成一句独立查询、把一个问题拆成多个查询分别检索。文章指出查询扩展在搜索领域早就有,「新的是可以用大语言模型来做这件事」。

  12. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 131 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:131,搜「AI classifiers to evaluate and refine prompts」)。

  13. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 304 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:304,搜「generating synthetic data」)。

  14. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 308 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:308,搜「Generate five variations of this sentence」)。

  15. 出处:「Chapter 3 Advanced Techniques for Prompt Generation」第 325 段(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:325,搜「prevent dataset biases」)。

  16. 补充(不在书里):来源:《The Curse of Recursion: Training on Generated Data Makes Models Forget》,Shumailov 等,2023 年 5 月 https://arxiv.org/abs/2305.17493(查阅于 2026-08-25)。论文把这个现象命名为「模型崩溃」(Model Collapse):用别的模型生成的内容去训练,会造成不可逆的缺陷,原始内容分布的尾部会消失;作者由此推论,人类自己写出来的真实数据会越来越值钱。注意论文测的是「一代代递归地这么做」,不是「用一次合成数据」——拿一批合成数据补样本,不等于会崩溃。

  17. 出处:「Chapter 8: Future Trends in Prompt Engineering」第 15 段(text/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:15,搜「Reinforcement Learning for Prompt Optimization」)、第 23 段(text/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:23,搜「learn how to create better prompts」)与第 29 段(text/09-ch08-chapter-8-future-trends-in-prompt-engineering.txt:29,搜「fine-tuned and adapted for use in another domain」)。

  18. 补充(不在书里):来源:《RLPrompt: Optimizing Discrete Text Prompts with Reinforcement Learning》,Deng 等,2022 年 5 月 https://arxiv.org/abs/2205.12548(查阅于 2026-08-25)。摘要原话是「优化出来的提示词常常是不合语法的乱码文字」,而这些乱码在换用别的模型时仍能保持相当的效果。