跳到主要内容

你打进去的那段话 — 它到底被当成了什么

这一章讲三件事: 为什么同一件事换个说法结果差这么多; 你打进去的那段话在机器里被拆成了什么;以及为什么这台机器 只会「猜下一个字」,却看起来像在听你的话。 后面七章讲的所有技巧,都是在这一章的机制上做文章——这一章没读通,后面全是招式没有道理。 不需要任何基础。

1. 先看现象:同一件事,两种问法,结果差得离谱

你大概试过这种事:让 AI 帮你写点什么,它给你一堆正确的废话; 换个说法再问一遍,忽然就像样了。

书里给的对照特别干净,值得原样看一眼1:

你打的字你会拿到什么
「跟我讲讲社交媒体。」一段谁都能写、对谁都没用的科普
「列出做营销最值得用的 5 个社交媒体平台,各写清楚它的强项和用户画像。」一张你今天下午就能拿去用的表

两次问的是同一件事,差别只在第二句说清楚了三样东西:要什么(列表)、要几个(5 个)、 要哪个角度(营销)。

书对这个差别的解释是:第二条提供了「清晰度、结构和明确的目标」2。 这句话是对的,但它只说了「怎么样」,没说「为什么这样就行」。 为什么,是这一章要补的。

先把两个名字定下来

这两个词全书会一直用,现在一次说清:

提示词,就是你打进对话框、交给 AI 的那段文字。英文叫 prompt。 书给的定义是「给 AI 模型的一组指令,它会影响模型的回答」3

提示工程,就是「怎么写这段文字才好使」这门手艺。英文叫 prompt engineering。 书说它「既是艺术也是科学」,核心是用对的方式问对的问题4

注意「工程」这个词在这里没有多高深的意思——它不是编程,不需要写代码。 书特意强调过:这件事让不懂技术的人也能用上 AI 的能力,不需要深厚的技术背景5

书在前言里给自己定的位置也在这儿:一份从基础原则、实用技巧,一直讲到进阶策略与未来趋势的完整指南, 读者不限于程序员——写内容的、做业务的、做研究的都算6

这句自述交代了它的野心,也顺带交代了它的毛病: 十章要从零基础一路铺到「未来趋势」,每一样就只能薄薄一层。 这也是我们这份拆解要补的地方——它给名字,我们补机制和出处。

2. 顶层全景:你打的字到它吐的字,中间发生了什么

在解释任何技巧之前,先把这条流水线摆出来。后面所有招式,都是在这条线上的某一环动手。

你打的那段文字

├─① 切成小块(它不认识「字」,只认识自己那套切法)

├─② 整段一起看一遍,算出「下一小块最可能是什么」的一张可能性清单

├─③ 从清单里挑一块,接到文末

└─④ 把「你的字 + 它刚接上的那块」当成新的输入,回到 ① 再来一遍
…一直循环到它算出「该停了」为止

图说:它没有「先理解你的意思,再组织语言回答」这个阶段。
整个过程就是同一个动作重复几百上千遍:看着现有文字,猜下一块。

这条线上跑一遍具体长什么样,现在就走一遍。 下面这句话会一路用到本章结束,每一节都在它身上往前走一步。

拿「AI is amazing.」这一句。它先被切成四小块:AI / is / amazing / . (为什么这么切、为什么连空格都被切进去,3.1 讲。)

然后是最关键的②: 它把这四小块整个读一遍,算出下一小块的一张可能性清单。 那张清单长这样:

下一小块的候选 可能性
─────────────────────────────
" It" 0.31
" The" 0.18
" Everyone" 0.04
" Artificial" 0.02
…还有几万个更小的 …

图说:这张清单才是它每一步真正的产物。
它不是「想好了要说什么」,而是「算出了几万个候选各自有多可能」。
(这几个数是为演示编的,不是真实数值。)

③ 从这张清单里挑一块接上去——比如挑中 " It", 文字就变成「AI is amazing. It」,从 4 小块变成 5 小块; ④ 拿这 5 小块从头再走一遍 ①②③,算出第 6 块。 一直循环到它算出「该停了」。

书对这一步的说法很直白:大语言模型「本质上是高级的文本预测引擎」, 它们不以人类的方式「思考」,只是根据海量数据里学到的规律来预测文字7

这句话是全书的地基,也是最容易被读过就忘的一句。 把它记住, 后面「为什么它会一本正经地胡说」「为什么给它例子就管用」全都能自己推出来。

那「大语言模型」到底是什么

上面我用了这个词,现在补上。

大语言模型(英文 large language model)——就是上面那台 「看着现有文字猜下一块」的机器,因为它是拿海量文字训练出来的、个头又很大,所以叫这个名字。 它常被缩写成 LLM(下文两种叫法混用,指的是同一样东西)。 ChatGPT、Claude、Gemini 背后跑的都是它。

它的底子是深度学习(这一行最主流的一大类方法:靠很多层结构, 自己从数据里摸出规律,不用人一条条去写规则)。

书给的正式说法是:它是「用海量文本训练出来的深度学习模型」, 用来识别规律、理解上下文(就是前后文——它算下一块时会回头看的那些字)、 生成看起来像人写的文字8

同一句话里,书还提到它的骨架是一种叫 Transformer 的结构。 这个词你现在不需要懂细节,只需要知道两件事: 它是 2017 年那篇论文提出的一种网络结构,今天几乎所有大语言模型都用它; 它最关键的本事是能一次把整段文字通盘看一遍,而不是从左到右一个字一个字读9

3. 核心原理

3.1 它不认识「字」,只认识「标记」

这一节解决一个具体的困惑:为什么它有时候数不清一个词有几个字母。

书里说,模型会把文字切成更小的单位,叫作标记10。 它的英文是 token——就是模型切分文字的最小单位,你在别处看到 token 说的都是它:

"AI is amazing." → ["AI", " is", " amazing", "."]

图说:书给的原例。注意 " is" 前面那个空格也被切进去了——
标记的边界不按你的直觉走,是按它自己那套切法走的。

标记就是模型切分文字的最小单位。 它可能是一个完整的词, 也可能只是词的一小截(比如英文里的 pre- 或 -ing), 也可能是一个汉字或半个汉字。

这件事有三个你会碰到的后果:

后果为什么
让它数「strawberry 里有几个 r」经常数错它看到的不是一串字母,是几个已经切好的整块
你被计费的单位是标记,不是字数长度的官方口径就是标记数
中文一般比同样意思的英文更费标记切法是按训练时的统计定的,对英文更友好

3.2 「猜下一块」是怎么猜的:三步

书把这件事拆成三步11,我按它的顺序讲,但每一步都补上书省掉的那句「所以呢」:

第一步,预训练:拿海量文字(书、网页、论文)让它反复做同一道填空题—— 遮住下一块,让它猜,猜错了就把内部那些可调的数往「错得少一点」的方向挪一挪。

那些可调的数,正式名字叫参数。 今天的大模型动辄几千亿个参数——而 2019 年那一代还只有十几亿个,几年之间翻了一百多倍; 更要紧的是,它每吐出一小块,这几千亿个数都要全部参与一遍计算12, 这就是它慢、它贵的全部原因。 参数不是知识条目,是「规律」被压进去之后的样子。

书在这里点了一句很重要、但一带而过的话:模型学的是词与词之间的关系, 而不是把事实存起来13

这句话解释了半本书的现象。 它没有一张「事实清单」可查, 所以它说出来的每一句话,本质上都是「按规律接下去最像的那句」, 而不是「从记录里查出来的那句」。

第二步,微调:在已经训好的模型上,拿一些更专门的数据再训一遍, 让它偏向某个领域或某种行为。

为什么需要这一步:预训练完的模型只会接着往下写,不会听话。 所以要再用一批「一问一答」的数据训一轮(一轮就是把这批数据完整过一遍), 把它调成「会回答问题」的样子。 书的说法是「预训练学通用数据,微调适配特定领域」11

第三步,你用它的时候:给它输入,它按第 2 节那个循环吐出回答。

「跑一遍模型」拿到的东西,就是第 2 节那张清单。 你把「AI is amazing.」发过去,它跑一遍,交出来的不是一个词, 而是「" It" 0.31、" The" 0.18、" Everyone" 0.04……」这样一整张表; 从这张表里挑哪一个,是下一步的事——由 3.4 那两个旋钮决定。

推理:这个词在这一行有两个意思,极容易撞车—— 一个指「让模型跑一遍」(书这一步用的英文 inference 就是它), 一个指「一步步想」。本文一律只用后一个意思,前一个一律说成「跑一遍模型」。

这三步之间有一条你必须记住的分界线:

预训练 + 微调 ← 花几千万美元、几个月,做完就冻住了
────────────────────────────────────────────
跑一遍模型 ← 你打一次字花的是几分钱、几秒钟,不改动模型里的任何一个数

图说:提示工程全部发生在下半截。你写的提示词改变的是「这一次它看到什么」,
永远改不了「它学过什么」。

这条线是提示工程的全部边界。

后面第 05 章讲的「让机器反复试、留下效果最好的那一版」、 第 04 章讲的「先去资料库里找出相关的几段再贴进提示词」, 都是在下半截想办法把更好的东西塞进那次输入里—— 没有一个能往上半截添知识。

3.3 它凭什么「记得」你前面说过的话

这一节回答:多轮对话(来回聊好几轮的那种对话)里,它怎么知道「那个」指的是什么。

书给的说法是:AI 靠一种叫注意力的内部机制,在长提示词和多轮对话里维持上下文14这话没错,但它回答的不是你真正会碰到的那个问题—— 你想知道的是「上一轮的话到底还在不在」,而这句话只告诉你「模型内部有个部件在管这事」。

真正的答案是一件书没讲、而你天天在碰的事:它其实没有「记性」。

每次你发一条新消息,程序做的事情是——把整段对话历史重新拼成一大段文字, 从头再喂给模型一次。 模型本身不保存任何东西,它每次都是从零开始读一遍。

第 1 轮 发过去的是: 「AI is amazing.」 4 小块
它答: 「It sure is! …」 比如 12 小块

第 2 轮 发过去的是: 「AI is amazing.」+「It sure is! …」
+「Which part?」 4 + 12 + 3 = 19 小块
它答: … 比如 20 小块

第 3 轮 发过去的是: 上面那 19 块 + 它刚才那 20 块 + 你这一句 40 小块以上

图说:所谓「它记得」,其实是「每次把前面的全部重念一遍」——
第 1 轮它读 4 小块,第 3 轮它要读 40 小块,十倍。
这就是为什么聊得越久越慢、越贵。
(12 和 20 这两个长度是为演示编的,不是真实数值。)

这段拼起来的文字有长度上限,叫上下文窗口:

上下文窗口 = 模型这一次最多能看多少标记(问题和回答加在一起)。 超过了,最前面的内容就会被砍掉——砍掉的部分它是真的看不见了。

书把这件事列在缺点里,原话是模型「在超出标记上限之后难以处理长距离的上下文依赖」15

判断(我们的,不是书里的): 「上下文窗口变大 = 长文档问题解决了」是个流行的误解。 2023 年斯坦福那篇《Lost in the Middle》测出来:同一份资料, 放在输入的开头或结尾,模型答得准;放在中间,准确率明显掉下去, 呈一条两头高中间低的曲线16所以真正的做法不是「把所有资料都塞进去」,而是「只塞该塞的,并且放在头尾」。 如果错,会错在: 如果后来的模型把这条位置偏好抹平了, 那「精挑资料」就只剩成本上的理由,不再有准确率上的理由。

3.4 你能拧的两个旋钮:温度和最大长度

书提了一句「用户可以调整 temperature(控制创造力)和 max tokens(回答长度)」17, 然后就没了。这句话里两个词都需要解释,而且第一个的说法还不太准。

温度(英文 temperature)——它管的就是「挑得多大胆」:

回想第 2 节——每一步它都算出一张「下一块可能是什么」的清单,每项带一个可能性大小。 温度决定它挑得多大胆: 温度低,它老老实实挑可能性最高的那块; 温度高,排名靠后的冷门选项也有机会被挑中。

拿第 2 节那张清单演示一遍最清楚(候选是 " It" 0.31、" The" 0.18、" Everyone" 0.04):

温度「AI is amazing.」后面接的是什么
0永远是 " It",跑一百遍一百遍都是它——因为 0.31 是这张清单上最高的那个
0.7多数时候仍是 " It",但 0.18 的 " The" 也常出来
1.2连 0.04 的 " Everyone" 都有不小机会被挑中,同一句话跑两遍很可能不一样

所以「控制创造力」这个说法是个方便的比方,准确的说法是「控制挑选时的随机程度」。 后文一律用后一种说法。

温度它怎么挑什么时候用
0 附近几乎总挑最高分要稳定、每次跑出来都一样的场合:抽字段(从一段话里把金额、日期这类信息挑出来)、分类、改格式
0.7–1.0大多挑高分,偶尔挑冷门写东西、想点子
更高冷门选项大量出头要花样,同时也更容易跑偏

这也顺带解释了一件让很多人以为是 bug 的事:同一句话问两遍,答案不一样。 那不是它记性不好,是随机性本来就在设计里。

最大标记数(英文 max tokens):

它是「这次回答最多能写多长」的硬上限,单位是标记。 它是截断,不是「写得简短一点」的指示——到了上限就当场断掉,可能断在半句话中间。

想让它写短,要在提示词里说「一句话答完」,而不是把这个数字调小。 这是新手最常踩的一个坑。

3.5 「它不理解」这句话,分寸在哪

书至少三次强调:模型**并不真正「理解」**语言,它靠的是统计规律而非真正的领悟18; 结论那一节写得更硬:「大语言模型依赖的是模式识别,不是真正的理解」19

这个提醒是对的,而且很重要——它是后面所有「别全信它」的根据。 但书把这句话用得有点过头,有一处需要修正:

书在讲常见误区时说,模型「基于模式,缺乏推理能力20

判断(我们的,不是书里的): 「缺乏推理能力」在 2025 年初这本书出版的时候 就已经站不住了。 同一个模型,你让它把中间步骤写出来再答,正确率会大幅提高—— 2022 年一篇讲「让它把步骤写出来」的论文里,一个模型在小学数学题上的正确率从 10.4% 跳到 40.7%, 改动只有在提示词里加一句「让我们一步一步想」21。 更别说 2024 年之后专门为多步思考训练的那一批模型。 准确的说法应该是:它没有独立于文字之外的思考过程, 它的「想」就发生在它写出来的字里面。 这个说法既保住了警惕,又没有否认事实, 而且它直接给出了第 03 章所有技巧的道理。 如果错,会错在: 如果哪天证明那些「一步步想」的输出只是表面文章、 和最终答案的正确性没有因果关系,那这条修正就要退回去。

4. 作者给了证据的和没给证据的

这本书几乎不给证据。 分开标一下,免得读者把两类混着信:

说法属于哪一类
模型是文本预测引擎、不真正理解有共识,业界通行说法,书没有引任何来源
切标记、预训练/微调/跑一遍模型这三步有共识,教科书内容
「训练遵循规模法则(说的是:数据越多、模型越大,表现越好)」22有说法,没出处——这是全书唯一一处像是要引文献的地方
用 GLUE、SuperGLUE、MMLU 这些基准来评测23属实,但书只报了名字,没说它们各测什么
「AI 缺乏推理能力」作者的判断,已经过时(见上一节)

关于规模法则那一条要补一句。 书说的「模型越大越好」是 2020 年的口径。 2022 年 DeepMind 的 Chinchilla 论文修正过:模型大小和训练数据量要一起配平, 当时的大模型普遍训练数据给少了24。这一点不影响你写提示词,但影响你怎么理解「更大 = 更好」。

关于那三个基准,补一句人话:

基准就是一套固定的考题,拿来给不同模型打分、好排名次。 GLUE 和 SuperGLUE 是早期的语言理解考卷(判断两句话是不是一个意思之类), MMLU 是一套横跨 57 个学科的选择题,从初中数学一直考到法律和医学它们只能测出「考试考得怎么样」, 测不出「拿去干活好不好用」——这个落差,第 07 章会展开。

5. 边界与局限

这一章对应的原书两章(第 1、2 章)是全书最薄的部分,有五个洞:

最大的那个洞是「系统提示词」——开发者单独写给模型的那段固定说明 (「你是什么、你能做什么、你绝不做什么」)。 书一个字没提,而它对模型的约束力比用户打的那句话强。

紧挨着的第二个洞:用程序接进去和在网页上打字不是一回事。 程序走的是 API(一个程序留给另一个程序调用的入口)。走 API 的时候, 系统提示词和用户那句话是分开填在两个格子里的,模型知道哪格是哪格; 你在网页上打字,只填得到其中一格。

其余几个:

书没讲的为什么要紧
上下文窗口不只是长度问题只说「超出上限有困难」,没说位置也会影响准确率(见 3.3)
「一个例子都不给」这种情况没有名字书在第 3 章讲了少样本(给它两三个例子照着做),却从没定义过它的对照面——零样本(一个例子都不给,直接问)

最后一个洞:书让你以为控制随机性只有温度一个旋钮。 还有一个同样常用的,管的是同一件事(挑下一块时有多大胆),只是拧法不同: 不调温度,而是把候选按可能性从高到低排队、凑够某个比例就不再往下看 (这个旋钮的名字叫 top-p,你翻任何一家 API 文档都会撞见它)。 不是大问题,但「只有温度一个旋钮」是错的印象。

还有一个时代印记:书把「多模态(不只是文字,图片、音频、视频也能当输入)AI」列为未来趋势25, 可是 2025 年 1 月它出版时,能看图的模型已经普及一年多了。 这是这本书对时间的第一处失准,第 08 章会看到还有更多。

6. 可带走的

  1. 提示词 = 你打进去的那段文字;提示工程 = 怎么写它才好使,不需要写代码;
  2. 它只做一件事:把现有文字整个读一遍,算出一张「下一小块可能是什么」的清单, 从清单里挑一块接上去,再从头来一遍——没有「先理解再回答」这个阶段;
  3. 它切的是标记不是字,所以数字母会错、计费按标记算、中文更费;
  4. 它学的是词与词的关系,不是一张事实清单——这是它会胡说的根源;
  5. 训练在上半截、你写提示词在下半截,提示工程改不了它学过什么;
  6. 「它记得前面」其实是每次把对话重念一遍,所以越聊越慢越贵;
  7. 上下文窗口是硬上限,而且中间位置的资料容易被忽略——精挑,并放头尾;
  8. 温度控制的是挑选时的随机程度,不是「创造力」;要短就在提示词里说,别调最大长度;
  9. 「它不理解」是对的,「它不会推理」是错的——它的思考就发生在它写出来的字里;
  10. 书里的规模法则口径停在 2020 年,后来被 Chinchilla 修正成「大小与数据要配平」。

7. 原文地图

主题原书章原文位置
这本书给自己定的位置与读者Prefacetext/01-fm-preface.txt:7(搜「foundational principles」) · text/01-fm-preface.txt:5(搜「developer, content creator」)
换个问法差别多大Chapter 1: Introduction to Prompt Engineeringtext/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:40(搜「Tell me about social media」) · text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:43(搜「clarity, structure, and a clear objective」)
提示词与提示工程的定义Chapter 1: Introduction to Prompt Engineeringtext/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:29(搜「a set of instructions given to an AI model」) · text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:25(搜「both an art and a science」)
不懂技术也能用Chapter 1: Introduction to Prompt Engineeringtext/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:17(搜「without needing deep technical expertise」)
文本预测引擎、不「思考」Chapter 1: Introduction to Prompt Engineeringtext/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:47(搜「advanced text prediction engines」)
注意力维持上下文Chapter 1: Introduction to Prompt Engineeringtext/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:61(搜「attention mechanisms」)
温度与最大标记数Chapter 1: Introduction to Prompt Engineeringtext/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:65(搜「max tokens」)
深度学习模型、TransformerChapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:15(搜「transformer architectures」)
切标记的例子Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:32(搜「smaller units called tokens」) · text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:34(搜「amazing」)
预训练 / 微调 / 跑一遍模型Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:37(搜「Pre-training involves learning from general data」)
学关系不存事实Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:52(搜「rather than storing factual knowledge」)
规模法则与基准Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:48(搜「scaling laws」) · text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:56(搜「SuperGLUE」)
上下文长度的局限Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:93(搜「beyond their token limits」)
不真正理解、只有模式识别Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:9(搜「probabilistic patterns rather than genuine comprehension」) · text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:114(搜「pattern recognition, not true understanding」)
多模态被列为未来Chapter 2: Understanding Large Language Models (LLMs)text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:102(搜「Multimodal AI」)
「缺乏推理能力」Chapter 7: Common Pitfalls and Things to Keep in Mindtext/08-ch07-chapter-7-common-pitfalls-and-things-to-keep-in-.txt:54(搜「lack reasoning capabilities」)

Footnotes

  1. 出处:「Chapter 1: Introduction to Prompt Engineering」第 40 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:40,搜「Tell me about social media」)与第 41 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:41,搜「List the top 5 social media platforms」)。中文是我们的转述,不是原文翻译。

  2. 出处:「Chapter 1: Introduction to Prompt Engineering」第 43 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:43,搜「clarity, structure, and a clear objective」)。

  3. 出处:「Chapter 1: Introduction to Prompt Engineering」第 29 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:29,搜「a set of instructions given to an AI model」)。

  4. 出处:「Chapter 1: Introduction to Prompt Engineering」第 25 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:25,搜「both an art and a science」)。原文还说这门手艺借了语言学、认知科学、用户体验设计和伦理学等多个学科的东西(同段,搜「cognitive science」)。

  5. 出处:「Chapter 1: Introduction to Prompt Engineering」第 17 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:17,搜「without needing deep technical expertise」)。作者在第 15 段还打了个比方,说掌握它会像掌握电子表格一样成为基本技能(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:15,搜「spreadsheets」)。

  6. 出处:「Preface」第 7 段(text/01-fm-preface.txt:7,搜「foundational principles」)与第 5 段(text/01-fm-preface.txt:5,搜「developer, content creator」)。前言自述这本书要提供一份提示工程的「完整指南」(comprehensive guide),覆盖范围「从基础原则、实用技巧到进阶策略与未来趋势」;目标读者一句列了开发者、内容创作者、商务人士和研究者四类。这是全书唯一一处作者交代自己意图的地方,后面十章都没有再回到它。

  7. 出处:「Chapter 1: Introduction to Prompt Engineering」第 47 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:47,搜「advanced text prediction engines」)。

  8. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 15 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:15,搜「transformer architectures」)。

  9. 补充(不在书里):Transformer 出自 2017 年 6 月的《Attention Is All You Need》,第一作者 Ashish Vaswani。书里用了这个名字,但没有交代它的来历。论文的主张就写在标题里:这套结构「完全建立在注意力机制之上」,彻底去掉了此前主流的循环结构——这正是它能一次通盘看完整段文字、而不必从左往右逐字读的原因。来源:https://arxiv.org/abs/1706.03762(查阅于 2026-08-25)。

  10. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 32 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:32,搜「smaller units called tokens」)与第 34 段那个切分例子(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:34,搜「amazing」)。原文说标记「可以是词、子词或字符」。

  11. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 37 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:37,搜「Pre-training involves learning from general data」)与第 40 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:40,搜「predicts the next token based on what it has learned」)。书把这三步叫 Tokenization / Training / Inference。 2

  12. 补充(不在书里,来自通用知识):「2019 年那一代只有十几亿个参数」指的是 GPT-2 那一代的规模量级(十亿级),而今天常见的大模型在千亿级——这是一个数量级上的对照,不是某两个具体型号的精确比值。「每吐出一小块,全部参数都要参与一遍计算」说的是这类模型最常见的那种结构;后来有一类只让其中一部分参与计算的做法,书里也没有提到。顺带说明:「参数」这个概念是我们补的——全书从头到尾没有给过任何模型规模的数字, 「parameters」这个词在书里只出现过两次,而且两次都是指温度、最大长度这类可调设定,不是指模型内部那些数。

  13. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 52 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:52,搜「rather than storing factual knowledge」)。这是全书信息量最大的一句,可惜作者只用了一行,没有往下推。

  14. 出处:「Chapter 1: Introduction to Prompt Engineering」第 61 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:61,搜「attention mechanisms」);第 2 章第 23 段用的是「自注意力」这个更精确的名字(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:23,搜「self-attention mechanisms」)。两者说的是同一件事:自注意力指的是「同一段文字内部,各部分互相看」。

  15. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 93 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:93,搜「beyond their token limits」)。

  16. 补充(不在书里):来源:《Lost in the Middle: How Language Models Use Long Contexts》,Liu 等,2023 年 7 月 https://arxiv.org/abs/2307.03172(查阅于 2026-08-25)。原文的结论是,相关信息出现在输入的开头或结尾时表现最好,出现在中间时明显下降。

  17. 出处:「Chapter 1: Introduction to Prompt Engineering」第 65 段(text/02-ch01-chapter-1-introduction-to-prompt-engineering.txt:65,搜「max tokens」)。这是全书唯一一次提到这两个设定,只有一句话。

  18. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 9 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:9,搜「probabilistic patterns rather than genuine comprehension」)与第 25 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:25,搜「statistical patterns」)。

  19. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 114 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:114,搜「pattern recognition, not true understanding」)。

  20. 出处:「Chapter 7: Common Pitfalls and Things to Keep in Mind」第 54 段(text/08-ch07-chapter-7-common-pitfalls-and-things-to-keep-in-.txt:54,搜「lack reasoning capabilities」)。书把这一条放在「别把 AI 当人」这个误区下面,提醒本身是对的,但用词过头了。

  21. 补充(不在书里):来源:《Large Language Models are Zero-Shot Reasoners》,Kojima 等,2022 年 5 月 https://arxiv.org/abs/2205.11916(查阅于 2026-08-25)。论文报告在 text-davinci-002 上,GSM8K(小学数学应用题)正确率从 10.4% 提升到 40.7%,MultiArith 从 17.7% 提升到 78.7%,改动只是在提示词里加上「Let's think step by step」。这条技巧的完整讲解在第 03 章。

  22. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 48 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:48,搜「scaling laws」)。一处版面上的小事实: 我们解包原书电子版核过,这句话的句末是「models .」——句号前多了一个空格,而那个位置没有任何脚注标记或上标。至于这个多余的空格是不是「引用标记被删掉后留下的坑」,书里没有任何东西能证实,那只能算我们的猜测,读者不必当真;能确定的只有一件事:这句话没有出处。

  23. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 56 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:56,搜「SuperGLUE」)。

  24. 补充(不在书里):来源:《Training Compute-Optimal Large Language Models》(即 Chinchilla),Hoffmann 等,2022 年 3 月 https://arxiv.org/abs/2203.15556(查阅于 2026-08-25)。论文训了四百多个模型,结论是「当前的大语言模型训练严重不足」,并给出一条很好记的规则:模型每翻一倍,训练用的标记数也该翻一倍。

  25. 出处:「Chapter 2: Understanding Large Language Models (LLMs)」第 102 段(text/03-ch02-chapter-2-understanding-large-language-models-ll.txt:102,搜「Multimodal AI」)。有意思的是,同一本书在第 3 章又把多模态当成一种可以现在就用的技巧来讲(text/04-ch03-chapter-3-advanced-techniques-for-prompt-generat.txt:267,搜「Multi-modal prompting combines text」)——书内部自己就不一致。