跳到主要内容

动手学大语言模型 —— 全书拆解

先把书名里那个词讲掉。大语言模型(英文 large language model,常用缩写 LLM——本文两种写法都会出现) 就是一台读了海量文字、学会「接着往下写」的机器。 「大」指的是它内部可调的数值多——几十亿到几千亿个。

30 秒导读: 这是一本 2024 年的实操书,回答一个问题—— 今天「AI 会说话」这件事,是由哪些零件拼起来的,每个零件解决什么麻烦。

本文后面提到这台机器,一律用中文全称,或者直接简称模型——说的是同一样东西。

它的长处不在深,在:从最土的办法一直讲到最新的省钱训练法,中间一环不落。

而它真正值得带走的,是两条藏在结构里、书自己都没点明的判断: ① 所有能力都建立在同一件事上——把文字变成数; ② 遇到新任务,先假设你不需要训练任何东西。

本组文档是我们重写的完整拆解,九章。读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者Jay Alammar——以画图讲技术出名,写书时在 Cohere(一家做语言模型的公司);Maarten Grootendorst——写过两个被广泛使用的免费小工具 BERTopicKeyBERT(源代码公开、谁都能拿去用和改),写书时在荷兰一家医疗数据研究机构1
出版2024 年 9 月第一版,O'Reilly2
它自己的定位「直觉优先」:大量插图配可运行代码,书里明说「重点在建立扎实的直觉,而不是推导数学公式」3
预设读者会一点 Python、听说过机器学习即可3
硬件门槛全书例子都设计成能在一张免费显卡上跑完4

三件事必须先说,否则会误读这本书:

第一,两位作者是「做工具的人」,不是做研究的人。 这不是缺点,但要知道: 你读到的技术选择,带着作者自己的手艺偏好—— 书里有两个被反复使用的工具(BERTopicKeyBERT)就是作者本人写的。

第二,它是操作手册,不是教科书。 每一节都长这样:一个概念 → 一张图 → 一段能跑的代码 → 一个分数。 代码两年就报废,图和分数不会。 我们的拆解只保留后两样。

第三,它写在 2024 年 9 月。 那时后来那些「会先想一想再回答」的模型还没出现, 让模型使唤外部工具也还没有统一规矩。原理层面没过时,生态层面已经换了一轮——见第 5 节。

2. 全书一条主线(读完这一节,你就懂了这本书)

这本书表面上是十二个各自独立的章节,骨子里是一条从头贯到尾的链子:每一步都是被上一步逼出来的。 下面把这条链完整走一遍——不看后面任何一章,只读这一节,你也能把这本书讲给别人听。

细节全部留给对应章节,这里只讲「发生了什么、为什么只能这样」。

① 你先得知道:「大模型」这个词指着两样东西

有人说「我们用大模型做了个客服机器人」,也有人说「我们用大模型把十万条工单自动归了类, 模型很小,普通电脑就能跑」。听起来后一句不对劲,其实两句都对。

因为这几年跑出来的是两支血统不同的东西:

  • 一支专门读懂:你给它一段话,它给你一串数,这串数代表「这段话是什么意思」。 它自己不会写字。分类、找相似、搜索,靠的是它。
  • 一支专门往下写:你给它一个开头,它一个字一个字往下接。聊天、写作、答题,靠的是它。

书给这两支起了固定的名字并且全书通用,我们也沿用:前一支叫表示模型。 上面那支「专门读懂」的就是它——分类、找相似、搜索全归表示模型管,它不负责写字。

后一支叫生成模型。 聊天、写作、答题,靠的就是这一支。

这个二分法就是你做任何技术选型时要问的第一个问题:我要的是一段「意思」,还是一段「文字」? (这两支是从哪儿分出来的,第 01 章讲。)

② 往回追一步:计算机看不懂字,这是所有麻烦的源头

给「猫」编个号 3542,给「狗」编个号 3543 —— 这两个号之间的差,什么也不代表。 编号是随手定的,顺序也是随手排的。所以「文字」这种东西,机器拿到手根本没法算。

于是整个领域五十年只在做一件事:给文字找一组「差值有含义」的数。

最后成功的办法朴素得像句废话:让意思相近的词,数值也相近。 这样一来「意思接近」就变成了「距离接近」,机器终于有东西可算了。

那这组数从哪来?靠一条同样朴素的观察:老在同类句子里出没的词,意思就相近。

这一步做成了,后面全部才有意义。 上面那支「读懂型」,产出的就是这组数。(第 01、02 章)

③ 入口处还有一道没人注意的关卡:先挨一刀

文字进机器之前,要先被切成小段——切完才好一段一段查数。 切出来的每一小段,中文叫「词元」,英文叫 token(有的书把它译作标记——说的是同一样东西)。 问题是这一刀怎么切,各家不一样。

后果比想象中大得多。书把七个真实模型的切法摆在一起对照,差异一眼可见:

  • 有的模型把 600 当一个整体,有的拆成 6 0 0 三段;
  • 有的把连续四个空格当成一段,有的干脆没有空格这个概念;
  • 有的碰到中文和表情符号直接吐一个「不认识」——它对这些内容天生是瞎的。

由此得到全书最实用的一条排查口诀:模型在某类输入上莫名其妙地差, 先去看它怎么切这类输入,再去怀疑模型本身。

换句话说:它能干什么,在开始训练之前就已经被这一刀削掉了一部分。(第 02 章)

④ 「往下写」那一支,内部在重复一个动作

你打的整段字 → 切段 → 查出一串数 → 穿过几十道处理工序 → 变成「下一个该是什么」的可能性清单 → 挑一个

把挑中的那一小段接到文末,整条流水线从头再跑一遍 ←─────────────────┘

图说:每吐一小段字,这台机器就完整跑一遍。两个后果直接跟着来。

后果一:写长文必然慢。 所以工程上第一件事就是把上一轮算过的中间结果存下来别重算—— 书做了实测,同一段任务,存和不存差出四倍多。

后果二:它一次能看多少字,是有硬上限的。 而且你的问题和它的回答共用这一份额度—— 很多人第一次撞到「超长度」报错时想不通的,就是这一点。

这套结构里真正的巧思不是「做得更大」,而是「不把所有东西平摊着看」—— 让它自己决定此刻该回头看前文的哪几处。这个念头 2017 年被提出来,此后没有换过。 (它具体怎么转、后来这些年又改动了什么,第 03 章讲。)

⑤ 现在到了全书最值钱的一节:先假设你不需要训练

这是这本书区别于教科书的地方,也是它最该被记住的东西。

书拿同一份数据(一万条影评,判断夸还是骂)做了一整排对照。 它没有直接给结论,但把结果排在一起,结论自己就跳出来了。

先说清一个词:标注就是「人工一条条给出标准答案」,是这行最贵最慢的活。

做法要不要训练干得怎么样
找一个别人已经练好、专门判断褒贬的现成模型完全不用八成
用「读懂型」把每条影评变成一串数,再在上面套一个最简单的判别器只练那个判别器,几秒钟八成半
只写下「这是一条好评」「这是一条差评」两句话,比谁离得近——连标注都不要什么都不用接近八成
找一个「会写型」的小模型,在影评前面加一句「下面这句是好评还是差评?」完全不用八成半
换成当时最好的商业模型,同样加那一句完全不用九成

这张表比书里任何一段论述都有用。它说明两件事:

  1. 一分钱不花、一条标注都没有,也已经能到接近八成;
  2. 花时间挑模型、把话说清楚,回报常常高于花时间训练。

所以顺序是:先不训练 → 再把话说清楚 → 再把材料喂进去 → 最后才动模型。 这本书剩下的所有章节,都是在这条顺序上依次往后走。(第 04 章)

⑥ 顺序的第二步:把话说清楚,能一直逼到「让它先想一想」

你写给模型那段话,书把它当成一堆可以加减的积木——七块: 角色 / 指令 / 背景 / 格式 / 受众 / 语气 / 材料。 建议朴素得可爱:一次加一块,看效果,留下有用的。

再往上是一个很反直觉的发现:让它把过程写出来,答案就对得多。 甚至不用给例子,只在问题后面缀一句「让我们逐步思考」,算术题的正确率就能翻好几倍。

为什么有效,一句话就说得清:它每写一个字都要重跑一遍流水线, 所以「多写几个字」等于「多想了几步」。写出来的过程,就是它唯一的草稿纸。

书自己在这里的措辞很克制,值得记住:这是在「模拟」推理(就是一步步把答案想出来的那个过程), 不是真的推理。 普遍认为模型是靠记住训练数据里的套路做到这一点的。(第 05 章)

⑦ 顺序的第三步:它信口开河,治法不是修它,是把材料喂进去

生成模型会非常自信地答错。书给的治法不是去修模型,而是: 先把相关材料查出来,连着问题一起交给它,让它照着材料说。

而「查」这件事,恰恰要用第 ② 步那支「读懂型」——把问题和资料都变成数,谁离得近就是谁。 书给了一个很干净的对比,查询是「那部电影的科学有多严谨」:

  • 按字面找,排第一的是「这是一部 2014 年的科幻电影」——因为里面有「科学」两个字;
  • 按意思找,排第一的是「许多天文学家称赞它的科学准确性」——这句里根本没有「严谨」二字。

这就是「按意思搜索」四个字的全部含义。

完整的一套是三道工序:先粗筛出一批(要的是别漏),再把这一批逐条细看、重新排一遍名次 (行话叫「重排」,要的是别歪),最后才把排在前面的几段连同问题一起交给模型(要的是说人话)。

这套东西今天叫 RAG,中文全称叫「检索增强生成」——意思就是先查再答。 它是生成模型最常见的落地形态。(第 06 章)

⑧ 同一套办法,原样搬到图片上就成了「看图说话」

图片怎么变成机器能吃的东西? 答案朴素得让人意外:切成方块,每块当一个「词」。 切完转成一串数,后面的处理流程完全不用改——它压根不知道自己在处理图片。

再往上一层更妙:拿数百万对「图 + 配文」来训,训练目标只有一句话—— 配对的拉近,不配对的推远。训完之后,一张猫的照片和「一张猫的照片」这句话,落在同一个地方。

最后一层是最省钱的做法:看图那部分冻着不动,说话那部分也冻着不动, 只训中间一小座桥,把图像那边的数翻译成说话那边听得懂的数。

「两端冻住,只训中间那一小块」——记住这个念头,第 ⑩ 步会原样再出现一次。(第 07 章)

⑨ 走到这一步才该动手训。表示侧的秘密只有一个念头

到这里,全书真正的暗线才浮出来。它散在四个章节里、用了四个不同的名字,其实是同一件事:

不要教模型「什么是狗」,要教它「为什么这是狗、不是猫」。 给出对立面,信息量才够。

做法就是成对地喂:一对「该靠近的」,一对「该远离的」,反复调,直到它把该近的摆近、该远的摆远。 上面第 ②(怎么让意思相近的词数值相近)、第 ⑧(怎么让图和配文对上)靠的都是它。

而书最有价值的一组实验,是用同一批数据、同一个底子,只换「怎么衡量差得远不远」这一件事—— 分数从五成九跳到八成。

结论直接可用:调「怎么衡量」的杠杆,比换模型大;而挑「像却不对」的反例,又比堆数据大。

书还回答了一个很实在的问题:训的时候是不是非得整个模型一起动? 答案是不必,但省得越多,代价越实——全训能到八成半,只动最外面一层就掉到六成三; 多放开一层,基本就追回来了。 (第 08 章)

⑩ 生成侧要三步,而后两步都在想办法省钱

① 预训练 → 会说话,但不听话(你问它,它接着编下一个问题)
│ 「预训练」就是先拿海量网页文字通读一遍、不带任何具体任务的那一步
│ 极贵。这本书不讲这一步,也不建议你做

② 教它听指令 → 拿「问题 + 标准回答」来教,让它学会「回答」而不是「接着问」


③ 教它说人话 → 拿「同一个问题的好答案 vs 差答案」来教,把偏好磨进去

图说:三步喂的数据形态完全不同,这是理解它们的关键。

第二步贵在哪?贵在要动的数太多。省钱的办法就是第 ⑧ 步那个念头:大部分冻住,只训一小块。 再叠一层「把冻住的那部分存得粗一点」,原本要一屋子机器的活,就压进了一张显卡、一天之内

第三步原本要另外再养一个「打分员」模型,还要拿它去做一轮复杂的调教。 后来有人发现打分员可以省掉——留一个冻住的自己当参照,直接朝「好答案比差答案更可能」的方向调就行。 这一下把两个模型变回了一个。

最后书很坦白地收尾:怎么判断一个模型好不好,没有金标准。 公开考卷会被针对性刷分,让另一个模型当裁判会跟着裁判一起偏,人类打分最准但那只是众人口味的平均。 它引了一句话作结——当一个指标(就是拿来衡量好坏的那个数)变成目标,它就不再是一个好指标。(第 09 章)

⑪ 一句话收尾

如果只带走三句:

把文字变成数,是一切的入口; 把「像不像」变成一个可以往上爬的目标,是一切的方法; 能不训练就不训练,是一切的顺序。

3. 九章地图

这张表不用记任何术语——每一章的名字后面,写的是「读完你能回答什么问题」。

读完你就能回答
01 两条分支为什么同一个词「大模型」指着两种完全不同的东西?先读这一章,后面八章的用词都在这里定下
02 文字怎么变成数我打的字进去之后,机器到底「看见」了什么?为什么有的模型算数会错、有的一写代码就乱缩进?
03 它内部长什么样它写字的时候在重复什么动作?为什么写长文那么慢、为什么会突然说「太长了」?
04 不训练也能干活一分钱不花训练,能把活干到几成?一堆没人整理过的文字,怎么让它自己分好堆并起好名字?最实用的一章
05 把话说清楚不改模型,光靠改我说话的方式,能把它逼到什么程度?怎么让它自己去查资料、自己去算?
06 让它别瞎说它张口就来怎么办?「按意思搜索」和「按字面搜索」差在哪儿,为什么必须两个都要?
07 让它看图图片凭什么能和文字用同一套办法处理?一张图和一句话怎么比出「像不像」?
08 训一个读懂型的真要自己训,该从哪儿下手最省力?只有 32 条标注数据还能不能干活?(能)
09 训一个会写型的从「会说话」到「听话」再到「说人话」,中间发生了什么?怎么把训练成本压进一张显卡?

推荐顺序: 01 → 02 → 03 打底,后面按需跳。 只想拿结论、马上干活的话,读本页第 2 节 + 第 04 章 + 第 06 章就够。 第 08 章思想密度最高——第 ⑨ 步那条暗线,是在那一章里才被完整串起来的。

4. 这本书覆盖什么、不覆盖什么

覆盖(而且讲得比多数材料完整):

  • 语言 AI 从最土的数词频到今天的完整演化,并且说清了旧办法今天还在哪儿用;
  • 文字进模型前挨的那一刀——极少有书专门讲,而它用七个真实模型做了横向对比;
  • 「把文字变成数」这件事的三个层级,以及它跳出文字之外的用法(比如做音乐推荐);
  • 生成模型内部的构造,以及近几年为了省时间、省显存(显卡自带的那块内存,模型装不装得下全看它)做的那些改动;
  • 一整排「不训练能干到几成」的对照实验——这是全书最实用的部分;
  • 把一堆散文字自动分堆并起名字的完整流水线;
  • 怎么把话说清楚,以及让模型「先想一想」的四种办法,连怎么强制它输出规定格式都讲了;
  • 「按意思搜索」的三道工序,以及怎么给一个搜索系统打分;
  • 让模型看图的三层递进;
  • 成对训练——全书的隐藏主角,从最早那套「把词变成一串数」的做法,一路贯到最省数据的分类法;
  • 省钱训练的全套办法,以及把人类偏好磨进模型的两条路线。

不覆盖(别指望在这本里找):

缺什么说明
最贵的那一步训练本身三步里的第一步只用两段带过。数据怎么配比、算力(你能调动多少台机器、算多久)怎么规划、多大的模型该配多少数据,一个字没有
数学推导书自己声明了「重点在直觉,不推公式」
生产工程部署、服务化、把请求攒起来一起处理、从发出请求到拿回答案要等多久、成本核算、监控,全部不在
安全那一块的细节书只在开头列了一节伦理清单。 怎么让模型的行为符合人的预期、怎么防人用巧妙的说法诱它绕开限制、怎么组织一批人专门去诱它出错、怎么在模型外面加一层检查拦住不该放出去的内容——四件事一件都没讲
会先想一想的那些模型书出版时还不存在;书里让模型「想一想」全靠改写你发给它的那段话,见下一节
让模型自己干活的工程现实只有一个玩具例子;多步长任务、出错怎么恢复、工具怎么统一接入,都不在
怎么给自己的系统建评测集列了公开考卷的名字和优缺点,但没有一条可执行的建议

5. 今天读,要修正的五处

这本书写于 2024 年 9 月。 下面五处不是它写错了,而是它没跟上—— 其中有一处的变化大到会改变你的技术选型。

先交代一个后面反复出现的词。「提示」就是你发给模型的那段话——指令、材料、格式要求都在里面。 这一行也叫提示词,说的是同一件事,本文两种写法都会出现。

书里的说法该怎么修正依据
书里那句**「想一想全靠改写提示词」**(第 05 章)方向对,但实现层换了。书里那四招都是在你写的那段话上做文章;2025 年之后主流做法是把「先想很久」直接训进模型——DeepSeek 那篇论文声称,不需要人工标注的推理过程,纯靠奖惩就能让模型自己长出「回头检查」「换个思路」这些行为《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》https://arxiv.org/abs/2501.12948(查阅于 2026-08-25)
「每接一个工具就手写一份说明」(第 05 章)书里让模型使唤外部工具,每个工具都要你亲手描述一遍;2024 年 11 月之后有了一个开放标准 MCP——一份人人都能照着实现的公开约定——把「每接一个数据源就写一份定制实现」变成了一次接入、到处可用(它到底约定了什么,见第 05 章第 5 节)《Introducing the Model Context Protocol》Anthropic,2024-11-25 https://www.anthropic.com/news/model-context-protocol(查阅于 2026-08-25)
「一次只能看几千字,长文必须切碎」(第 03、06 章)数量级变了,但切碎并没有过时。一边是长度暴涨(Gemini 1.5 在极长输入下仍保持很高的查找准确率),另一边有工作指出:同样的信息,放在开头或结尾模型找得到,放在中段就明显找不到了。所以「全塞进去」不等于「找得到」《Gemini 1.5》https://arxiv.org/abs/2403.05530 与《Lost in the Middle: How Language Models Use Long Contexts》https://arxiv.org/abs/2307.03172(均查阅于 2026-08-25)
第 05 章那些代码照抄会报废。 书里用了一个负责「把模型、套在你那段话外面的那层固定格式、外部工具串成一条流水线」的第三方库,它的核心写法在书出版前就已经被官方宣布不再维护、建议你改用别的写法LangChain 源码里的标注:since="0.1.17"alternative="RunnableSequence, e.g., prompt | llm"removal="2.0.0" https://github.com/langchain-ai/langchain/blob/57c83d44bc8ae89a189ad521b9756cfac996039c/libs/langchain/langchain_classic/chains/llm.py(查阅于 2026-08-25)
「模型变大会突然长出新本事」被当成前提(第 07 章开头)书顺手把这句当既定事实用了;它在书出版前就被挑战过——有工作论证这种「突然」可能是打分方式造成的错觉:换成连续的打分方式,曲线就变得平滑、可预测《Are Emergent Abilities of Large Language Models a Mirage?》https://arxiv.org/abs/2304.15004(查阅于 2026-08-25)

判断(我们的,不是书里的): 这五处里,只有一处会让你改变做法,就是第一条。 书教你花力气改写提示、让模型模拟着想一想;今天更省事的做法是直接换一个已经训过「会想」的模型, 把省下来的力气花在查资料和做评测上。 如果错,会错在: 如果你的任务是公司内部特有的、模型没见过的多步流程 (比如按内部规程走的审批链),那书里那套显式拆步骤的办法仍然不可替代—— 训过的「会想」只擅长它见过的那类想法。

6. 我们的判断

判断(我们的,不是书里的): 这本书今天的价值排序是—— **① 那一整排「不训练能干到几成」的对照实验(不过时,而且极其实用)

② 讲「文字怎么变成数」的那两章(不过时,别处很难找到这么完整的) ③ 成对训练那条暗线(不过时,但书自己没把它放到应有的位置) ④ 具体的包与代码(已经过期)。** 引用它的时候引 ①②③,别引任何一段代码如果错,会错在: ① 里那些分数是 2024 年的模型给的。如果今天最好的免费小模型 一句提示就能超过九成,那「阶梯」的形状会变——但**「先试不训练」这个顺序不会变**。

判断(我们的,不是书里的): 成对训练才是这本书真正的主角,但书自己没这么说。 它散在四个章节里、顶着四个不同的名字出现,而它们是同一件事: 把「像不像」变成一个可以往上爬的目标。 如果只允许你从这本书里带走一个念头,应该是它,而不是那个大家都在说的架构名词。 如果错,会错在: 如果将来的做法不再需要「反例」 (比如直接让会写型的模型吐出那串数),这条主线的解释力就会下降。 判据是:新办法还需不需要给出对立面。不需要,这条线就断了。

判断(我们的,不是书里的): 这本书的图值钱,代码不值钱,而它自己是反过来定价的。 书名叫「动手学」,一半篇幅是代码;但代码依赖的那些包两年内换了一轮, 而那些图——一次一小段字的流水线、三道工序的搜索、把大方阵拆成两个瘦条——今天原样成立。 读它的正确姿势是:看图,读分数,跳过代码块。 如果错,会错在: 如果你的目的就是照着跑一遍建立手感,那代码仍有价值—— 但要先去它的代码仓库取最新版,不要照着书页敲。

判断(我们的,不是书里的): 书里有两处诚实值得单独表扬,也正因如此,第三处的沉默值得警惕。 讲「让模型自己干活」时,它主动写了「没有人在流程中来判断输出或推理过程的质量」; 讲商业模型拿到九成分数时,它主动写了「据我们所知,它可能实际上是在我们的数据集上训练过的」。 这两句自我拆台在同类书里非常罕见。 但反过来:书对自己反复推荐的那两个工具——BERTopic(把一堆散文字自动分堆并起名字) 和 KeyBERT(从一段文字里挑出最能代表它的几个词),两个都是作者本人的作品—— 没有做同等力度的自我拆台,也没有给任何独立对比。读到第 04 章时把这一点放在心上。 如果错,会错在: 如果那两个工具在独立评测里确实优于同类方案, 那这就不是利益相关,只是作者恰好写了两个好工具——书里没给对比,我们无从判断。

7. 兑现表:每一句「后面讲」都记在这里

这一节不是给读者读的,是给我们自己对账用的。 本组文档里每一处「第 N 章讲」「后面会讲」「这是伏笔」,都在下面记一行, 并且逐行核过了两件事:那一章真的讲了吗?讲的是不是许诺的那件事? 下面只写「许诺在哪、该在哪兑现」,不复述内容——名词都留在它该在的那一章里。

第 2 节那条主线的十步,每一步末尾都甩了一个章号。逐一兑现如下:

许诺在哪应兑现在哪核过了吗
§2 ①「这两支是从哪儿分出来的,第 01 章讲」01 §3.6–3.7✓ 讲的就是 2018 年那次「只留一半」的裁剪
§2 ②「产出的就是这组数(第 01、02 章)」01 §3.3 · 02 §3.5–3.7✓ 那三层各是什么形状都写出来了
§2 ③「在开始训练之前就被这一刀削掉了一部分(第 02 章)」02 §1 那张七模型对照表 · §3.3
§2 ④「它具体怎么转、后来改动了什么,第 03 章讲」03 §3.5 · §3.6 那条带数的走查 · §3.7–3.10✓ 两问都答了
§2 ⑤「这本书剩下所有章节都在这条顺序上往后走(第 04 章)」04 §1 那五个分数 · §3.6
§2 ⑥「模型靠记住套路做到这一点(第 05 章)」05 §3.5✓ 书那句「我们强调『类似』」原样保留了
§2 ⑦「它是生成模型最常见的落地形态(第 06 章)」06 §2 三道工序 · §3.4 · §3.6
§2 ⑧「记住这个念头,第 ⑩ 步会原样再出现一次(第 07 章)」07 §3.3✓ 而且 09 §3.2 确实原样再来了一次
§2 ⑨「(第 08 章)」——成对训练、最大的那个杠杆、少训几层的代价08 §3.1 · §1 那张 0.59→0.85 · §3.6 Q1✓ 三件都有
§2 ⑩「(第 09 章)」——三步、两次省钱、没有金标准09 §2 · §3.2 · §3.3 · §3.7✓ 四件都有

总纲其余三处:

许诺在哪应兑现在哪核过了吗
§3「第 ⑨ 步那条暗线,是在那一章里才被完整串起来的」08 §2 顶层全景✓ 四个化名并排列出来了
§4「书里让模型『想一想』全靠改写你发给它的那段话,见下一节」本页 §5 第一行
§6「读到第 04 章时把这一点放在心上」04 §3.10 那条提示块 · §4 末尾的判断块✓ 两处都点了利益相关

各章之间的二十三处:

许诺在哪应兑现在哪核过了吗
01 §3.3「这条区分在第 04 章和第 06 章会反复用到」04 §3.3 · 06 §3.3✓ 两处都真的用到了那条区分
01 §3.10「这一节是第 09 章的伏笔」09 §2✓ 而且 09 把两步拆成三步,比许诺的更细
01 §3.11「它具体怎么做到『粗了却还准』,第 09 章讲」09 §3.3✓ 正面回答了「怎么做到」这一问
02 篇首「这三层是第 04、06、08 章共同的地基」04 §3.3 · 06 §3.1 · 08 §3.4
02 §3.3「……第 05 章详讲」(那个让模型先写过程的做法)05 §3.5 整节
02 §3.3「第 05 章讲提示模板时会回到这里」05 §3.1✓ 回到的是同一批 <|user|> 标记
02 §3.7「第三层是第 04 章和第 06 章的全部基础」04 §3.3 · 06 §3.1
02 §3.9 末尾那句「那就是第 07 章的……」07 §3.2 整节✓ 点名的那个模型正是那一节的主角
02 §4「这是第 06 章的伏笔」(「谷歌杀手」那条注)06 §3.6✓ 动机被完整接住了
02 §6 第 11 条「第 08 章会告诉你『像却不对』的反例更好」08 §3.5 阿姆斯特丹那个例子
03 §2「换个最后那一小层就换个工种,第 08 章讲逐词分类时用的就是它」08 §3.8✓(原先写的是「整章都在用」,与事实不符,已改口径)
03 §3.2「那个『多敢挑冷门』的设定,完整讲法在第 05 章」05 §3.2✓ 含 0.8 / 0.2 那组经验值
03 §3.3「本章 3.7 节会讲『你是第几个』这条信息今天怎么加」03 §3.7✓ 同章内兑现
03 §3.5「那两道工序是第 09 章的内容」09 §3.1 · §3.4
04 §3.3 判断块末尾指向第 08 章08 §3.6 Q3 · §3.7
04 §3.5「第 05 章整章讲它」(把话说清楚这件事)05 整章
05 §3.3「治它(一本正经地编)的根本办法在第 06 章」06 §3.6
05 §3.5「那个『变大就突然长出新本事』的说法有争议,见第 07 章第 5 节」07 §5 第一条✓ 连论文出处一起给了
05 §3.7 那张表最后一行指向第 09 章09 §3.6 末尾
06 §3.2「这条软肋直通第 08 章」(换个领域就不灵)08 §3.6 Q3 的第二条路
06 §3.2「用来搜的那个模型要拿问答对专门训过,这是第 08 章的内容」08 §3.4 第三种衡量方式✓ 那一节要的「该靠近的一对」正是问答对
07 §2「第三层那个念头,第 09 章会原样再用一次」09 §3.2✓ 「不动大的,只训一小块」
07 §3.2「第 08 章会把这条线完整串起来」08 §2 · §3.1

核不上的那一处,已经把许诺删掉了:

原来的许诺处理
02 §3.6 原写「过完模型出来的那串数还驱动画图模型——最后这条是第 07 章的伏笔删掉了那句伏笔。 第 07 章开头就声明了它只讲「能看图」、不讲「能画图」,§5 又重申一遍;为一句伏笔去补生成侧,会破掉那条边界声明。改成「书顺带提了一句,本组文档不展开」

拆解写于 2026-08-25,依据 2024 年 O'Reilly 第一版(中文译本)。原始书籍文件不入库, 本组文档是我们自己的重写;每条引用都可用 node scripts/book-verify.mjs hands-on-large-language-models 回核。

Footnotes

  1. 出处:「动手学大语言模型」第 232 段(text/02-fm.txt:232,搜「Cohere 的伙伴们」)与第 242 段(text/02-fm.txt:242,搜「IKNL」)。两人的所属机构写在致谢里,不是正文声明的。另外值得注意:书的赞誉页第 59 段(text/02-fm.txt:59,搜「sentence-transformers 创建者」)由 Cohere 的机器学习总监 Nils Reimers 撰写——而他正是第 08 章大量引用的那套开源工具的作者。

  2. 出处:「动手学大语言模型」第 41 段(text/02-fm.txt:41,搜「2024 年 9 月:第一版」)。

  3. 出处:「动手学大语言模型」第 89 段(text/02-fm.txt:89,搜「视觉化语言」)与第 95 段(text/02-fm.txt:95,搜「本书假定你有一些 Python 编程经验」)。书还说明每一章都可以独立阅读(第 101 段,text/02-fm.txt:101,搜「每一章都可以独立阅读」)——这解释了为什么原书的章序不是最好的讲法,我们的拆解重新做了切分。 2

  4. 出处:「动手学大语言模型」第 125 段(text/02-fm.txt:125,搜「16 GB 的 VRAM」)。这条门槛不是台账,它直接决定了书里挑哪些模型做示例——全书的主力生成模型只有 38 亿个可调数值,而不是任何一个大家伙。