跳到主要内容

数据截至 (上游 commit eb980a5c9eea)

Happy-LLM:从零造一个大语言模型(就是今天这些会说话的机器)— 全书拆解

30 秒导读: 这是 Datawhale 的一本开源(内容和代码全部公开、免费可用)中文教程, 回答一个问题——今天这些会说话的机器,到底是怎么造出来的。 书名里的 LLM 是 Large Language Model 的缩写,中文叫大语言模型——就是这类机器的正式名字。

它最独特的地方不是讲得多深,而是**「为什么这么设计」和「亲手做一遍」是同一条线**: 前半本把每一步的来龙去脉推一遍,后半本让你在自己的显卡上真的训出一个能对话的模型。

本组文档是我们重写的完整拆解,九章。读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者Datawhale 开源社区,核心贡献者宋志学、邹雨衡,指导专家朱信忠1
性质免费开源的社区教程,不是出版社的教科书,没有经过同行评议
写作时间内容主体覆盖到 2024 年年中;前言里提到了 2025 年才出现的模型,说明定稿时已进入 2025 年2
面向谁书里自己说了:要有 Python 基础,最好懂一点深度学习(深度学习——用多层结构的网络从大量数据里自己找规律的那套方法)3
篇幅七章:前四章讲道理,后三章动手

三件事必须先说,否则会误读这本书:

第一,它是「教程」不是「综述」。 目标是让你能动手,不是把研究前沿讲全。 所以它对每个做法都给了「怎么做」,但大量地方没给「谁最早这么做的、当时的对手是谁」。 我们的拆解在这些地方补上了核对过的一手出处。

第二,它自带一个真的能跑通的项目。 书里训出来的模型有 2.15 亿个可调的数,作者在八张显卡上跑了 46 小时4这是这本书最值钱的部分——大部分讲道理的书,到「你可以自己试试」就停了。

第三,书里的代码是讲解片段,不是能直接运行的工程。 我们在拆解里点出了几处明显对不上的地方。 这不影响它讲道理的价值,但别指望复制粘贴就能跑——真正能跑的在它的配套仓库里。

2. 一句话先给出全书的结论

这些机器不是被「设计」出来的,是被一连串死路「逼」出来的。 每一代做法都在解决上一代绕不过去的毛病; 而最后赢的那条路,恰恰不是当年最被看好的那条—— 它赢在「出的练习题最省事」,省事到可以把互联网上所有文字都吃进去。

3. 全书一条主线(读完这一节,你就懂了这本书)

不看任何后续章节,只读这一节,你也能把这本书讲给别人听。 细节全部留给对应的章节,这里只讲「发生了什么、为什么只能这样」。

① 起点:机器不认字,只认数

这门学科要解决的第一件事,不是「理解」,而是把文字变成数。 理由很物理:机器内部只有加法和乘法,你得先给它数。

难点在于:给每个词编个号是不行的。 「猫」是 7 号、「狗」是 8 号、「西瓜」是 3000 号,机器就会当真地算出 「猫和狗差 1,猫和西瓜差 2993」。编号是随便定的,而这些距离是假的。

所以真正的要求是:变成一组数,并且让这组数之间的关系,反映词与词之间真实的关系。 接下来四十年,整个领域都在回答这一句话。

② 四代做法,每一代都死在一个具体的地方

第一代:一个词占一张表里的一格
└ 死在:任意两个词之间毫无关系。「猫」和「狗」的距离,等于「猫」和「西瓜」的距离

第二代:去数「哪个词后面爱跟哪个词」
└ 死在一个自相矛盾:想看得远就得多数几个词,多数几个词就没有足够的样本

第三代:不由人来定,让机器自己学出这组数
└ 靠一个朴素的观察:出现环境相似的词,意思就相近
└ 死在:一个词只有一组固定的数,「苹果」在水果和公司里长得一模一样

第四代:别给固定的数,给一台现算的机器 —— 整句话喂进去,现取这个词此刻的表示
└ 思路对了,但它用的那个零件不行

图说:每一代都不是「更先进」,而是「上一代那个毛病绕不过去了」。

第四代顺带带来了一个更大的东西,后来十年整个领域都按它组织: 先在海量文本上练一个通用底子。 关键在于这些文本没有经过人工标注—— 标注就是人给每条数据写上正确答案,又贵又慢;不用标注,互联网上的文字就要多少有多少。

练完底子,再在具体任务上用少量数据调一下。这后一步的正式名字叫微调。 贵的那一步只做一次,后面每个任务都便宜。

③ 那个零件为什么必须换掉

第四代用的零件是一个词一个词往下递:算完第一个才能算第二个。

两个毛病,而且都是结构决定的——不是调一调就能改好的:

  • 必须排队。 显卡的全部本事就是同时算几万件事,而这个结构强制它一件一件来;
  • 远处会模糊。 信息一站一站往后传,隔得越远丢得越多。

要解决,只能换结构。

④ 换成什么:让任意两个位置一步之内直接相连

新的做法可以用查字典讲完: 你手上有一个要查的东西,库里有一堆键和键对应的内容。 普通字典要求键完全匹配;新做法不要求—— 它给每个键算一个「有多像」的分数,然后按分数把所有内容混起来。

这个动作叫注意力。收益是结构性的: 任意两个位置的距离,从「隔多远就传多少步」变成了恒定一步。 排队没了,远处模糊也没了。

代价也是结构性的:这个动作眼里没有先后顺序。 「我喜欢你」和「你喜欢我」在它看来完全一样,所以顺序必须另外补回去。 (怎么补,以及一台完整的机器还差哪几个零件,第 03 章讲。)

⑤ 一台机器切三刀,三伙人各押一注

这台机器天生有两半:一半负责读懂,一半负责往下写。 于是有三种拆法,而真正拉开距离的不是结构,是每条路给自己出的练习题:

一段现成的文字:「我 喜欢 你 因为 你 很 好」

完形填空: 「我 ▢ 你 因为 你 很 ▢」→ 猜两个 ▢
└ 前后都能看,理解得最准
└ 但真用的时候句子里没有 ▢ —— 练的和用的不是一回事

接龙: 「我 喜欢」→ 猜「你」;「我 喜欢 你」→ 猜「因为」……
└ 只能往前看,理解得糙一点
└ 但练的和用的完全一样,而且任何一段文字把结尾遮住就是一道题

图说:这两道题决定了两种命运。结构上的差别只是为了配合这道题。

当年是完形填空那条路大获全胜,一出手就在十一项任务上刷新纪录,统治了三年。 接龙那条路的第一代,输给了它。

⑥ 三年后反过来了,原因不在结构在练习题

接龙赢在四点,每一点都是「更能吃下资源」:

赢在哪具体是什么
练的和用的一样没有那个真实场景里不存在的人造记号
题目无限供给任何一段文字都是一道题,互联网上所有文本都能直接用
它就是下游任务本身写作、问答、翻译本来就是「往下写」
没有硬上限完形填空那条路当年被卡死在「最多只能读 512 个片段」

一句话:赢的不是更聪明的结构,是更省事、更能规模化的练习题。 判断一条技术路线有没有未来,先问:给它十倍资源,它接得住吗。

⑦ 放大之后,冒出了三样以前没有的东西

先说这一步具体放大了什么。模型内部有一大堆可以调的数,调对了它就「会」了,这些数叫参数; 它们一共有多少个,就叫参数量。 这个数从一亿堆到了一千七百五十亿。

同时被放大的还有喂给它读的文本——这一行管它叫语料——从几十 GB 堆到几百 GB。

两样一起放大之后,小模型身上看不到的能力出现了。三样真正改变了游戏规则:

新能力你会看到什么为什么改变游戏
在提问里塞几个例子它就会照做参数一个都不改做一个新任务的成本从「标一千条数据 + 训一次」降到「写一段话」
没见过的要求它也能照办你怎么说它怎么做模型第一次能直接服务普通人,而不只是研究者
让它把中间步骤写出来,难题正确率大涨一步步算给你看把「一步答不出来」的题,换成很多步「一眼能答」的题

书里还归纳了第四样,叫涌现——「某些能力小模型没有、大模型突然就有了」。 它比书里写得更有争议:反对的一方认为那可能只是评分尺子不连续造成的错觉。 (第 05 章把双方的证据都摆出来了。)

⑧ 只练接龙不够:完整的训练分三段

一个只练过接龙的模型,书里的比喻很准: 博览群书但不求甚解——你问什么它都能接着往下写,就是不知道你在问什么。

① 海量无标注文本上练接龙 → 拿到知识和语感
│ 最贵的一步:上千张卡跑一个多月

② 拿成对的「要求 → 回复」去教它 → 学会听懂人话、照着做


③ 人给回复排名次,照着名次去调它 → 学会答得让人满意

图说:三步各管一件事 —— ① 懂多少,② 听不听得懂,③ 答得合不合人意。
缺哪一步就缺哪一样,顺序不能换。

第 ③ 步有一个很妙的设计:不让人打分,而让人排名次。 因为不同的人给分尺度不一样,直接打分会把这种差异放大;排名次要稳定得多。 (为什么这一步贵到大多数团队做不起,第 05 章讲。)

⑨ 亲手做一遍:今天的机器和课本上那台已经不一样了

这本书的后半段是它区别于其他材料的地方——它让你把上面全部走一遍。

第一件事是发现:今天真正在跑的模型,和课本上那台差了四个零件。 每一处替换的性质完全不同,这个区分本身比零件更值得记住:

换了什么性质
把每层数值拉回统一尺度的那道手续,换成了更省事的一种删掉了其实没起作用的那一半
位置信息从「加上去」改成「转个角度」换了一个更对的数学结构
让多组查询共用一份中间结果明码标价的交易:用一点质量换速度
给每个位置的内容做加工的那道工序,多开了一条「阀门」通道纯经验:试出来更好,谁也说不清为什么

一个模型架构里同时存在这四类零件,是这一行的常态。 (逐个讲透在第 06 章。)

⑩ 训练里最容易做错、后果最隐蔽的一步

第 ② 步(教它听懂人话)的数据里,必须标清楚哪些位置算分、哪些不算: 只对「模型该说的话」算分,对「用户说的话」不算。

这件事做错了不会报错。 训练照跑、各项数字照降、看起来一切正常, 只是训出来的模型会去模仿提问,而不是回答问题。

在这一行,「静默失败」比「崩溃」危险得多——崩溃至少告诉你哪里错了。

⑪ 显卡不够怎么办:业界最后选定的那种妥协

调整一个模型的全部参数太贵。前后有三种省钱办法,前两种各死在一处:

  • 一种是在模型里插一小块新零件只训它——死在从此推理(也就是每次拿模型算结果)永久变慢;
  • 一种是在输入前面挂一段可训练的前缀——死在它占掉了本来能放内容的位置;
  • 最后赢的那种,是在原来的地方并联一小块,训完可以合并回去——推理一点不慢。

它的依据是一个反直觉的发现:要把一个模型调到会做某件新事, 真正需要动的数远远少于它的参数总量。

它省下来的主要是显卡自己的内存。(为什么省得掉,第 08 章讲。)

但它有一条明确的禁区:改「怎么说」可以,灌「新知识」不行。 (这条禁区是很多人「微调完模型还是不懂我们业务」的直接答案。)

⑫ 最后一步:模型不等于产品

模型训完还差三件事,而它们的共同点是:一个参数都不改,只改模型周围的东西。

事情解决什么代价
量一量你怎么知道它好?靠公开题库和榜单,而不是感觉题库全都公开在网上,而模型的训练语料是从网上爬的——分数可能是背出来的
给它查资料先去文档库里捞出相关段落,塞进提问里再让它答整套系统的上限是「捞得准不准」,捞错了它照着错的编
给它接手脚给它一组现成的函数,让它自己判断该调哪个每多一步就多一次出错机会,十步任务的成功率是各步连乘

全书到此收尾。一句话总结它的立场:

这些机器不是魔法,是一条能一步步走完的工程链条; 链条上每一环都是被上一环的死穴逼出来的,而每一环你都可以亲手做一遍。

4. 九章地图

这张表不用记任何术语——每一章的名字后面,写的是「读完你能回答什么问题」。

读完你就能回答
01 文字怎么变成数所谓「神经网络」到底是台什么机器?机器不认字,那它凭什么处理语言?为什么给每个词编个号行不通?
02 注意力机制「它被打翻了」——模型凭什么知道「它」指的是水不是书?全书枢纽,别跳
03 一台完整的机器你打的字进去之后,一共经过了哪几道工序?为什么每道工序都得有?
04 三条路线的分岔为什么今天所有的模型都长一个样? 当年赢的那个后来怎么输了?
05 「变大」带来了什么为什么在提问里塞几个例子它就会了?一个能对话的模型是分几步造出来的?
06 换掉的四个零件课本上那台机器和今天真正在跑的,差在哪?每一处为什么要换?
07 真的训一个出来一个人训一个能对话的模型,要几张显卡、几个小时? 最容易做错的是哪一步?
08 换上业界的工具自己写的那套为什么撑不到实际项目?显卡不够时大家怎么办?
09 模型之外怎么判断一个模型到底行不行?它不知道的事、做不了的事怎么办?

推荐顺序: 01 → 09 顺着读,这也是原书的论证顺序。

  • 只想拿结论: 读本页第 3 节,加第 04、05 两章;
  • 只想动手: 从第 06 章开始,遇到不懂的名词回头查第 02、03 章;
  • 想判断该不该用某个技术: 第 06 章末尾那张「四类零件」表,和第 08 章末尾那段。

5. 这本书覆盖什么、不覆盖什么

覆盖(而且讲得比多数中文材料清楚):

  • 文字表示四十年的完整演进链,以及每一代死在哪;
  • 注意力那条公式怎么一步步被逼出来——用查字典的类比讲,这是全书最好的一段;
  • 一台完整机器的全部零件,含代码级细节;
  • 三条技术路线的对比,以及每个代表模型的练习题是怎么设计的;
  • 变大之后的四种能力、四个特点,以及三段训练的完整流程;
  • 一个真的能跑通的完整项目,含真实耗时和单卡最低配置,以及怎么训练那个「把文字切成模型认识的最小片段」的零件——它叫分词器;
  • 显卡不够时那套省钱办法的原理和用法。

书里还各给了一个能跑的最小实现,做的是两件「模型之外」的事。 一件是检索:先去文档库里捞出相关段落,再让模型照着这几段回答。

另一件是工具调用:给模型一组现成的函数,让它自己决定该调哪一个。

不覆盖(别指望在这本里找):

缺什么说明
会「想一想再答」的那类新模型前言里提了名字,正文一个字没讲。这是本书之后最大的变化
三段训练里的第三段实操第四章讲了原理,后面的实操只做到第二段。书里自己也承认没做
让模型也能看图、听声音只在「特点」里给了一段概述,没有原理也没有实现
推理部署与加速一个字没讲
一种把模型拆成多个「专家」的结构完全没提,而今天主流开源模型大量采用
评测的方法论列了榜单和题库清单,但没讲怎么设计一次评测、怎么防题目泄漏
安全与对齐(就是让模型的行为和人希望的一致)这一整块研究只在讲第三段训练时点了「安全、有用、无害」六个字

6. 今天读,要补的五处

这本书的正文主体覆盖到 2024 年年中。 下面五处不是它写错了,而是它没交代来源、或者认错了功劳。

书里的说法该怎么补依据
「训练文本量应该是模型参数量的 1.7 倍」(第 05 章)1.7 倍不是一条法则,只是当年那个模型的实际配比。真正的结论来自 2022 年的一项研究:模型每翻一倍,训练数据也该翻一倍,大致落在 20 倍;而书里把这个功劳记给了晚一年发布的另一个模型《Training Compute-Optimal Large Language Models》https://arxiv.org/abs/2203.15556(查阅于 2026-08-25)
把「涌现」当成既定事实(第 05 章)它是一个有名字、有出处、也有反对意见的主张:2022 年正式提出,2023 年被反驳——所谓突变可能只是评分尺子不连续造成的错觉《Emergent Abilities of Large Language Models》https://arxiv.org/abs/2206.07682 与《Are Emergent Abilities of Large Language Models a Mirage?》https://arxiv.org/abs/2304.15004(均查阅于 2026-08-25)
四个被换掉的零件(第 06 章)书把它们当「人家就是这么写的」直接实现,四篇原始论文一篇都没引。这四样各有明确的取舍理由,而且性质完全不同见第 06 章各节脚注
一句解释「它为什么省」的话译反了(第 08 章)原文说的是:当你用的正好是那种要给每个参数额外记一笔账的训练办法时,这个方法才省得特别多——因为被固定住、不参与训练的那些参数不必记账。中译读起来却像是「这个方法自己会去用那种办法」,方向反了。第 08 章原样纠正《LoRA: Low-Rank Adaptation of Large Language Models》https://arxiv.org/abs/2106.09685(查阅于 2026-08-25)
「先思考再行动」一笔带过(第 09 章)这个框架有正式出处和实证结果:它靠去一个真实的百科网站上查资料,压住了纯靠自己想的那种做法里的编造和错误传播《ReAct: Synergizing Reasoning and Acting in Language Models》https://arxiv.org/abs/2210.03629(查阅于 2026-08-25)

判断(我们的,不是书里的): 上面五条有一个共同点—— 绝大多数不是知识错误,是「省略了出处」。 这正好是「教程」和「教材」的差别: 教程为了让你尽快能动手,会把「谁最早提的、当时的对手是谁、代价是什么」全部略掉。 好处是快,坏处是你学到的是结论而不是判断力—— 下次遇到一个新零件,你没有工具去判断它值不值得用。 如果错,会错在: 如果读者本来就只想跑通流程、不打算做技术选型, 那这些省略就是正确的取舍,我们补的东西对他是负担。

7. 我们的判断

判断(我们的,不是书里的): 这本书今天的价值排序是—— ① 第 02、03 章那两段讲解(中文材料里第一梯队) > ② 第 06、07 章的动手全流程(独一份) > ③ 第 04 章的模型综述(好,但同类材料很多) > ④ 第 09 章的应用(已经落后于现在的工具链)。 引用它的时候引 ① 和 ②,别引第 09 章的具体做法。 如果错,会错在: 如果读者的目标是做应用而不是理解内部,这个排序正好要倒过来—— 对他来说第 09 章那点最小实现反而是最快的入口。

判断(我们的,不是书里的): 这本书最值得带走的思维方式,是它讲每一代做法时的那条隐线—— 每一次技术跃迁,都是有人指着上一代的死穴说「这个绕不过去,得换个东西」。 新做法取代旧做法,不是因为它「更先进」,而是因为旧做法那几个毛病是结构性的、修补不掉的。 遇到一个新方法时,值得先问的不是「它有多强」,而是**「它替掉的那个东西,死在哪」**。 答不上来,说明这个新方法可能只是换了个写法。 如果错,会错在: 有些进步确实只是量变(数据更多、显卡更多),没有前一代的「死穴」可指。 硬要给这类进步找一个被解决的结构性缺陷,就会编出一个不存在的故事。

判断(我们的,不是书里的): 读这本书要注意区分三个声音—— 作者的转述(占绝大部分,措辞肯定,很少标注不确定性)、 作者明确标注的推测(全书只有寥寥几处,比如「据推测,这种能力可能来自对代码的训练」)、 以及没有标注、但其实是一个主张的地方(比如把「涌现」当成既定事实)。 我们的拆解里凡是第三类都单独点了出来。 如果错,会错在: 如果把我们标出的「其实是主张」当成「书写错了」, 就会低估这本书——它在教程这个体裁里已经算相当克制的了。

8. 兑现表

全书每一处「第 N 章讲」「后面会看到」都记在这里,并且逐行核过: 那一章真的讲了吗?讲的是不是许诺的那件事?

这张表故意不用术语——它是给还没读正文的人看的账本, 每一行只写「许了什么、去哪儿还」,具体的名字留在那一章里。

许诺在哪许了什么应兑现在哪
本页 §主线 ④语序怎么补回去、整机还差哪几个零件03 §8,以及 §4–8 那五个零件
本页 §主线 ⑦「突然冒出新能力」这件事双方的证据05 §3
本页 §主线 ⑧第三段训练为什么贵到大多数团队做不起05 §11.5「代价极高」那一段
本页 §主线 ⑨四个被换掉的零件逐个讲透06 §3–6,外加 §8 那张总账表
本页 §主线 ⑪省钱的那个办法为什么省得掉08 §7.3–7.4 那四级台阶,以及 §7.8
01 §1三种切法各给一个例子说清差别07 §3.2 三行对照表,以及 §3.2.1 那份五个词的迷你语料
01 §2「掰弯」那一步叫什么、为什么非它不可03 §4 那一行:「没有它,堆多少层都等价于一层」
01 §8讲那个「只读不写、专门负责读懂一句话」的模型04 §3 整节
01 §10那个动作具体怎么算、公式怎么推出来02 全章,尤其 §4–7
02 §10那块遮布决定两条路线的全部差别04 §6.2 那张对照图
02 §13 ①两笔账拆开算06 §5 那张 512 / 4096 对照表
02 §13 ②语序信息怎么补回去03 §8 整节
03 §3「所有任务都能写成文字进、文字出」会变成一个模型的核心主张04 §5.3
03 §7具体怎么切、怎么训出那张表07 §3 整节
03 §8这个零件在第 06 章会被换掉,以及为什么换06 §4
03 §12 ①让好几个查询共用一份中间结果,省的是另一笔账06 §5(同上)
04 §3 开头大模型和上一代的差别在体量和新能力05 §2,以及 §3–7 那四种新能力
04 §3.5为什么只把语料过一遍、一次喂进去的条数还那么多05 §9.2.1(本轮新补,原先是欠债)
04 §5.1为什么省掉「减平均值」这一步是安全的06 §3,含论文出处
04 §5.3从「固定前缀」到「读懂自然语言要求」中间发生了什么05 §5
05 §2「突然冒出新能力」是什么,下一节讲05 §3
05 §5那种能自己拆解目标、调工具办事的程序是什么09 §5 整节
05 §7语序信息改成「转个角度」那一处具体怎么做06 §4
05 §10.5「哪些位置算分」这件事,第 07 章会实际写07 §4.3–4.4,含逐位 0/1
07 §1书里那个程序靠调外部函数解决「数字母」09 §5.5 第一段真实对话
07 §3.5那套排版格式会在第 08 章再出现,并决定微调成败08 §5.3
07 §8 ③「怎么量它行不行」是第 09 章的内容09 §3

逐行核下来,有两处核不过。本轮都处理了:

原先的许诺核出来的问题怎么处理的
02 / 03 原写「后面第 05、06 章背后都是这条平方关系」说反了。 第 06 章讲的那笔账是按长度成正比地涨,不是平方;而第 05 章讲上千张卡算的是另一回事,和句子多长无关把话改准成「两笔账拆开算」,并且在 06 §5 真的补上了那张对照表
01 / 03 原写「第 07 章会讲透」「是第 07 章整章的内容」支票开大了。 那件事在第 07 章只占一节,而且原先只有一张三行表、没有任何实走一边把话改准(改成「第 3 节」),一边07 §3.2.1 真的补了一份五个词的迷你语料走一遍

拆解写于 2026-08-25,依据 Datawhale 开源的 Happy-LLM PDF 版(七章正文)。 原始书籍文件不入库,本组文档是我们自己的重写; 每条引用都可用 node scripts/book-verify.mjs happy-llm 回核。

Footnotes

  1. 出处:「🤝 如何贡献」第 33 段(text/03-fm.txt:33,搜「宋志学」)与第 37 段(text/03-fm.txt:37,搜「朱信忠」)。项目的自我定位见「🎯 项目介绍」第 12 段(text/01-fm.txt:12,搜「Datawhale」):由 Datawhale 推出,目标是「帮助大家深入理解大语言模型的原理和训练过程」;方法论写成「授之以鱼,更授之以渔」(text/01-fm.txt:17,搜「授之以」)。

  2. 出处:「前言」第 2 段(text/04-fm.txt:2,搜「2022年底」)与第 22 段(text/04-fm.txt:22,搜「DeepSeek-R1」)。前言里点名了 DeepSeek-R1 与 Qwen-VL,以及「从『百模大战』到『Agent 元年』」的说法,可以据此判断定稿时间。补充(不在书里):DeepSeek-R1 的论文首次公开于 2025 年 1 月 22 日,来源:《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》https://arxiv.org/abs/2501.12948(查阅于 2026-08-25)。

  3. 出处:「📖 内容导航」第 47 段(text/02-fm.txt:47,搜「Python」)。原文的要求是「需要具备一定的编程经验,尤其是要对 Python 编程语言有一定的了解」,并且「最好具备深度学习的相关知识」。

  4. 出处:「5.3.6 使用模型生成文本」第 204 段(text/18-ch05-03-5-3-6.txt:204,搜「215.127」)与第 242 段(text/18-ch05-03-5-3-6.txt:242,搜「8卡4090」)。原文给的开销是:八张 4090 显卡,预训练 46 小时,在 350 万条中文指令上再训 24 小时;单卡最低配置是批大小为 4 时占 7GB 显存、预计 533 小时。