跳到主要内容

一本书读懂大模型 — 全书拆解

30 秒导读: 这是一本 15 万字的产业读物,由中国电信研究院天翼智库的大模型研究团队写于 2024 年年中。

先说清它不是什么: 它不是讲原理的书。它讲「ChatGPT 是怎么造出来的」那部分只够入门, 想搞懂机制别看它。 (这一行里说的模型——就是「一台从海量数据里学出规律、再拿这规律干活的程序」; 「大」说的是它内部可以拧的数多到千亿级。)

它真正不可替代的是: 一份把整门生意串起来的中国视角快照—— 造一个模型要花多少钱、这笔钱怎么算、哪些行业真的在买、卖出去的钱最后进了谁的口袋、政府打算怎么管。 这些内容在讲原理的书里一个字都没有。

本组文档是我们重写的完整拆解,八章。读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者中国电信研究院天翼智库大模型研究团队——一个国有电信运营商的研究机构,不是高校、也不是做模型的公司1
成书时间2024 年年中。推荐序署 2024 年 5 月;书里的统计数字大多截到 2024 年 3 月底2
内容八章,从 AI 的来历、核心技术、要用到的设备,一路讲到行业落地、这门生意的结构、监管与展望3
自称的特色跨学科——技术、商业、产业、政策、监管五个面一起讲,面向没有技术背景的读者4

三件事必须先说,否则会误读这本书:

第一,它是一份 2024 年年中的快照,不是教材

书里的数字有明确的保质期。先认一个名字: ChatGPT 背后那个模型系列叫 GPT, 第几代就在后面缀个数字——GPT-4 是第四代,GPT-3 是第三代,下面那张表里两个都会用到。

还有一道手续也得先说: 一个模型在我国要面向公众开张, 得先向监管部门登记、审核通过才行,这道手续叫备案。

于是书里这几个数是这样的,每个后面都得配一个可比的量才读得出分量5:

书里的数拿什么比
GPT-4 的参数(模型内部那一大堆可以拧的数,数量越多个头越大)「超过 1 万亿它的上一代 GPT-3 是 1750 亿,两代之间翻了五倍以上
国内完成备案的大模型「117 个书里另一处说 10 亿参数以上的模型有 100 多个——也就是说,做出来的模型几乎都去备了案
面向具体行业做的大模型「341 个是上一行那 117 个的近三倍——这一行真正的量在行业那一侧,不在通用模型那一侧

这三个数都是当时数出来的存量。

判据只有一条:凡是带「截至某年某月」的句子,今天都只能当史料读; 凡是讲「为什么只能这么做」的段落,今天仍然有效。

而且成书的时间点很特殊:它写在「会先想一会儿再回答」的那一类模型出现之前。 2024 年 9 月之后出现的这类模型,以及它引发的整个行业重新算账,全书一个字都不可能提到。

第二,作者是这门生意里的直接参与方,而且是国有企业

这一点不点破,书里很多段落会被误读成中立分析。

中国电信自己就是大模型玩家:书里出现的星辰大模型、启明网络大模型、天翼云慧聚平台、 上海临港的万卡机房、中部与京津冀两个专门堆芯片的机房(这种专门堆 AI 芯片的机房行话叫智算中心; 算力指的是一堆芯片在单位时间里能做多少次运算),都是作者所在企业的产品6

推荐序更是直接写明中国电信要做「智能算力的主要服务商、基础通用大模型的先行者、行业大模型的主导者」7

这会往哪个方向偏,是可以预判的:

书里的倾向和作者位置的关系
大量篇幅论证机房和芯片这一层是决定因素电信运营商正是建机房、卖算力的那一方
强调把模型装进客户自己的机房、数据不外流运营商的政企客户正是这类需求的买方
反复出现政务、工业、医疗这些卖给机构的行业这些是运营商的传统客户盘
收入预测里机房和芯片这一层拿走 50%–70%这个结论对作者所在的一侧最有利

这不等于书写错了。 它的论证基本站得住,数据也标了来源。 但读的时候要把**「事实」「第三方预测」「作者的倾向」**三样分开——本拆解全程做了这个区分。

第三,书里有四个声音,必须分开

声音出现在哪我们怎么标
正文作者(天翼智库团队)全书主体默认
推荐序作者(邵广禄,2024 年 5 月于北京)「推荐序」「这是推荐序作者的说法」
被引用的第三方(IDC、麦肯锡、Gartner、信通院、亿欧、智研瞻、罗兰贝格……都是市场调研或咨询公司)遍布全书,尤其行业与产业两章「这是某机构的预测,不是作者的判断」
我们——判断块

第三个声音是这本书最需要警惕的地方。 书里大量结论性的数字—— 「2030 年政务大模型市场 6612.78 亿元」「AI 将为全球经济带来 35.6 万亿美元」—— 都是咨询公司的预测,不是已经发生的事实,而书里往往和事实并排陈述,不加区分。

2. 全书一条主线(读完这一节,你就懂了这本书)

这本书表面是八个独立主题,底下是一条从「东西怎么造出来」走到「这门生意怎么做」的链子。 下面把它完整走一遍——不看后面任何一章,只读这一节,你也能把这本书讲给别人听。

细节全部留给对应章节,这里只讲「发生了什么、为什么只能这样」。

① 它先给整个行业画了一条时间轴

这本书讲的东西叫大模型——就是 ChatGPT、文心一言这类你输一句话、它回你一段话的程序 (英文缩写 LLM,即 large language model,直译叫「大语言模型」)。 书没有一上来讲它怎么造,而是先给整个人工智能行业画了一条时间轴:

只会照人写死的规矩办事 → 能看能听能说 → 能理解会推理 → 能自己定目标、自己干完

图说:这条轴量的是「机器表现得多像人」,不是「用了什么技术」。
书说我们现在站在第三格,第四格「尚未在实际中应用」。

这条轴是全书的坐标系,后面七章都往它上面挂。 但它同时是全书最不该照抄的一段——这一章的史实错误最密集,第 01 章会逐条点出来。

② 让第三格成立的不是一个发明,是一串补漏

最容易犯的错,是以为大模型靠的是某一项突破。不是。

书把它拆成五样东西,而这五样是一个接一个被逼出来的: 先有一种新造法让机器读长文章不再丢三落四、而且能同时开动上万块芯片一起算; 造出来的东西什么都懂一点、什么都不精,于是要再调一遍;

调完它会说话了,但说的不一定是人想听的,于是要请人来打分; 打完分它听话了,但个头太大跑不动,于是要瘦身; 瘦下来跑起来了,但什么都往外说,于是要加约束。

每一样都是在补上一样留下的窟窿。中间断一环,后面全部落空。(怎么补的,第 02 章讲。)

③ 这五样东西全都要烧钱,而这笔钱是可以算出来的

这是全书最有价值的一段,也是它区别于所有科普书的地方。

书从「机器学习——让机器自己从数据里找规律,而不是人把规则写死——到底在做什么运算」 推出两条极简的算式, 让你能拿一个模型的规模、一天多少人来用、每人一天问答几次, 十分钟估出它需要多少张显卡、要烧多少电。

算出来的结果有一个反直觉的地方:

训练(把一个模型从数据里练出来的那个过程)只花一次钱, 而上线之后每天回答问题的开销,比训练还大得多。

书举的那道题里,训练要六千多张顶级显卡跑一天,上线之后每天要一万三千多张显卡不停地转8

这条结论直接决定了后面所有的生意判断。(算式长什么样、怎么用,第 04 章讲。)

④ 钱花下去还不够,还得有电、有地方放、有数据

顺着钱往下推,一路推出四堵墙:

一张显卡不够 → 得成千上万张一起干 → 它们之间来回传数据反而成了新瓶颈
→ 这么多机器得有地方放,还得散热 → 风扇吹不动了,只能泡到液体里降温
→ 最后卡在电费上:马斯克说两年内会从「缺芯片」变成「缺电」[^9]

图说:每一堵墙都是被上一堵推出来的,不是有人事先规划的。

而另一头的数据更紧张:能拿来喂给机器读的高质量文字,快用完了。 书引的预测是 2026 年就见底9。 于是这一行开始做一件听起来很怪的事——用机器造出来的假数据,去训下一个机器。

⑤ 钱和数据堆出来的本事,书归成四条

看得懂、写得出、想得清、记得住。

四条里最值得带走的是最后一条,因为它解释了那个所有人都遇到过的毛病: 它会一本正经地编。

书说得很到位:这些知识不是像文件一样存在硬盘里,而是被压进了上千亿个数之间的计算关系。 而压缩会丢东西,先丢的永远是罕见的那些——一个页码、一个人名、一条法条的编号。

丢掉之后,它并不知道自己丢了什么。 它手上永远有一张「下一个字最可能是什么」的清单,清单上永远有分数最高的那一项 (这个「有多大可能」行话叫概率),所以它永远答得出来,而且答得读着通顺。

于是编造不是它坏了,是这套存取方式的必然产物——书明确说这无法完全避免10

(这四条各自是什么、这三级台阶各自凭什么,第 05 章讲。)

⑥ 本事要变成产品,先看人和机器谁做主

书给了一条特别好用的分法——不按产品长什么样分,按机器承担多少活儿分11:

谁做主什么样
人做主你说一句,它做一件。它是个听话的工具
五五开它是个有想法的搭档,你写它改,它写你改
它做主你只给一个目标,剩下的它自己拆、自己干、你验收

顺着这条轴往前一步,书押了一个很大的注: 大模型会取代搜索引擎(那种按关键词给你一串网址的东西),成为人们上网的第一个入口。 理由是它把「一个个点开链接看」和「自己把几个网页拼起来」这两步替用户做掉了12

但这一脚会踩碎搜索引擎的饭碗: 它的界面上没有一排排的结果,按出价排名卖广告这套机制在结构上就不存在了; 而回答一次问题的成本,比搜一次贵一个数量级13。(第 05 章讲透。)

⑦ 到了行业里,五个行业其实在做同一件事

书用五章分别讲了五个行业,但骨架完全一样。 真正的差别只有一条:这件事错了要不要紧。

错了没关系 ─────────────────────────────→ 错了出人命 / 赔大钱
客服、写稿、查资料 整理、分析、给建议 看病、放贷、控制机床
已经用上了 正在试 老办法还得留着

图说:大模型先吃掉「错了没关系」的活儿,精确的活儿仍然交给老办法。

工业那一章讲得最实在:新旧两种做法会长期共存,因为听声音判断机器故障、 看画面挑次品这类活儿,老办法至今更好用14。(第 06 章讲。)

⑧ 这门生意分三层,而钱会往两头走

上游是芯片和机房,中间是做模型的,下游是做产品的。书给了一份收入分配的推测15:

芯片和机房这一层拿 50%–70% · 做产品的拿 30%–40% · 做模型的拿 0%–10%。

做模型本身几乎不赚钱,因为打价格战避不开——书直接算出当时的定价已经贴着成本。

由此推出全书对中国市场最硬的一条判断: 「百模大战」的下半场会从「秀本事」转向「换成钱」,模型的数量会急剧减少。 书引李彦宏那句话来收尾:「我们需要 100 万量级的 AI 原生应用,但不需要 100 个大模型。」16

⑨ 最后是「别出事」这一侧

书列了四类祸:数据泄密和有害内容、版权、伦理、饭碗与公共安全17

各国的思路出奇一致——尽量少设门槛,把力气放在事中和事后; 方式上「边发展边治理、边摸索边修正」; 抓手是请第三方来考它,看它到底有多大本事、有多少风险18

⑩ 全书的落点

一句话:

技术这一关已经过了,接下来决定成败的不是模型有多聪明, 而是电费够不够便宜、数据能不能用、行业愿不愿意买、监管允不允许。

这就是这本书和所有讲原理的书最大的分歧点,也是它唯一不可替代的地方。

3. 八章地图

这张表不用记任何术语——每一章后面写的是「读完你能回答什么问题」。

读完你就能回答
01 那把尺子满天飞的「AI 几点零」是谁定的、按什么分的?这一章还告诉你这本书哪几句话不能照抄
02 五样东西ChatGPT 这类东西是怎么一步步造出来的?为什么少一步都不行?
03 下一步2024 年这行的人押注什么?两年过去,押中了哪些、押空了哪些?
04 账本一个模型要多少张显卡、烧多少电?这笔账怎么自己算一遍? 数据快不够用了怎么办?
05 本事与产品它为什么写得了文章却算错数、还会编?这些本事怎么变成你手机里的东西?
06 行业剧本医院、电视台、银行、政府、工厂上大模型,哪一步最容易卡住?为什么老办法还不能扔?
07 钱的流向这门生意的钱最后进了谁的口袋?为什么做模型的那一层几乎不赚钱?
08 祸与管它会闯什么祸?各国政府打算怎么管?管得住吗?

推荐顺序: 01 → 02 → 04 → 05 → 06 → 07 → 08,03 可以最后读。 只想拿结论的话: 读本页第 2 节,加 04、07 两章就够——那两章是这本书唯一别处不太找得到的东西。

4. 这本书覆盖什么、不覆盖什么

覆盖(而且是同类书里少见的):

  • 一份完整的中国大模型行业快照:哪些公司在做、散落在哪些城市、备案了多少个、怎么部署、政府在招什么标;
  • 一套能自己重算一遍的成本测算:从最基本的运算次数推到算式,再推到具体的显卡张数与电费;
  • 数据从哪来的四个环节:去哪儿采、怎么加工、不够了怎么造、模型不知道的事怎么临时喂给它;
  • 五个行业的落地细节:医疗、媒体、金融、政务、工业,场景拆得很细,案例都是实名的;
  • 这门生意分几层、钱怎么分,以及「把模型当成水电一样按用量卖」这套模式的来龙去脉;
  • 中外监管思路的对照:欧盟的法案、美国的行政令、我国的暂行办法,以及「软硬两手」的整体思路。

不覆盖(别指望在这本里找):

缺什么说明
像样的原理讲解只讲了个大概。想搞懂机制,这本书不够用
模型的个头和喂给它的数据量该怎么配全书只强调「个头越大越强」,没有一处提到数据量要跟着一起放大——这是最要紧的一处缺口
会先想一会儿再回答的那类模型写在 2024 年中,而那类模型是同年 9 月之后的事
让模型自己干活的工程现实讲了愿景和案例,但「它怎么调外部工具」「多步任务怎么保证不出错」一个字没有
公开可下载的模型生态只说了「公开的和不公开的会长期并存」,没有具体家族、授权条款、社区这些实际信息
失败案例全书几乎只有成功案例。没有一个「上了大模型然后效果不行」的记录

5. 今天读,要修正的五处

这本书写于 2024 年年中。 下面五处不是它写错了,而是它没跟上、或者当时就搞错了每一条凭什么这么说——哪一篇论文、谁写的、哪一天发的——都在对应的章节里写着, 这里只说「要改什么」。

书里怎么说今天该怎么改详见
模型个头每年至少长 10 倍补一句:个头和喂给它的字数必须一起放大。这本书出版前两年就有人指出,当时的大模型普遍「个头太大、读的字太少」。全书没有一处提到这件事,这是它最大的技术缺口第 04 章
「个头长到某一步,它就突然会了一样谁也没教过的本事」被当成既定事实这件事有争议:换一种打分方式,那个「突然」就不见了。当描述用没问题,当解释用是空的第 05 章
「让它把中间步骤写出来」只是一种提问技巧方向对,但它已经从提问技巧变成了训练目标——现在是训出来的习惯,不必再靠提问诱导,小的模型也能被训出来第 05 章
「临时喂资料」这套做法没给名字步骤书讲对了,但它早就有正式名字,而且那篇论文比这本书早四年。拿不到这个名字,读者就搜不到后面四年的全部研究第 04 章
美国的监管靠拜登那道行政令已经作废:那道令在 2025 年 1 月被撤销,换成了一道方向相反的。书说美国治理体系「逐步成熟」,而它依据的东西已经不存在了第 08 章

判断(我们的,不是书里的): 这五条里,前两条最要命,因为它们不是「过时」,是当时就该知道。 讲「个头太大、读的字太少」那篇比本书早两年,质疑「突然就会了」那篇早一年,两篇都是当年的热门工作。 这说明这本书的取材方式是「综述产业动态」,不是「梳理研究前沿」—— 它读的是咨询报告和新闻,不是论文。 如果错,会错在: 如果作者是有意省略(比如认为对非技术读者没必要), 那这是取舍不是疏漏——但书里没有交代,我们无从判断。

6. 我们的判断

判断(我们的,不是书里的): 这本书今天的价值排序是—— ① 这门生意的结构和算账方式(仍然有效) > ② 2024 年的行业快照(史料价值) > ③ 技术原理讲解(直接跳过)。 引用它的时候引①和②,技术定义千万别引——第 01 章里就有若干处硬伤。 如果错,会错在: 如果这门生意的结构本身发生了质变(比如回答一次问题的成本降到某个临界点, 让芯片和机房不再是最贵的一环),那①里的收入分配判断也要跟着修正。 判据是:同样一次问答,今天「上线之后每天的开销」还是不是占大头。

判断(我们的,不是书里的): 全书最该带走的一件事,是它把「算力」从一个形容词变回了一个可以算的数。 书给的那两条算式,配上「一天多少人用、每人问答几次」, 十分钟就能估出一个产品要多少张卡、烧多少电。这个习惯比书里任何一个结论都值钱。 如果错,会错在: 这两条算式只覆盖了最主要的那部分运算, 漏掉了「句子越长、开销涨得越快」的那一块。 句子很长的时候(长文档、长对话),实际成本会明显高于估算——估出来的是下限,不是实际值。

判断(我们的,不是书里的): 读这本书要一路盯着「这句话是谁说的」。 全书大量结论性数字来自咨询公司的预测(IDC、麦肯锡、Gartner、亿欧、智研瞻、罗兰贝格……), 而书里把它们和已经发生的事实并排陈述,不加区分。 我们的拆解里凡是这类数字都单独标了出处机构和「这是预测」。 如果错,会错在: 如果把这些预测当成作者的判断去引用, 就会把一份产业综述读成一份行业承诺——那是这本书最容易被误用的地方。

判断(我们的,不是书里的): 这本书没有一个失败案例,这件事本身就是信息。 五个行业章节里每一个案例都是「效率提升 X%、成本下降 Y%」,数字全部来自厂商官宣。 一份 2024 年的产业报告里没有任何「试了但没成」的记录,只能说明它的取材来自宣传口径。 如果错,会错在: 如果这本书的定位本来就是「向产业界和决策者介绍机会」而非「评估风险」, 那这是体例问题不是诚信问题——但它的书名和自我定位是「全面、客观、深入」,那就该有反面材料。

7. 兑现表:每一处「后面讲」都记在这里

这份拆解里凡是往后指的话——「第 N 章讲」「后面会讲」「见第 N 节」——都在下表记一行。 逐行核过两件事:那一节真的讲了吗?讲的是不是许诺的那件事,而不是同名的另一件事。 这张表是拿来核对的,不是拿来读的——右边一列写到节为止,不必现在弄懂它讲的是什么。

总纲往后指的

许诺在哪应兑现在哪
本页 §2① 「这一章的史实错误最密集,第 01 章会逐条点出来」01 §8「这一章哪几处不能信」——四处硬伤逐条列表
本页 §2② 「(怎么补的,第 02 章讲。)」02 §2 到 §6,五样东西各占一节
本页 §2③ 「算出来的结果有一个反直觉的地方」04 §5 末「这道题真正的结论」——训练只花一次钱,回答问题天天花
本页 §2③ 「(算式长什么样、怎么用,第 04 章讲。)」04 §4「两条算式:全书最值钱的一段」+ §5「拿它算一道题」
本页 §2⑤ 「这四条各自是什么……第 05 章讲」05 §2 开头(这四条是书自己在 4.1 节归的,依据是它列的 481 个细分任务)+ §4 到 §7 各讲一条
本页 §2⑤ 「这三级台阶各自凭什么,第 05 章讲」05 §7「于是编造是必然的,不是故障」——三级台阶各占一段
本页 §2⑥ 「(第 05 章讲透。)」05 §11「入口要换人」,含「顺手砸掉的东西:按出价排名那套广告」
本页 §2⑦ 「(第 06 章讲。)」06 §6 工厂那一段末「新旧两种做法会长期共存」
本页 §6 判断 「第 01 章里就有若干处硬伤」01 §8,同上
本页 §5 表「模型个头每年至少长 10 倍 → 第 04 章」04 §12「一处必须补上的缺口:模型和数据要一起放大」
本页 §5 表「『个头长到某一步就突然会了』被当成既定事实 → 第 05 章」05 §3——整节在讲这件事其实有争议
本页 §5 表「『让它把中间步骤写出来』只是提问技巧 → 第 05 章」05 §6 末「两年之后:它已经不是提问技巧了」
本页 §5 表「『临时喂资料』这套做法没给名字 → 第 04 章」04 §10 第④小节——那套做法的正式名字与原始论文
本页 §5 表「美国的监管靠拜登那道行政令 → 第 08 章」08 §7「美国:书写的那套,今天已经不成立了」
本页 脚注 10「这份预测后来被作者本人修订过,详见第 04 章」04 §10 第③小节里的「补充(不在书里)」一段

各章之间往后指的

许诺在哪应兑现在哪
01 §5 「把这个底子再拿少量专门数据训一遍这件事,第 02 章第 3 节讲」02 §3——整节讲这件事,含在同一条走查上的那一步
01 §6 「第 02 章整章讲它」(那种让每个词一步看到全句的新造法)02 全章,重点在 §2
01 §6 「后来赢的是 GPT 那条路——为什么,第 02 章讲」02 §2 讲「两条路线为什么分了家」那一小节,含补上的那一级台阶
01 §6 「第 02 章讲那套做法时,喂进去的就是『把词变成一串数』这一步的产物」02 §2 主走查第 1 步(「猫」那串数 0.31 / −0.12 / 0.88)
01 §6 「这处缺口第 04 章会算给你看」(定义只提个头、不提读了多少字)04 §12「一处必须补上的缺口」
01 §6 「这一点第 06 章会讲透」(通用和行业的实际差别)06 §3 三步走第①步——拿这一行攒下的大量文字材料再训一遍
01 §10 「这是全书最要紧的一处缺口,第 04 章会详细讲」04 §12,同上
01 §10 「但没提这件事在学界有争议——第 05 章会补上」05 §3 引的那篇 2023 年 4 月的反驳论文
02 §1 「每一环各是什么,下面五节各占一节」02 §2 到 §6
02 §5 「第 06 章工业那一节里,第三波要求模型直接跑在产线设备上」06 §6 工厂那一段「三波次」表第三波「生产制造」那一格(这句话已补上)
02 §6 「第 08 章第 9 节讲请第三方来考它时会再碰到这个前提」08 §9 判断块(已补上:第三方要评的正是「合不合人的偏好」,而这个前提没被证明过)
02 §8 「这几步各是什么、各要花多少次运算,第 04 章第 4 节讲」04 §4「训练在做哪三件事」+「数一数每一步要做多少次运算」
03 §2 走查 「『怎么调这个工具』正是书完全没讲的那一层,见第 5 节」03 §5 末「这一节最大的缺口」
03 §2 走查 「下面第 3 到第 7 节,把这五步各自展开」03 §3 到 §7
04 §1 「第 07 章讲这门生意怎么分钱」07 §9「收入怎么分」
04 §4 「第 07 章讲计费时会再碰到它」(按字收钱的那个「字」)07 §8「按字计费这件事,当时有多乱」
04 §9 「第 06 章和第 07 章都会再碰到它」(把模型连机器一起打包卖)06 §4 部署表第一行 + 07 §7 第③种模式里「卖软件加硬件」那一支
05 §2 走查 「第 07 章第 8 节会看到:混元一块约 1.8 个汉字」07 §8 那张各家计价表
05 §2 走查 「这条走查后面还会用到四次:第 4、6、7、8 节」05 §4(靠线索词蒙分)、§6(多吐 14 个字)、§7(编出页码)、§8(三种模式各自兜不兜得住)
05 §6 「第 07 章第 8 节讲按字计费时会把这 14 个字折成钱」07 §8 末段(已补上:每天多付 336 元、一个月约 1 万元)
05 §9 「第 06 章讲媒体行业那三条风险时,会再碰到这一条」06 §6 电视台那一段末尾(已补上:同一个基座既决定写什么、又决定推给谁看)
06 §2 走查 「第 3、4、5、6 节都会回到这次门诊」06 §3(三步各是什么)、§4(为什么只能装进医院自己的机房)、§5(为什么只能走到第③步)、§6(别的行业的第①步)
06 §6 「同时吃进好几种信息这件事,见第 03 章」03 §4——整节讲「一起看」和「翻译过去」这两件事
06 §9 「只有第 08 章会从宏观角度碰一下就业冲击」08 §6 里的「就业」那一小段
07 §2 走查 「按次卖模型能力这门生意的来历,第 6 节讲」07 §6「一种新的卖法:把模型当水电按用量卖」
07 §2 走查 「第 10 节讲『公开可下载的模型和不公开的模型』时那笔账」07 §10 末「另外两条趋势」第二条
08 §2 走查 「第 11 节那份愿景里,没有一句话对应这一步」08 §11「原书最后一章:那是一份愿景,不是分析」

逐行核过之后,有三处原来指错了地方,已经改掉:

  • 05 那句「第 07 章讲计费时会再碰到」,原本指到的是同名的另一件事(计量标准不统一); 现在 07 §8 末尾真的把「多吐那 14 个字」折成了钱;
  • 05 讲信息茧房那句原本指向第 08 章,而书里媒体那三条风险在第 06 章;
  • 02 讲压缩那句原本指向第 06 章一个不存在的段落,现在那句话补进了工厂那一段的三波次表。

拆解写于 2026-08-25,依据 2024 年版《一本书读懂大模型:技术创新、商业应用与产业变革》。 原始书籍文件不入库,本组文档是我们自己的重写; 每条引用都可用 node scripts/book-verify.mjs yi-ben-shu-du-dong-da-mo-xing 回核。

Footnotes

  1. 出处:「推荐序」第 34 段(text/01-fm.txt:34,搜「天翼智库」)。原文:「中国电信天翼智库大模型研究团队长期跟踪大模型技术的最新进展……他们以这些成果为主体,完成了本书的写作」。反馈邮箱与公众号也都是中国电信的(出处:「前言」第 103 段(text/02-fm.txt:103,搜「天翼智库」))。

  2. 出处:「推荐序」第 40 段(text/01-fm.txt:40,搜「2024年5月于北京」)。正文的统计截止时间见「5.1 我国大模型行业应用全景」第 16 段(text/22-ch05-01-5-1.txt:16,搜「国内已发布341个行业大模型」),口径是「截至 2024 年 3 月 30 日」。

  3. 出处:「前言」第 40 段(text/02-fm.txt:40,搜「本书共分为8章」)。

  4. 出处:「前言」第 70 段(text/02-fm.txt:70,搜「跨学科的视角」)。作者自列的三个特色是:实战与理论结合、前瞻性视角、易读性。

  5. 出处:「前言」第 25 段(text/02-fm.txt:25,搜「GPT-4的参数规模已经超过1万亿」)与第 28 段(text/02-fm.txt:28,搜「截至2024年3月28日」,备案 117 个)。补充(不在书里,来自通用知识):GPT-4 的规模 OpenAI 从未公开,「超过 1 万亿」是业界流传的估计值,书里当成事实陈述了。

  6. 出处:「3.1.3 大模型一体机」第 185 段(text/14-ch03-01-3-1.txt:185,搜「天翼云慧聚」)、「3.1.2 智算中心」第 157 段(text/14-ch03-01-3-1.txt:157,搜「中国电信中部智算中心」)与第 168 段(text/14-ch03-01-3-1.txt:168,搜「上海临港智算中心」)、「5.1.2 行业大模型技术和部署路线」第 74 段(text/22-ch05-01-5-1.txt:74,搜「启明」)。

  7. 出处:「推荐序」第 31 段(text/01-fm.txt:31,搜「中国电信积极践行央企使命担当」)。这是推荐序作者的表述,不是正文作者的说法,但它交代了这本书所处的机构位置。

  8. 出处:「3.1.1 智算集群」第 119 段(text/14-ch03-01-3-1.txt:119,搜「6141张H200 GPU」)。这道题的题设(1750 亿规模、3000 亿字的训练材料、一亿日活、每人每天 10 轮)见同章第 84 段(text/14-ch03-01-3-1.txt:84,搜「日活用户为1亿」)。

  9. 出处:「3.2.3 数据合成」第 52 段(text/15-ch03-02-3-2.txt:52,搜「高质量的语言数据存量预计将在2026年耗尽」)。这是书转述 Epoch AI 研究团队的预测,不是作者自己的测算;这份预测后来被作者本人修订过,详见第 04 章。

  10. 出处:「4.1.4 记忆能力」第 161 段(text/17-ch04-01-4-1.txt:161,搜「这些因素无法完全避免」)。知识被压进参数之间的说法见同节第 158 段(text/17-ch04-01-4-1.txt:158,搜「知识通过建模转化为上千亿参数之间的数学计算逻辑」)。

  11. 出处:「4.2 基座模型的三大应用模式」第 22 段(text/18-ch04-02-4-2.txt:22,搜「它们更多强调的是人机协作模式」)。书特别强调这三种「并不对应某种具体的产品形态」。

  12. 出处:「4.4.2 大模型将引发搜索引擎商业模式变革」第 71 段(text/20-ch04-04-4-4.txt:71,搜「逐个链接查看」)。

  13. 出处:「4.4.2」第 77 段(text/20-ch04-04-4-4.txt:77,搜「竞价排名机制在AI搜索引擎中将不复存在」)与第 86 段(text/20-ch04-04-4-4.txt:86,搜「两者的成本相差10倍」)。

  14. 出处:「5.6.4 大模型将和小模型长期共存」第 165 段(text/27-ch05-06-5-6.txt:165,搜「工业大模型和小模型预计将长期共存」)。

  15. 出处:「6.3.2 产业营收将向应用层与基础设施层倾斜」第 47 段(text/31-ch06-03-6-3.txt:47,搜「应用层的营收分布预计将达到30%~40%」)、第 50 段(text/31-ch06-03-6-3.txt:50,搜「模型层的营收分布预计为0~10%」)、第 53 段(text/31-ch06-03-6-3.txt:53,搜「计算基础设施服务的营收分布预计为50%~70%」)。这是作者的推测,书里也标明是「推测」。

  16. 出处:「6.3.1 百模大战迎来下半场」第 27 段(text/31-ch06-03-6-3.txt:27,搜「我们需要100万量级的AI原生应用」)与第 33 段(text/31-ch06-03-6-3.txt:33,搜「从“展示能力”转向“创造价值”」)。前一句是书转述百度李彦宏的公开表态,不是作者原话。

  17. 出处:「7.1 大模型发展将带来4类风险」四小节标题,见「7.1.1」第 18 段(text/33-ch07-01-7-1-4.txt:18,搜「数据、内容与网络攻击风险」)。

  18. 出处:「7.2.2」第 88 段(text/34-ch07-02-7-2.txt:88,搜「尽可能减少事前准入限制」)与「7.3.2 治理方式:敏捷治理成为主流」第 62 段(text/35-ch07-03-7-3.txt:62,搜「边发展、边治理」)。第三方评测那一条见「7.3.3」第 79 段(text/35-ch07-03-7-3.txt:79,搜「需要第三方评测机构的参与」)。