从一次千亿市值的翻车,进产业篇
这一章讲三件事: 为什么产业篇要从一次翻车讲起; 这个产业分成哪四层;以及最底下两层各自在卖什么。
它在全书链条里的位置: 第 05 章说它会编、而且越准越危险。 这一章把那句判断换算成钱。 第 17、18 章接着往上讲第三层和第四层。
1. 同样是编错一次,创业公司没事,搜索巨头是千亿
这一节是产业篇真正的开头,它比任何一张产业地图都更能说明问题。
时间线只有两个月,请按顺序看:
| 时间 | 发生了什么 |
|---|---|
| 2022 年 12 月上旬 | 谷歌一次全员沟通会上,有员工问:ChatGPT 上线未满一周就收获百万用户,这是否证明谷歌错失了一次重大机会?1 |
| 同一场会 | 那位技术负责人的回答是:这类东西仍然存在一些问题,谷歌有能力提供同样的产品,但如果在产品尚不成熟时就公之于众,产品可能在提供信息时出错,就会招致更大的「声誉风险」——所以谷歌需要**「比小型初创公司更保守」**2 |
| 同一场会 | 首席执行官的表态是:在这个新领域需要兼顾勇气和责任,必须维持好平衡3 |
| 仅仅十余天后 | 首席执行官在公司内部发出了「红色代码」警报,推动多个团队快速集结;他甚至把两位创始人拉进这些会议中,而这两人自 2019 年后就已淡出公司运营4 |
| 2023 年 2 月初 | 谷歌在发布会上展示了同类产品 Bard;Bard 在短短的演示中暴露了一个事实错误——它误认为世界上首张太阳系外行星照片是由詹姆斯·韦伯太空望远镜拍摄到的5 |
| 错误被公众发现后 | 股价暴跌 9%,市值损失千亿美元5 |
| 同期 | 微软发布集成了这类能力的搜索引擎,一个月内下载量增长了 8 倍之多6 |
书里对这件事的解读是两句话,两句都要记住:
第一句是对那位技术负责人的:「接下来发生的事情证明,谷歌是对的。」 Bard 那次翻车完美印证了他的判断——这类东西目前都存在问题7。
第二句是本章的核心:虽然 ChatGPT 也会犯错, 但谷歌作为全球最大的搜索引擎公司,其产品一旦出错,就被公众舆论放大, 其承担的风险将远大于创业公司7。
把第 05 章那条判断换算一下:
| 创业公司编错一次 | 搜索巨头编错一次 | |
|---|---|---|
| 技术上 | 一样 | 一样 |
| 后果 | 用户抱怨一句 | 9% 股价,千亿美元市值 |
| 原因 | 没人指望它准 | 所有人都指望它准 |
这就是「越准越危险」在产业上的价钱: 你越被信任,你犯的每一个错就越贵。
书里还给这件事贴了一个标签:创新者窘境—— 成功的公司往往会被自己现有的市场和客户束缚,而忽视新兴的技术和市场的需求, 从而导致被更具创新力和灵活性的新进入者所颠覆8。 具体到这里:这类应用是搜索引擎的潜在替代品,而它的商业模式尚不明晰; 一旦替代发生,新的收入能不能弥补搜索收入的损失,这是那位首席执行官要考虑的9。 (这笔账在第 18 章会被算得更细。)
2. 四层地图:钱是怎么流的
这一节给出产业篇的骨架,后面三章各占一层或两层。
书里的分法是四层10:
┌─────────────────────────────────────────┐
│ 应用层 直接面对用户 ── 第 18 章 │
├──────────────── ─────────────────────────┤
│ 模型即服务层 把模型包成按次收费的服务 │
│ ── 第 17 章 │
├─────────────────────────────────────────┤
│ 软件基础设施层 三块 ──── 本章第 7–9 节 │
├─────────────────────────────────────────┤
│ 硬件基础设施层 显卡和云 ── 本章第 3–6 节│
└─────────────────────────────────────────┘
这张地图和代序里那张是同一张(第 07 章第 8 节核对过)。
本章讲最底下两层。 先说结论:这两层是这一轮里商业模式最清晰、 也最先赚到钱的两层。
3. 硬件那一层:为什么非显卡不可
这一节先说清楚这一层在卖什么力气。
先立一个词:这一行数算力,数的是「每秒能做多少次带小数点的加减乘除」, 这种运算叫浮点运算。
书里引了一句投资公司的话当题记,这句话说得很直白: 一切数据处理都要经过基础设施厂商之手,他们收割了产业回报; 算力的每秒浮点运算次数成了生成式 AI 的命脉11。
为什么用显卡而不是普通处理器? 书里的理由只有一句: 它擅长并行——就是「同时干很多份一模一样的活」; 而这一行要算的正是那种活12。
书里管那种活叫矩阵运算——矩阵就是一张排成方阵的数表, 成千上万个数排成行和列,一次算一大片。
4. 四个要求,每一个都有数
这一节把那四个要求逐条对上具体的数。
先把三个词讲清楚,不然下面那张表读不懂。
显存:就是那张卡自己身上的存放空间——参数和中间结果都得先搬进去,它才算得动。
带宽:就是「每秒能搬多少数据」,像水管的粗细。
字节:就是数据量的基本单位,一个英文字母大约占一个字节,一个汉字通常占三个。
大模型对这张卡提了四个要求13:
| 要求 | 为什么 | 对应的数(以书里点名的那张卡为例) |
|---|---|---|
| 更高的计算能力 | 规模一大,计算量翻着跟头涨 | 每秒 1979 万亿次 16 位浮点计算14 |
| 更大的显存容量 | 装得下整个模型,就不用频繁去别处取 | 80 GB14 |
| 更快的显存带宽 | 数据要在存放的地方和计算的地方之间快速来回 | 每秒 3.35 万亿字节14 |
| 更高效的多卡通信 | 一张卡装不下,就要拆到多张卡上,卡之间要同步 | 最多可连接 256 张,跨卡通信每秒 9000 亿字节14 |
这张卡有名字,而且你在任何一份机房报价单或显卡规格页上都会撞见它: 书里点名的这一张叫 H100,它的上一代专业卡叫 A10014。
那 1979 万亿次是什么概念? 书里自己给了两个参照物,这是全书最好的一处对照: 索尼那台游戏机的显卡是 10.28 万亿次,A100 是 312 万亿次14。 也就是说:它是那台游戏机的约 190 倍,是上一代专业卡的约 6 倍。
表里最后一行那两个数也要放在一起读:卡之间每秒 9000 亿字节, 而同一张卡内部的显存带宽是每秒 3.35 万亿字节—— 也就是说,卡跟卡说话的速度只有卡跟自己说话的四分之一左右。 这个四分之一就是下一节那个瓶颈的来处。
换成业务上的效果: 以 1750 亿参数那一代(也就是第 02 章那个 GPT-3)为例, 训练速度最高提升 12 倍(与 A100 相比); 在 5300 亿参数那个模型上,每张卡每秒能处理的量比 A100 高 30 倍; 而「你按下去到它开口」之间的那段等待,可控制在 1 秒之内15—— 1 秒大约是你正常说话说出两三个字的工夫(这个参照是我们补的常识,不在书里)。
5. 一台机器装不下,于是网络成了瓶颈
这一节讲一个外行最容易忽略、但决定成败的东西。
书里说得很清楚:一台机器(书里叫计算节点,就是一台装了 8 张卡的机器) 往往装不下,需要连接多台机器一起训—— 这种做法叫分布式训练;这就要求数据中心具备更高的核心网带宽16。
当时的量级:云服务厂商可以提供每秒数百吉比特的核心网带宽, 未来可以达到每秒万亿比特的级别17。
5.1 先说被比下去的那一方:办公室里那根网线
这一小节只讲一件事:平常机器之间是怎么说话的。
办公室、机房里那根网线用的是一套通行了几十年的收发规矩,这套规矩叫以太网。
在它上面还叠着另一套规矩,管的是「这段数据发给谁、走哪条路、丢了怎么重发」。 这套规矩你在任何一份网络设置页面上都会撞见,它的名字叫 TCP/IP。
这两套规矩为什么在这里不够用? 因为它们把数据交出去之前, 要先请机器上那套管收发的系统程序过一道手,还要占用处理器去打包拆 包。 平时上网这点开销可以忽略,可训练时几百台机器要不停地互相核对中间结果,这道手就成了瓶颈。
5.2 那种关键技术:让两台机器的内存直接对话
这一小节讲书里点名的那种做法,以及它凭什么快。
书里点名的做法是:把数据直接从一台机器的内存快速搬到另一台机器的内存里, 绕开双方那套管收发的系统程序,也不劳烦处理器18。 这种做法的名字叫 RDMA(远程直接内存访问)18—— 你在任何一份机房网络方案里都会撞见这四个字母。
绕开中间环节换来什么? 书里给了两样。 第一样叫吞吐——就是「单位时间里能过多少量」——很高,占用也低18。
第二样叫时延——就是「从发出到收到隔了多久」——很低18。 这两样正好对应第 4 节末尾那个四分之一:卡之间的话说得越快、等得越短, 那一堆卡才越像一台机器。
这条路上有两种方案,先把两个名字挂在这儿。 一种自己拉专线,名字叫 InfiniBand(书里译成「无限宽带技术」,缩写 IB); 另一种把同样的报文塞进以太网的包里收发,名字叫 RoCE19。
两者的取舍书里写得很实用19:
| 方案 | 好处 | 代价 |
|---|---|---|
| 专线那种(IB) | 带宽利用率更高,能支撑更大规模的训练集群(集群就是「一堆机器当一台使」) | 无法兼容现有以太网,要换网卡和交换机,部署运维成本不菲 |
| 架在以太网上那种(RoCE) | 被认为是低成本解决方案 | 性能上有一些损失 |
这一节的意义在于:它解释了为什么「买卡」不等于「有算力」。 卡之间连不好,买再多也跑不满。
6. 主走查:训一个 130 亿参数的模型要多少钱
这是本章的主走查。四步,每一步都有可核的数。
书里这笔账出现在第 15 章那场对话里,由几个角色一句一句算出来。 我们把它整理成一条走查,每个数都标了出处。
| 第几步 | 算什么 | 数 |
|---|---|---|
| 1 | 官方论文给的训练消耗 | 13.5 万卡时(用 80 GB 显存的那种专业卡)20 |
| 2 | 假设你有 1000 张卡 | 13.5 万 ÷ 1000 = 135 小时 |
| 3 | 换算成天 | 135 ÷ 24 ≈ 5 天半20 |
| 4 | 光买这 1000 张卡要多少钱 | 差不多 1 个亿人民币20 |
第 4 步那个数是这条走查的落点:1 亿元只是卡钱,不含机房、电、人。 书里另一处把完整的门槛给出来了:大模型预训练的资金门槛在几个亿到几十个亿之间 (对应百亿级到千亿级参数的模型)21。
顺带记住一个对照: 这一代 130 亿参数的模型, 推 理只用上一代的单卡就能完成20—— 训练要 1000 张卡跑五天半,而用起来只要一张老卡。 这个不对称是整个产业的经济学基础(第 18 章会把它变成一条横线)。
这一层为什么最先赚到钱? 书里的理由很硬: 提供商预训练和微调时要用它;行业客户拿私域数据微调时要用它; 最终用户使用应用时,还要用它来推理—— 每一个环节都能创造面向企业的收入22。
7. 软件那一层,第一块:让多机多卡一起干活
从这一节开始讲第四层。这一层有三块,书里逐块讲了。
第一块是框架。 书里先给了一个好懂的定位: 有人将深度学习框架比作深度学习的操作系统—— 它提供预定义的组件(抽象层)、管理计算资源、适配不同硬件23。 这一层的几个名字你在任何一份招聘启事上都会撞见:书里点的是 谷歌大脑做的 TensorFlow、Meta 做的 PyTorch、百度做的飞桨(PaddlePaddle)23。
为什么大模型需要它的「分布式」版本? 书里列了四件事24: 大规模计算、数据与模型与流水线三种并行、高效的资源利用、容错和恢复。 最后一条最容易被忽略:训练时间很长,中途某台机器坏了, 有容错和恢复机制就不必从头再来。
书里把实现方式分成两类,这个分法很清楚25:
| 类型 | 做法 | 书里点名的例子 |
|---|---|---|
| 叠加式 | 在已有框架之上再提供分布式能力,两者分工:一个管任务调度、资源管理和容错,另一个管模型怎么搭、怎么训、怎么调得更好 | ChatGPT 项目里用的那一套组合叫 Ray on PyTorch:调度和容错归 Ray,搭模型和训模型归 PyTorch26 |
| 全栈式 | 专为大模型解决横向扩展、原生支持分布式的框架,不需要定制化开发,兼容多种底层硬件 | 国内一个把源码公开出来的框架,名字叫 OneFlow27 |
这一块的商业模式,书里说得很实在:除了常见的高级功能年费、技术咨询费、 定制开发费之外,还有一条新路—— 把框架技术投入某一家模型提供商、提供定制的技术能力,从对方的商业收入中分成; 书里那句总结很直白:如果做框架本身不好挣钱,但客户能挣钱,那么就加入你的客户28。
8. 软件那一层,第二块:数据这门生意
这一节讲的东西第 02 章提过一句(「数据要大,更要精」),这里是它的产业形态。
先分清哪一步要人。 标注:就是「给一条数据写上正确答案或打上分类」。 书里说,预训练阶段需要的数据量极大,但不需要人来标注, 可以通过购买、合作、抓取获得;而后面两个阶段(监督微调和强化学习)都需要人标过的样本29。
标注样本有四种来源30:
| 来源 | 具体做法 | 关键细节 |
|---|---|---|
| 1 专业人 员标注 | 分两类人:培训后即可上岗的标注人员,和对学历与行业经验要求高的垂直行业人员 | 训练阶段曾有几十位博士参与标注,编写对话答案或给答案评分31 |
| 2 收集用户反馈 | 用户重新生成回答之后,系统问「新老两个回答哪个更好」 | 这是数据数量最大、性价比最高的一种32 |
| 3 公域或三方数据 | 公开的互联网数据,或其他产品的数据 | 必须符合法律规定;书里举了一个浏览器插件的例子,用户在上面分享自己的对话记录33 |
| 4 企业私域数据 | 企业客户自己的数据 | 归到模型服务层去讲 |
第 1 种的成本压力,书里写得很坦白。 那家专业标注公司降成本的两个办法是: 尽量把任务分解、在某些环节降低对人员学历和专业素质的要求, 把更多人力工作外包给东南亚、非洲、南美等地; 以及在积累到一定数据量之后,先用机器标注、再由人工审核34。
第 2 种最值得讲,因为它会自己转起来。 书里把这个循环叫数据飞轮—— 早于竞争对手发布产品 → 提前拿到更多数据 → 加入训练、体验变好 → 吸引更多用户 → 收集到更多数据35。 这是一个自我强化的循环,而且它在第 17、19 章还会各出现一次。
9. 软件那一层,第三块:那个托管着十万个模型的地方
这一节讲第三块,它是这一层里最不像「软件」的一块。
书里的类比很好懂:在软件行业,最大的代码托管和协作社区叫 GitHub—— 开发者在上面做版本管理、协作开发、分享和复用别人的东西; 而在模型这一侧,有一个对应的地方,它的名字叫 Hugging Face36。 这两个名字都得记住:你以后但凡去下载一个模型或一段代码,九成会落在这两个地方之一。
这个地方的用户分两类37:
| 谁 | 在这里干什么 |
|---|---|
| 模型托管者(通常是研发方) | 托管并共享预训练模型和数据集 |
| 模型使用者 | 挑合适的模型、在社区里协作和评价、把选定的模型投入生产;训练和推理都能在平台上完成 |
顺带把一个词讲清楚:把源码和那一堆训练好的数公开出来、 别人可以下载、可以改、还可以再放出去,这种做法叫开源。
规模有多大? 书里给的数: 从 2019 年一个模型的分享起步,上万家公司都在使用他们的服务; 接受该社区托管的模型超过 10 万个,其中半数以上是开源的38。 这两个数放在一起才有量感:上万家公司对十万个模型, 平均每家公司背后大约躺着十个模型——它不是一个小众的资料站,是这一行的默认货架。
它的价值在哪? 书里用了一个经济学的说法: 它是一个双边平台,为模型研发者(科学界)和模型使用者(产业界)搭建桥梁, 弥补了科学与生产之间的鸿沟39。 国内类似的模型库社区,书里点名了阿里的那一个39。
商业模式? 书里说得很清楚:完全是面向企业的—— 与其他开源项目的商业化相似,主要通过高级功能付费、定制服务项目费赢利, 也可以扩展到云计算代理领域40。
这一块为什么容易被漏掉? 因为它既不生产模型,也不生产算力。 但第 17 章那个用 8 张卡一天做出来的模型,它的底座就是从这里下载的—— 没有这一块,那一章的故事讲不成。
10. 作者的判断与证据
| 说法 | 性质 |
|---|---|
| 那次全员会、红色代码、Bard 翻车、9%、千亿 | 新闻事实,可核 |
| 「谷歌是对的」 | 作者的判断,而且这个判断有事实支撑 |
| 显卡四个要求与那些数 | 厂商公开规格 |
| 训练一个 130 亿参数模型的账 | 书里角色对话中的估算,基于论文里的卡时数 |
| 「几个亿到几十个亿」的门槛 | 估算,书里没有给测算过程 |
| 框架的两类实现 | 技术事实 |
| 标注外包的成本控制方式 | 事实,而且书里没有回避它不好看 |
| 数据飞轮 | 商业分析,不是可测量的模型 |
必须点破的一处:这一章讲硬件时用的全是某一家的产品参数。 书里对国产替代只给了一段(书里点名了一家国内芯片厂商的产品41), 而且没有做同口径对比。 读的时候要知道:这一章的数字有强烈的单一厂商色彩。
11. 边界与局限
- 书里没有讲显卡的供给约束会持续多久。 它在这一章末尾把这个问题列成了「思考题」, 自己没有回答。
- 书里没有讲电。 代序里那笔电费账(第 07 章第 5 节)在这一章一次都没有被接上—— 产业篇讲了卡、讲了网、讲了框架,唯独没讲电。
- 标注工人的处境书里只字未提。 外包到低成本地区这件事只当成本控制手段来写, 没有一句关于那些人的工作条件。
- 模型库社区的合规风险没有讨论。 十万个模型里那些数是从哪来的、按什么许可放出来的、 被下载之后怎么用,一句没有。
12. 可带走的
- 产业篇的真正开头是一次翻车:同样是会编,创业公司没事,搜索巨头是 9% 股价、千亿市值。
- 四层:硬件 → 软件 → 模型即服务 → 应用。 钱从下往上流,先赚到钱的在最下面。
- 显卡的四个要求:算得快、装得下、搬得快、连得好。
- 1979 万亿次 ≈ 那台游戏机显卡的 190 倍——这是全书最好用的一个参照物。
- 训一个 130 亿参数的模型:13.5 万卡时 → 1000 张卡跑 5 天半 → 光卡钱约 1 亿元。 而推理只要一张老卡。
- 软件那一层有三块:分布式框架、数据、模型库社区。 少讲哪一块,地图就是残的。
- 数据飞轮:先发 → 更多数据 → 更好 → 更多用户 → 更多数据。 它会自己转起来。
13. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 全员会与「更保守」 | 13 大模型应用的三重境界 | text/15-ch13.txt:114(搜「2022年12月上旬」) · text/15-ch13.txt:121(搜「比小型初创公司」) |
| 红色代码 | 13 大模型应用的三重境界 | text/15-ch13.txt:133(搜「仅仅十余天后」) · text/15-ch13.txt:137(搜「而二人自2019年后就已淡出」) |
| Bard 翻车与千亿 | 13 大模型应用的三重境界 | text/15-ch13.txt:146(搜「误认为世界上首张太阳系外行星照片」) · text/15-ch13.txt:148(搜「市值损失千亿美元」) |
| 创新者窘境 | 13 大模型应用的三重境界 | text/15-ch13.txt:126(搜「谷歌正在遭遇创新者窘」) |
| 四层结构 | 14 大模型产业拆解 | text/16-ch14.txt:2(搜「我们将大模型产业划分为4层」) |
| 显卡四要求 | 14 大模型产业拆解 | text/16-ch14.txt:22(搜「更高的计算能力」) · text/16-ch14.txt:36(搜「更高效的集群通信能力」) |
| 1979 万亿次与两个参照 | 14 大模型产业拆解 | text/16-ch14.txt:52(搜「计算能力达到1979万亿次」) · text/16-ch14.txt:53(搜「索尼PlayStation5游戏机的GPU计算能力是」) |
| 12 倍与 30 倍 | 14 大模型产业拆解 | text/16-ch14.txt:62(搜「可将训练速度最高提升12倍」) · text/16-ch14.txt:64(搜「每GPU推理吞吐量比A100高30倍」) |
| 核心网带宽与两种方案 | 14 大模型产业拆解 | text/16-ch14.txt:77(搜「G比特每秒」) · text/16-ch14.txt:87(搜「无限宽带技术」) |
| RDMA 与它绕开的东西 | 14 大模型产业拆解 | text/16-ch14.txt:80(搜「远程直接内存访问」) · text/16-ch14.txt:83(搜「绕开双方操作系统内核」) |
| 硬件最先赚钱 | 14 大模型产业拆解 | text/16-ch14.txt:103(搜「硬件基础设施To B」) |
| 框架比作操作系统与三个名字 | 14 大模型产业拆解 | text/16-ch14.txt:139(搜「有人将深度学习框架比作深度学习的操作系统」) · text/16-ch14.txt:136(搜「Meta开发的PyTorch」) |
| 叠加式与全栈式 | 14 大模型产业拆解 | text/16-ch14.txt:186(搜「叠加式」) · text/16-ch14.txt:210(搜「全栈式」) |
| 标注四种来源 | 14 大模型产业拆解 | text/16-ch14.txt:266(搜「通过专业人员进行数据标注」) · text/16-ch14.txt:321(搜「获取公域或三方数据」) |
| 数据飞轮 | 14 大模型产业拆解 | text/16-ch14.txt:313(搜「数据飞轮」) |
| 模型库社区 | 14 大模型产业拆解 | text/16-ch14.txt:350(搜「GitHub是最大的软件代码托管平台和社区」) · text/16-ch14.txt:364(搜「接受该社区托管的模型超过10万个」) · text/16-ch14.txt:370(搜「双边平台」) |
| 训一个 130 亿参数的账 | 15 关于大模型产业的对话:第1集 | text/17-ch15-15-1.txt:50(搜「跑13.5万GPU小」) · text/17-ch15-15-1.txt:52(搜「差不多1个亿人民币」) |