跳到主要内容

另一个人的声音:七十年、三个学派、一笔电费账

这一章讲三件事: 这一行的七十年是怎么走过来的; 这一行为什么突然开始跟电力打交道;以及 2023 年春天真实发生过的几件事。

它在全书链条里的位置: 前六章讲的是「它是什么」。 这一章给的是时间坐标——你需要它,才能在第 08、09 章把这件事和工业革命并排放。 但它也是全书唯一一处不是作者本人写的正文。

1. 先说清楚:这是谁在说话

这一节必须放在最前面,否则你会把两套判断混在一起。

代序的作者是朱嘉明,落款 2023 年 5 月 9 日1; 本书作者的落款是 2023 年 5 月 11 日2两个人,两篇文章,相差两天。

为什么必须分开记? 因为这两篇文章的口径不一样:

代序正文
写法论文式,大量引文和脚注情景剧 + 案例 + 对话
关心什么思想史、知识论、文明尺度的风险产业怎么落地、钱怎么算
对同一件事的说法有几处对不上(见第 8 节)

本组拆解的做法是:代序里的判断一律写明「这是代序作者的说法」,不并进正文的结论。

2. 七十年,以及一开始就分了三派

这一节给全书唯一一条完整的时间线。

代序从这一行的定义讲起:1956 年那次会议给出的说法是—— 让机器使用语言、形成抽象和概念、解决现在人类还不能解决的问题、提升自己; 而首要问题是让机器像人类一样能够表现出智能3

从 1956 年算起,到这本书出版,这一行已经接近 70 年4

而这 70 年一开始就分了三派5:

学派主张什么依靠什么思维
符号学派用符号运算模拟人的认知过程和抽象逻辑思维抽象思维,注重数学上说得清
联结学派直接模拟大脑,靠一张网和它的学习方法产生智能形象思维,仿人脑
行为学派从进化论和控制论出发,行为是对环境变化的反应组合感知思维,模拟身体和行为

关键的一句在后面:在相当长的时间里,符号那一派是主流。 代序给的转折点是:因为计算机只能处理符号、不可能具有人类最复杂的感知, 符号那一派在 20 世纪 80 年代末开始走向式微6

这一条解释了第 03 章那个疑问的另一半: 第 03 章说的是「同一条路上两种练法的竞争」, 而这一条说的是「这条路本身在更早的年代就赢过一次」。

3. 三个里程碑

这一节是代序最有用的一段,也是最需要小心引用的一段。

第一个里程碑是机器学习——就是「不靠人一条条写死规则, 而是让程序自己从数据里找出规律」。 代序把它的源头追到 1950 年那篇论文和那个著名的测试; 而第一个实物是 1952 年一个下西洋棋的程序—— 它能从棋子的位置学出一个说不清的规律,为下一步提供比较好的走法7

第二个里程碑是深度学习——就是把第 03 章那张网做得很多层; 代序说的「深度」指的就是层数8。 时间点是 2006 年,代序管它叫「深度学习元年」8

中间那一段是它的生物学理由: 只有 1.5 千克重的大脑, 大约有 860 亿个神经元,与数万亿个突触相连9

860 亿是个什么概念? 拿第 02 章那个数比:1750 亿个可调的数, 是这个数的两倍——但两者不是一回事,一个是生物细胞,一个是可调的数字。 (代序把它们并排放,但没有说它们等价。)

那「数万亿个突触」呢? 拿它自己除一下就有量感了: 数万亿 ÷ 860 亿 ≈ 几十——平均每个神经元往外接出去几十条线。 (这一步除法是我们做的,代序只给了两个数。)

真正让它出圈的是 2012 年:那一年一个网络在图像识别比赛上做出结果, 代序说这成为新一轮发展的起点10

第三个里程碑:生成大模型。 从 2018 年开始迅速流行, 做法就是第 02、04 章讲过的那两步:先在没人标过答案的海量数据上练,再用人标过答案的数据调11。 代序给了一个规模上的细节:训练用了数万台机器,既有普通处理器,也有显卡12

4. 这三步一步比一步更靠堆规模,而堆规模会撞墙

这一节是我们补的一级台阶——不补上,下一节的电费账会显得突兀。

把上面三步连起来看,有一条线索:

第一步 机器学习 靠的是:找到一个能从数据里学规律的办法
↓ 规模不是主要矛盾
第二步 深度学习 靠的是:把网做深、把数据做大
↓ 规模开始变成主要矛盾
第三步 生成大模型 靠的是:把规模一路推到极限
↓ 规模就是全部

一路堆规模,先撞上的是显卡。 代序说,那个东西是硬件那一层的核心, 而这一行的效率提升已经超越了摩尔定律—— 摩尔定律说的是「同样大小的芯片上,能装的元件数每隔一两年翻一番」, 这是这一行几十年来最可靠的一条经验规律13。 代序同时说,这条规律正在逼近物理极限14

撞完显卡,再往后撞上的是电。 这就是下一节。 (显卡对这件事到底提了哪些要求、一次训练要花多少钱,第 16 章有具体的数。)

5. 那笔电费账(而且是转引的)

这一节给出代序独有的两个数,并且要把它们的来源说清楚。

代序给的两句话是:

  • 目前这一行的能源消耗占全球能源消耗的约 3%15;
  • 根据一份报告,到 2025 年,它将消耗 15% 的全球电力供应15

这两个数必须打个标记再用。 代序给它们配的出处是两篇中文网络文章 (一篇百家号、一篇中国日报网),不是能源统计机构的报告原文第二个数尤其可疑:从 3% 到 15% 意味着两年内翻五倍, 而代序没有给出任何推导过程。 本组拆解的处理:这两个数只能当「有人这么说过」来引用,不能当事实。

为什么还要留着它们? 因为它们指出了一个真问题: 这一行的成本结构里有一项是电,而电是有物理上限的。 这一条在第 16 章会变成具体的机房和成千上万张卡,在第 18 章会变成每答一次的成本。

6. 代序的落点:知识是怎么被生产的

这一节讲代序真正关心的东西——它不是技术,是知识论。

代序关心的是知识本身:从记忆(就是把事实存住、要用的时候取出来) 一直到创造,这中间的每一层都被它重新过了一遍。

代序一共列了七条改变,其中最要紧的是第一条和最后一条: 第一条是知识生产的主体变了——从人类垄断,变成人和机器混合生产16; 最后一条是知识处理方式变了

最后这一条给了全书一个很有用的框架:人对知识的处理分为六个层次—— 记忆、理解、应用、分析、评价和创造17这六层在第 10 章会被逐层走一遍,那一章还会给出一个真实的效率实验。

代序还提了一件与第 01 章直接相关的事: 如果它与外部知识源(例如搜索引擎)和工具(例如编程语言)结合, 将丰富知识体系并提高获取效率18—— 这正是第 06 章那两类插件在思想史上的位置。

顺带把两个名字挂上,因为你出门一定会撞见它们: 代序里点了一次它内部那套计算方法的名字——注意力: 说白了就是「算下一个字的时候,前面哪几个字该多看两眼」19

这套方法出自一篇论文,而正文里也提过一次这篇论文的名字: 《注意力就是你所需的一切》——书里在原书第 14 章讲一家公司的创始人来历时, 把它称作「大模型基石级论文」20

但正文里只是把它当一个人的履历带过。 唯一一次讲清「它是什么」的地方,是代序。 这两处加起来,就是全书对它的全部交代:一个名字、一句解释,连图都没有。

7. 主走查:同一个问题穿过七十年

这是本章的主走查。拿 1956 年那句定义当输入,每一站写出当时手里有多少东西。

输入:「让机器像人类一样能够表现出智能」。

年份手里有多少数据、多少算力走到哪一步
1956那次会议把问题提出来,并分成三派35
1952一个下西洋棋的程序一副棋盘的局面证明了程序能从数据里学出走法7
1986那位后来的图灵奖得主112 个句子(104 句训练、8 句测试),没有显卡思想成立,但做不出东西来21
2006同一个人提出把网做深这条路8
2012一个图像识别的网络一个大型图像数据集图像识别做出结果,新一轮的起点10
2020那一代生成大模型数万台处理器1750 亿个可调的数突然会了没人教过的事12

看第 3 行和第 6 行的对比:同一个人、同一个思想,差的是数据和算力。 112 个句子对上千亿个可调的数——这就是第 03 章那句「比算力和数据更短缺的是相信」的量级。

8. 代序和正文对不上的地方

这一节是本组拆解替读者做的核对,书里没有。

事项代序说正文说
「大」的门槛参数至少达到 1 亿22只说上一代是 1750 亿,没有给门槛
产业分层硬件、软件、模型即服务、应用四层23第 16 章用的是同一套四层——这一处是对得上的
幻觉用的词是**「AI 幻象」**24用的词是「幻觉」
涌现引的是同一篇论文25第 04 章引的也是它——对得上

最要紧的一处不同不在数字上,在态度上: 代序把这件事放在文明尺度上谈(核武器、潘多拉盒子、火星迁徙), 而正文从头到尾在算账。 两种态度都有价值,但不要把代序的紧迫感当成正文的结论。

9. 那份 2023 年春天的风险清单

这一节把代序里那几件真事列出来,因为它们常被记混。

时间事情
2023 年 3 月 29 日一位科技企业家联名千余科技领袖,呼吁暂停开发26
2023 年 4 月那位图灵奖得主向谷歌提出辞职,理由是想「自由地谈论这一行的风险」27
更早控制论之父在《人有人的用处》里写下的那句话:这些机器的趋势是要在所有层面上取代人类28

代序给这一节的落点是一个问句:人是否或早或晚都会成为它的工具人。 这个问题书里没有回答,我们也不替它回答。

10. 作者的判断与证据

说法性质
三个学派的划分与各自主张学科史的通行说法
三个里程碑与年份事实,可核
860 亿个神经元神经科学的通行数
3% 与 15% 那两个能耗数转引自两篇网络文章,没有推导
「大模型赋予它一种与人类近似、又很不同的思维能力」代序作者的判断,没有证据
「弱人工智能、强人工智能、超人工智能的界限不复存在」代序作者的判断,而且是一个很强的判断
知识处理六层借用的现成教育学框架,不是这一行的东西

11. 边界与局限

  • 代序不讲怎么做,只讲意味着什么。 它没有一个可操作的结论。
  • 代序的引文密度极高,但多数是二手转引。 那两个能耗数是最典型的例子。
  • 代序里的中国部分只有点名。 文心、通义、盘古三个名字之外没有任何拆解。
  • 代序把「生成主义」这类哲学概念引进来,和正文完全接不上。 我们在这里不展开,因为它对读懂这本书没有帮助。

12. 可带走的

  1. 代序是另一个人写的,判断要分开记。
  2. 这一行从 1956 年算起接近七十年,一开始就分三派,符号那一派曾长期是主流。
  3. 三个里程碑:能从数据里学规律 → 把网做深 → 把规模推到极限。
  4. 一路堆规模,先撞显卡,再撞电。
  5. 那两个能耗数(3%、15%)是转引的,当「有人这么说过」用。
  6. 知识处理六层这个框架很有用,第 10 章会拿它当骨架。
  7. 2023 年春天那几件事是真的:千人联署、那位得主辞职。

13. 原文地图

主题原书章原文位置
那次会议的定义代序text/01-fm.txt:8(搜「达特茅斯会议对人工智能」)
接近七十年代序text/01-fm.txt:131(搜「已经接近70年」)
三个学派代序text/01-fm.txt:141(搜「符号学派」) · text/01-fm.txt:156(搜「在20世纪80年代末开始」)
第一个里程碑代序text/01-fm.txt:159(搜「第一个里程碑」) · text/01-fm.txt:162(搜「西洋棋的程序」)
第二个里程碑代序text/01-fm.txt:186(搜「第二个里程碑」) · text/01-fm.txt:191(搜「2006年也因此成为」)
860 亿个神经元代序text/01-fm.txt:195(搜「大约有860亿个神经元」)
2012 年那一次代序text/01-fm.txt:208(搜「设计的AlexNet神经网络模型」)
第三个里程碑与规模代序text/01-fm.txt:212(搜「第三个里程碑」) · text/01-fm.txt:218(搜「OpenAI使用了数万台」)
四层结构代序text/01-fm.txt:410(搜「这个结构包括硬件基础」)
超越摩尔定律代序text/01-fm.txt:414(搜「AI算法效率已经超越了摩尔定律」)
那篇论文的名字14 大模型产业拆解text/16-ch14.txt:934(搜「大模型基石级论文」)
那两个能耗数代序text/01-fm.txt:435(搜「能源消耗占全球能源消耗」)
知识处理六层代序text/01-fm.txt:467(搜「记忆、理解、应用、分析」)
风险清单代序text/01-fm.txt:525(搜「联名千余科技领袖」) · text/01-fm.txt:527(搜「向谷歌提出辞」)

Footnotes

  1. 出处:「代序」第 624 段(text/01-fm.txt:624,搜「朱嘉明」)与第 626 段(text/01-fm.txt:626,搜「2023年5月9日」)。

  2. 出处:「后记」第 73 段(text/20-fm.txt:73,搜「2023年5月11日」)。

  3. 出处:「代序」第 8 段(text/01-fm.txt:8,搜「达特茅斯会议对人工智能」)。这段引文放在代序开头,是全书对这一行最早的一次定义引用。 2

  4. 出处:「代序」第 131 段(text/01-fm.txt:131,搜「已经接近70年」)。原文的起算点是 1956 年那次会议。

  5. 出处:「代序」第 141 段(text/01-fm.txt:141,搜「符号学派」)。三派的对照见第 151–153 段(text/01-fm.txt:152,搜「联结学派则是形象思维」)。 2

  6. 出处:「代序」第 156 段(text/01-fm.txt:156,搜「在20世纪80年代末开始」)。

  7. 出处:「代序」第 159 段(text/01-fm.txt:159,搜「第一个里程碑」)与第 162 段(text/01-fm.txt:162,搜「西洋棋的程序」)。原文说,这个程序驳倒了「机器无法超越书面代码、无法像人类一样学习模式」的论断。 2

  8. 出处:「代序」第 186 段(text/01-fm.txt:186,搜「第二个里程碑」)与第 191 段(text/01-fm.txt:191,搜「2006年也因此成为」)。原文对「深度」的解释是:指网络中隐藏层的数量。 2 3

  9. 出处:「代序」第 195 段(text/01-fm.txt:195,搜「大约有860亿个神经元」)。

  10. 出处:「代序」第 208 段(text/01-fm.txt:208,搜「设计的AlexNet神经网络模型」)。 2

  11. 出处:「代序」第 212 段(text/01-fm.txt:212,搜「第三个里程碑」)。

  12. 出处:「代序」第 218 段(text/01-fm.txt:218,搜「OpenAI使用了数万台」)。 2

  13. 出处:「代序」第 414 段(text/01-fm.txt:414,搜「AI算法效率已经超越了摩尔定律」)。摩尔定律那句解释是我们补的通用知识,代序里只点了名字。

  14. 出处:「代序」第 417 段(text/01-fm.txt:417,搜「摩尔定律逼近物理极限」)。

  15. 出处:「代序」第 435 段(text/01-fm.txt:435,搜「能源消耗占全球能源消耗」)与第 436 段(text/01-fm.txt:436,搜「耗15%的全球电力供应」)。原文给的出处是两篇中文网络文章,不是能源统计机构的原始报告。 2

  16. 出处:「代序」第 452 段(text/01-fm.txt:452,搜「改变知识生产的主体」)。

  17. 出处:「代序」第 467 段(text/01-fm.txt:467,搜「记忆、理解、应用、分析」)。

  18. 出处:「代序」第 477 段(text/01-fm.txt:477,搜「与外部知识源」)。

  19. 出处:「代序」第 378 段(text/01-fm.txt:378,搜「基于注意力机制的深度神经网络」)。代序是全书唯一一处讲「它是什么」的地方;那句大白话解释是我们补的。 正文里还有一处只出现了论文名,见 20

  20. 出处:「14 大模型产业拆解」第 934 段(text/16-ch14.txt:934,搜「大模型基石级论文」)。这一处出现在讲一家角色扮演公司创始人来历的段落里——原文说他是谷歌前首席软件工程师、那篇论文的第二作者。书里只借它交代一个人的资历,没有讲这篇论文说了什么。 那家公司本身在第 18 章第 5 节。 2

  21. 出处:「03 ChatGPT是怎样炼成的」第 422 段(text/05-ch03-03-chatgpt.txt:422,搜「只能使用112」)。这一行不在代序里,是从正文补进来的,因为代序讲到 1986 年时没有给数据量。

  22. 出处:「代序」第 50 段(text/01-fm.txt:50,搜「模型参数至少达到1亿」)。原文接着说这个标准一直在提高。

  23. 出处:「代序」第 410 段(text/01-fm.txt:410,搜「这个结构包括硬件基础」)。第 16 章用的就是这套分层。

  24. 出处:「代序」第 563 段(text/01-fm.txt:563,搜「AI幻象」)。

  25. 出处:「代序」第 236 段(text/01-fm.txt:236,搜「据谷歌、斯坦福和DeepMind联合发表」)。

  26. 出处:「代序」第 525 段(text/01-fm.txt:525,搜「联名千余科技领袖」)。

  27. 出处:「代序」第 527 段(text/01-fm.txt:527,搜「向谷歌提出辞」)与第 531 段(text/01-fm.txt:531,搜「谈论人工智能的风险」)。

  28. 出处:「代序」第 548 段(text/01-fm.txt:548,搜「人有人的用处」)。原文的完整引语是:这些机器的趋势是要在所有层面上取代人类,而非只是用机器能源和力量取代人类的能源和力量。