跳到主要内容

为什么它居然管用 — 简单的不是模型,是语言

这一章讲三件事: 全书真正的论点是什么、作者拿什么当证据、 以及这个论点的分量究竟有多重(比很多转述说的轻)。 前五章讲「它怎么做的」和「它做不到什么」,这一章回答书名的后半句:为什么它能做到。

1. 先看现象:这件事本来不该发生

这一节回答:为什么「它能写文章」值得惊讶。

把两个数字放在一起看:

数量级
人类大脑1000 亿个神经元、约 100 万亿条连接
ChatGPT1750 亿条连接(权重)

人类语言,以及背后的思维过程,一直被视为复杂性的巅峰。 过去人们甚至猜测:大脑里也许不只有神经元网络,还有某种尚未发现的物理机制。

而现在1:

一个连接数与大脑神经元数量相当的、纯粹的人工神经网络,就能够出色地生成人类语言。

这就是那条「重要的新信息」。问题是:凭什么?

先排除一个太容易的解释

有人会说:简单规则也能产生极复杂的行为 —— 第 05 章那个规则 30 就是最著名的例子, 所以「简单结构做出复杂行为」不奇怪。

但作者自己把这条路堵死了: ChatGPT 用的这种网络,恰恰是被特意构建来压制这种现象的 —— 压制计算不可约性,好让它更容易训2

也就是说:不能用「复杂的行为自己冒出来了」来搪塞。

2. 核心主张:简单的不是模型,是语言

于是他给出这本书真正的论点3:

我认为基本答案是,语言在根本上比它看起来更简单。 这意味着,即使是具有简单神经网络结构的 ChatGPT, 也能够成功地捕捉人类语言的「本质」和背后的思维方式。 此外,在训练过程中,ChatGPT 已经通过某种方式隐含地发现了使这一切成为可能的 语言(和思维)规律。

「隐含地发现」是这句话里的关键词: 不是有人把规律教给它, 而是它为了做好「续写」这件事,顺带把规律摸了出来,而且这些规律只存在于权重里, 没有任何人能读出来。

再进一步,他把这件事提到科学发现的高度:

ChatGPT 的成功为一个基础而重要的科学事实提供了证据: 我们仍然可以期待发现重大的新「语言法则」,实际上是「思维法则」。 在 ChatGPT 中,由于它是一个神经网络,这些法则最多只是隐含的。 但如果我们能使它们变得明确,就有可能以更直接、更高效和更透明的方式做到它所做的事。

记住这三个词:更直接、更高效、更透明。 这是全书后半段所有讨论的目标。

3. 两条已经知道的「语言法则」

这一节回答:「语言法则」到底长什么样。 作者用两个已知的例子来说明。

法则一:句法语法

句法语法就是「哪种词能接哪种词」的那套规则。 语言不是把词随机拼在一起:名词前面可以有形容词、后面可以有动词, 但两个名词通常不能挨在一起。这类规则可以画成一棵树来大致捕捉, 这棵树叫解析树(把句子逐层拆成成分:先拆成主语部分和谓语部分,再往下拆)4

ChatGPT 并不明确「知道」这些规则,但训练中隐含地发现了它们,而且很擅长遵守。

作者给了一个「类自然科学」的观察,这句话分量不轻5:

Transformer 架构好像成功地学会了似乎在所有人类语言中都存在 (至少在某种程度上是近似的)嵌套树状的句法结构。

为什么英语语法学得会、括号却学不会

第 05 章那个括号实验就在这一节里。两者的对比是这一节最有教学价值的部分:

括号语言英语语法
规则的性质严谨的、必须真的数一遍局部的选词和其他提示去猜
神经网络表现长序列必错好得多
出错的时候一定是错的可能错过某些「形式上正确」的情况 —— 但人类也会错过

结论是:语言存在整体的句法结构,而且蕴含着规律性。 这就限制了神经网络需要学的东西「有多少」。

法则二:逻辑

语法只是约束之一。

像「好奇的电子为了鱼吃蓝色的理论」这样的句子,语法完全正确, 但不是人们通常会说的话 —— 用词的正常含义去读,它基本上毫无意义6

有没有通用方法判断一句话是否有意义?没有传统的总体理论。 但作者认为,ChatGPT 在几十亿个(应该有意义的)句子上训练之后, 已经隐含地「发展出」了一个这样的理论。

而这个理论的冰山一角,人类早在两千多年前就知道了:逻辑。 亚里士多德的三段论说明,遵循一定模式的句子是合理的,其他则不合理 (例:所有鱼都是蓝的;这个不是蓝的;所以它不是鱼)。

这里有一个想象力很好的类比7:

就像可以异想天开地想象亚里士多德是通过**「机器学习式」地研究大量修辞学例子** 来发现三段论逻辑一样,也可以想象 ChatGPT 在训练中通过查看大量文本 「发现」了三段论逻辑

同时作者也给了边界:更复杂的形式逻辑它会失败,原因和括号匹配失败的原因相同。

4. 那条还没被写下来的法则:语义语法

这一节回答:语法和逻辑之间那一大块空白,靠什么管。

如果语法管「哪种词能接哪种词」,逻辑管「推理合不合规」,那中间那一大块 —— 「什么样的话说得通」 —— 靠什么管?

作者给这块东西起了个名字:语义语法8

它和句法语法差在哪

句法语法语义语法
识别的单位名词、动词、形容词更精细的分级:比如「移动」这个概念、「换了位置也还是它自己的东西」这个概念
规则长什么样名词后面可以跟动词「东西」可以「移动」
预设了什么只预设「语言由词构成」必然预设一个「世界模型」 —— 一副骨架,语言搭在上面

作者立刻给了一个重要的澄清,免得这个概念被误解9:

即使一句话在语义语法上完全没问题,也不意味着它已经或者能在实践中成真。 「大象去了月球」毫无疑问会通过语义语法,但在现实世界中还没有成真 —— 虽然它绝对可以在虚构的世界中成真。

也就是说:语义语法管的是「说得通」,不是「是真的」。这两件事必须分开。

主走查:拿两句话过三道关

这三条法则怎么用?挑两句话,一道关一道关地过。 这是本章的主走查。 (第一句是我们编的例子,第二句是书里给的。)

第一句:「桌子吃掉了星期二」。

过哪一关这一关判什么结果
① 句法语法名词动词形容词搭得对不对 ——「桌子」名词、「吃掉」动词、「星期二」名词,名词+动词+名词是合法的搭法
② 语义语法「吃掉」要求前面是个能吃东西的活物、后面是个能被吃的东西不过 —— 桌子不是活物,星期二不是东西,两头都不合
③ 逻辑推理有没有自相矛盾没走到这一步 —— 第 ② 关已经把它拦下了

第二句:「大象去了月球」。

过哪一关这一关判什么结果
① 句法语法名词动词形容词搭得对不对
② 语义语法「去」要求前面是个能移动的东西、后面是个地方 —— 大象能移动,月球是个地方
③ 逻辑推理有没有自相矛盾
那事实上呢真发生过吗没有

最后一行就是作者那句澄清的全部内容:三道关全过,不等于这件事是真的。 而上面那张表里的「能吃东西的活物」「能移动的东西」「地方」—— 这些就是「更精细的分级」的实际长相:不是名词动词形容词,而是「什么样的东西能干什么」。

5. 出路:把隐含的规律写成计算语言

如果语义语法必然预设一个世界模型,那这个世界模型该怎么写下来?

作者的答案是他自己四十多年的项目:计算语言 —— 一种精确的符号表示,用来尽可能广泛地谈论世界上的事物10

这里必须提示利益相关: 这个计算语言就是作者自家的 Wolfram 语言, 他是这条路线的提出者,也是商业受益者。论证本身成立,但要把产品和论点分开看。

他很诚实地交代了这个项目的现状11:

在「我买了两斤苹果」中,我们可以轻松地表示「两斤苹果」并做营养等计算, 但是(还)没有找到「我买了」的符号表示。

也就是说:名词那一类的东西已经形式化得不错了,动词那一类、日常话语的部分还没有。

为什么值得做

作者给了一个类比,说明这条路能走多远12:

三段论逻辑(两千多年前)
└─ 一开始只是「关于人类语言陈述的一组规则」
└─ 两千年后被形式化 → 形式逻辑
└─ 由此建起巨大的「形式化高塔」
└─ 最终能解释现代数字电路的运作

语义语法(现在)
└─ 一开始也只能处理简单的模式
└─ 一旦计算语言的框架建立起来
└─ 就能搭起「广义语义逻辑」的高塔
└─ 精确处理我们现在只能含糊谈论的东西

图说:作者押注的是历史会重演一次。这是主张,不是已发生的事。

他还点出人类语言与计算语言的根本差别13: 人类语言不精确,因为它的意义只由使用者之间的「社会契约」定义; 而计算语言必然精确,因为它指定的东西最终总要在计算机上毫无歧义地执行。

一个漂亮的收束:两种「压缩」

作者把计算语言和 ChatGPT 放到了同一个位置上14:

可以把计算语言(和语义语法)的构建看作一种在表示事物方面的终极压缩, 因为它使我们不必处理普通人类语言中的所有「措辞」,就能谈论可能性的本质。 ChatGPT 的巨大优势与之类似:它也在某种意义上「钻研」到了 不必考虑不同措辞、就能「以语义上有意义的方式组织语言」的地步。

一个是人为设计的显式压缩,一个是训练得到的隐式压缩,两者做的是同一件事。 这是全书思想上最漂亮的一句话。

6. 全书的一句话总结

作者自己在最后一章给了压缩版15:

首先从互联网、书籍等获取人类创造的海量文本样本,然后训练一个神经网络来生成「与之类似」的文本。 特别是,它能够从「提示」开始,继续生成「与其训练数据相似的文本」。

注意这句话里没有「理解」「推理」「知道」这类词。这是刻意的。 全书的立场是:所看到的一切能力,都是「续写与训练数据相似的文本」这一件事的结果。

他还给了一个同样克制的说法:ChatGPT「仅仅」是从它积累的 **「传统智慧的统计数据」**里提取了一些连贯的文本线索 —— 而结果的类人程度已经足够令人惊讶了16

它像大脑吗

作者的回答是分层的17:

层面像不像
底层结构 —— 人工神经网络本来就是照着理想化的大脑做的
生成语言时的许多方面似乎很相似
学习的方式不像 —— 硬件差异迫使它用一种与大脑截然不同、某些方面效率更低的办法
有没有循环不像 —— 它内部没有循环、不重新计算数据,这不可避免地限制了计算能力

最后一行他讲得很重:这个限制「即使与当前的计算机相比也是如此,更谈不上与大脑相比了」。 而怎么在修好这一点的同时还能高效训练,尚不清楚。

7. 诚实地标出边界

这一章是全书思想密度最高的部分,但也必须把话说清楚。

判断(我们的,不是书里的): 「语言比看起来更简单」是推测,不是结论。 书里没有给出语义语法的任何形式化结果,也没有给出可检验的预言。 它的价值在于提供了一个看待整件事的角度:模型的能力上限, 可能更多取决于任务本身有多少规律可循,而不是它有多少个可调的数。 如果错,会错在: 如果后续出现「同样的架构在毫无规律可言的领域也同样有效」的证据, 这个角度就站不住;反过来,如果出现「在规律性很强但训练数据稀少的领域反而无效」的证据, 说明起作用的是数据量而不是规律性。

还要给作者记一笔:他自己把话说得比多数转述都保守。

「我强烈怀疑」「我认为」「至少就我们目前所知」这类限定词在这一章里反复出现, 而中文版导读序的转述则明显更笃定18读这本书时要注意区分谁在说话。

8. 可带走的

  1. 对照很关键:约 1750 亿条连接的人工网络,连接数与大脑神经元数量相当,就能生成语言;
  2. 不能用「复杂的行为自己冒出来了」搪塞 —— 这种网络恰恰是被特意构建来压制那个现象的;
  3. 核心主张:语言在根本上比它看起来更简单 —— 简单的不是模型,是语言;
  4. 训练做的事是「隐含地发现」了这些规律,不是被教会了规则;
  5. 两条已知法则:句法语法(它确实学会了嵌套树状结构)、三段论逻辑;
  6. 英语学得会、括号学不会,差别在「靠提示猜」还是「必须真的算」;
  7. 语义语法管「说得通」,不管「是真的」 —— 走查上就是:「桌子吃掉了星期二」卡在第 ② 关(桌子不是活物), 「大象去了月球」三关全过、但事实上没发生过;
  8. 语义语法必然预设一个世界模型,而写下世界模型的工具是计算语言(作者自家的产品);
  9. 两种压缩:计算语言是显式压缩,ChatGPT 是隐式压缩,做的是同一件事;
  10. 全书自述的总结里没有「理解」二字 —— 一切能力都是「续写相似文本」的结果;
  11. 这一整章是主张,不是结论;书里没有任何形式化证据。

9. 原文地图

主题原书章原文位置
大脑与网络的数量级对照真正让ChatGPT发挥作用的是什么text/15-fm-chatgpt.txt:16(搜「1000亿个神经元」)
排除「复杂性涌现」真正让ChatGPT发挥作用的是什么text/15-fm-chatgpt.txt:19(搜「规则30」)
核心主张真正让ChatGPT发挥作用的是什么text/15-fm-chatgpt.txt:24(搜「语言在根本上比它看起来更简单」) · text/15-fm-chatgpt.txt:24(搜「隐含地发现」)
句法语法与解析树真正让ChatGPT发挥作用的是什么text/15-fm-chatgpt.txt:33(搜「解析树」) · text/15-fm-chatgpt.txt:72(搜「嵌套树状」)
语法正确但无意义的句子真正让ChatGPT发挥作用的是什么text/15-fm-chatgpt.txt:75(搜「Inquisitive electrons」)
三段论真正让ChatGPT发挥作用的是什么text/15-fm-chatgpt.txt:81(搜「三段论」) · text/15-fm-chatgpt.txt:84(搜「Mad Libs」)
语义语法与世界模型语义语法和计算语言的力量text/17-fm.txt:16(搜「更加结构化」) · text/17-fm.txt:19(搜「语义语法」) · text/17-fm.txt:28(搜「世界模型」)
说得通不等于是真的语义语法和计算语言的力量text/17-fm.txt:25(搜「大象去了月球」)
计算语言的现状语义语法和计算语言的力量text/17-fm.txt:37(搜「两斤苹果」) · text/17-fm.txt:66(搜「形式化高塔」)
人类语言为何不精确语义语法和计算语言的力量text/17-fm.txt:52(搜「社会契约」)
两种压缩语义语法和计算语言的力量text/17-fm.txt:69(搜「终极压缩」)
全书自述总结那么,ChatGPT到底在做什么?它为什么能做到这些?text/18-fm-chatgpt.txt:16(搜「与之类似」) · text/18-fm-chatgpt.txt:25(搜「传统智慧的统计数据」)
与大脑的异同那么,ChatGPT到底在做什么?它为什么能做到这些?text/18-fm-chatgpt.txt:31(搜「重新计算数据」) · text/18-fm-chatgpt.txt:37(搜「human condition」)

Footnotes

  1. 出处:「真正让ChatGPT发挥作用的是什么」第 16 段(text/15-fm-chatgpt.txt:16,搜「1000亿个神经元」)。

  2. 出处:「真正让ChatGPT发挥作用的是什么」第 19 段(text/15-fm-chatgpt.txt:19,搜「规则30」)。规则 30 是作者 1983 年提出的一维二进制元胞自动机规则:规则极简,却能产生看上去随机的复杂图案。中文版编者注对此有说明。

  3. 出处:「真正让ChatGPT发挥作用的是什么」第 24 段(text/15-fm-chatgpt.txt:24,搜「语言在根本上比它看起来更简单」)与第 24 段(text/15-fm-chatgpt.txt:24,搜「隐含地发现」)。

  4. 出处:「真正让ChatGPT发挥作用的是什么」第 33 段(text/15-fm-chatgpt.txt:33,搜「解析树」)。

  5. 出处:「真正让ChatGPT发挥作用的是什么」第 72 段(text/15-fm-chatgpt.txt:72,搜「嵌套树状」)。

  6. 出处:「真正让ChatGPT发挥作用的是什么」第 75 段(text/15-fm-chatgpt.txt:75,搜「Inquisitive electrons」)。原句是「Inquisitive electrons eat blue theories for fish」。

  7. 出处:「真正让ChatGPT发挥作用的是什么」第 81 段(text/15-fm-chatgpt.txt:81,搜「三段论」)。第 84 段(text/15-fm-chatgpt.txt:84,搜「Mad Libs」)还提到 Mad Libs 式的「短语模板」是另一种更机械的做法,但作者认为 ChatGPT 用的是更一般的方法。

  8. 出处:「语义语法和计算语言的力量」第 19 段(text/17-fm.txt:19,搜「语义语法」)与第 16 段(text/17-fm.txt:16,搜「更加结构化」)。

  9. 出处:「语义语法和计算语言的力量」第 25 段(text/17-fm.txt:25,搜「大象去了月球」)。

  10. 出处:「语义语法和计算语言的力量」第 28 段(text/17-fm.txt:28,搜「世界模型」)。

  11. 出处:「语义语法和计算语言的力量」第 37 段(text/17-fm.txt:37,搜「两斤苹果」)。

  12. 出处:「语义语法和计算语言的力量」第 66 段(text/17-fm.txt:66,搜「形式化高塔」)。作者也承认本体论这件事「并不容易」,并且说这可能正是亚里士多德之后两千多年里这方面几乎没有进展的原因。

  13. 出处:「语义语法和计算语言的力量」第 52 段(text/17-fm.txt:52,搜「社会契约」)。

  14. 出处:「语义语法和计算语言的力量」第 69 段(text/17-fm.txt:69,搜「终极压缩」)。

  15. 出处:「那么,ChatGPT到底在做什么?它为什么能做到这些?」第 16 段(text/18-fm-chatgpt.txt:16,搜「与之类似」)。

  16. 出处:「那么,ChatGPT到底在做什么?它为什么能做到这些?」第 25 段(text/18-fm-chatgpt.txt:25,搜「传统智慧的统计数据」)。

  17. 出处:「那么,ChatGPT到底在做什么?它为什么能做到这些?」第 31 段(text/18-fm-chatgpt.txt:31,搜「重新计算数据」)。同章第 37 段(text/18-fm-chatgpt.txt:37,搜「human condition」)把这件事称为理解「人类条件」核心特征的最佳动力。

  18. 出处:「导读序」第 332 段(text/01-fm.txt:332,搜「刘江」)。导读序把这一主张与伊尔亚·苏茨克维在访谈中强调的「GPT 的大思路是通过生成来获取世界模型的压缩表示」相提并论,称二者「异曲同工」——这是导读序作者的解读,不是 Wolfram 的原话。