跳到主要内容

下一步押注什么 — 2024 年这一行看好的五条路

这一章讲三件事: 2024 年年中这一行看好哪五个方向; 每个方向到底想解决什么问题;以及两年过去,哪几条走通了、哪几条还在原地。 第 02 章讲的是「已经成了的东西」,这一章讲的是「当时押在牌桌上的东西」—— 所以它的价值不在结论,在于它保存了一份可以事后对账的清单。

1. 先看现象:每隔几个月就冒出一个「取代 Transformer」的新名字

你大概见过这种新闻标题:「XX 架构横空出世,回答速度快 5 倍」「Transformer 时代要结束了」。

过两个月,声音没了,大家还在用 Transformer。

这不是新闻在骗人,而是**「论文上跑赢」和「产业里换掉」之间隔着很远**。 这本书恰好写在这类新闻最密集的时候,所以它把当时桌上的牌几乎全记了下来—— 这份记录今天最大的用处,是拿来对账。

2. 顶层全景:五条路,各自想补哪个窟窿

第 02 章留下的四个短板
├─ 长文章吃不消、算得太费 ──→ ① 换个造法:非 Transformer 架构
├─ 只会读文字,看不见听不见 ─→ ② 什么信息都能吃:多模态与跨模态
├─ 只会一问一答,不会办事 ──→ ③ 让它自己干活:智能体
├─ 只活在屏幕里,碰不到东西 ─→ ④ 装进机器人:具身智能
└─ 结构是拍脑袋定的,没根据 ─→ ⑤ 回头找生物学借灵感:生物智能

图说:五条路不是并列的赛道,是分别针对上一章那四个短板 + 一个「结构从哪来」的追问。
书里是并列陈述的,这条对应关系是我们整理出来的。

这张图也说明了这一章为什么可以跳着读:五条路互不依赖。

一条贯穿全章的主走查:一份 8000 字的报告

下面拿同一份东西走五条路,一条路占一步。 凡不是论文里给出的数值,都是为演示编的。

输入: 一份 8000 字的行业报告,配一张季度走势图。

第 ① 步,交给今天的 Transformer。 它要让这 8000 个字两两互相比对一遍,也就是 8000 × 8000 = 6400 万次比对。 把报告换成 16000 字,这个数变成 2.56 亿——长度翻一倍,活儿翻四倍。 这正是第 02 章那张短板表第一行说的事。

第 ① 步的另一半,交给另一类做法:状态空间——不保存全部历史,只维护一小块「当前状态」。 它不回看原文,只留着那一块状态:读第 1 个字更新一次,读第 8000 个字也是更新一次, 每个字的开销从头到尾一样,不管前面有多长。 代价当场就能说清——读到第 8000 个字的时候,前面 7999 个字只剩下这块状态里的痕迹; 报告开头那句「本季调查了 1200 家企业」如果没被记进这块状态,它就再也找不回来了。

第 ② 步,把那张走势图也喂进去。 多模态是让报告和图一起进去、合成一个理解: 正文只说「第三季度下滑」,图上那条曲线在 9 月 12 日拐头, 两样合起来才知道拐在哪一天。 跨模态是另一件事——拿这 8000 字换出一段 60 秒的视频,输入进去、输出的是另一种东西。

第 ③ 步,让它自己去补一个报告里没有的数。 报告里缺 2024 年的行业总量。智能体这一步会自己判断「我得去查一下」, 调一次查资料的工具(这个动作行话叫检索),把查回来的数填进结论, 然后重新决定下一步该干什么。 「怎么调这个工具」正是书完全没讲的那一层,见第 5 节。

第 ④ 步,把结论变成一个真实动作。 具身智能这一步是:把「第三季度下滑」这个结论交给车间里的一台机械臂, 让它把某条产线的节拍从每分钟 30 件调到 22 件。 从这一步起,判断错了不再是一句话,是一个真实动作。

第 ⑤ 步,回头问一句:第 ① 步那 6400 万次比对,本来是从哪儿抄来的? 是从人的注意力系统抄来的。生物智能这条路问的就是:还能再抄点什么?

五条路各动了一处——①换算法、②换输入的种类、③换「谁决定下一步」、 ④换输出的形态、⑤换灵感的来源。下面第 3 到第 7 节,把这五步各自展开。

3. ① 换个造法:那些「非 Transformer」架构

它想解决什么

第 02 章说过 Transformer 的头号短板:文章越长,要算的量涨得越猛。 书把这件事的后果说得很直接——基于 Transformer 的模型计算成本高、效率低、还爱编1

于是有人问:能不能换一种造法,让「长度翻倍、成本也只翻倍」而不是涨得更猛?

书列的五类尝试

书把当时的新架构分成五类2这张表不用记名字,记住每一类在动哪儿就行:

这一类在动哪儿书举的例子
只改 Transformer 内部的细节华为诺亚方舟实验室与北京大学的 PanGuπ,专门治「特征坍塌」——就是网络算到后来,不同的输入被算成了几乎一样的结果,等于把差别抹平了3
回头借循环网络的思路Mamba 属于一类叫状态空间——就是不保存全部历史,只维护一小块「当前状态」,读一个词就更新一次——的做法;书里给的全名是「选择性状态空间模型」,「选择性」指它会挑着记4
回头借卷积网络的思路TogetherAI 的 StripedHyena;腾讯与香港中文大学的 UniRepLKNet5
把两种思路缝在一起微软研究院的 RetNet,用一种叫「多尺度保留」的机制替掉多头注意力;彭博提出的 RWKV,想同时要 Transformer 的训练速度和循环网络的回答速度6
干脆为某个专门任务重新设计加州大学的 CyberDemo(让机器人靠看视频学动作)、卡内基梅隆大学的 H2O(人实时遥控人形机器人)7

为什么第二类最值得看:「不保存全部历史」意味着什么

这一类的想法值得单独说清楚,因为它和 Transformer 的分歧是根本性的。

Transformer:每写一个字,都把前面所有字重新看一遍
⟹ 前面越长,每个字的开销越大

状态空间: 只维护一小块「当前状态」,读一个字就更新一次状态,原文不再回看
⟹ 前面多长,每个字的开销都一样

图说:前者是「每次重读全书」,后者是「边读边记笔记,只留笔记」。
笔记省事,但笔记里没写的东西就永远找不回来了——这是它的代价。

补充(不在书里): Mamba 的原始论文题为《Mamba: Linear-Time Sequence Modeling with Selective State Spaces》,作者是 Albert Gu 与 Tri Dao,2023 年 12 月 1 日提交。 论文自报的结果有三条。先说其中那个词:线性——就是「长度翻倍、开销也只翻倍」,不会涨得更猛。

三条依次是:开销随长度线性增长;生成速度约为同等 Transformer 的 5 倍; 30 亿参数的 Mamba 在语言任务上能打平两倍大的 Transformer。

来源:https://arxiv.org/abs/2312.00752(查阅于 2026-08-25)

判断(我们的,不是书里的): 书这里有一处时间写错了。 书写的是「2023 年 6 月,研究者 Albert Gu 提出了 Mamba 模型架构」4, 而论文实际是同年 12 月 1 日提交的,早了将近半年。 这类偏差单独看无关紧要,但它和第 01 章那几处错误是同一种毛病: 凡是书自己没有一手接触的技术事实,时间和归属都要重核。 如果错,会错在: 如果 Albert Gu 确实在 2023 年 6 月有过一次公开报告或预印稿而我们没查到, 那书就没写错,是我们只认了论文提交日。判据是:能不能找到 6 月的公开记录。

边界:书自己也没说这些新架构什么时候能用

书的原话只说这些新架构「与同等规模的 Transformer 架构相比,普遍表现更佳」, 然后接了一句「随着这些模型架构逐渐验证成功,它们将逐步进入产业界」2

这句话里没有判据。 「逐渐」是多久、「验证成功」的标准是什么,一个字没有。

判断(我们的,不是书里的): 两年过去,这条路兑现的方式和书的设想不一样。 Transformer 没有被换掉;真正大规模落地的改动,发生在 Transformer 内部—— 把一个大模型拆成一堆「专科医生」,每回答一个字只叫醒其中几个,这叫混合专家。 一个公开的例子是 DeepSeek-V3:总共 6710 亿参数,但每个字只用到 370 亿—— 十八分之一;它在 14.8 万亿字的材料上训练,全程约 278.8 万张 H800 显卡小时。 把这几个数换算成第 04 章那道题的口径,才看得出它有多省: 278.8 万卡时 折合六千张卡连跑 19 天; 而第 04 章那道题里,1750 亿参数的模型是「6141 张卡跑一天」,也就是约 14.7 万卡时。 DeepSeek-V3 的总参数是它的近四倍、训练材料(14.8 万亿字对 3000 亿字)是它的近五十倍, 而卡时只多了不到二十倍。 换句话说:这两年省成本的主力不是「换掉 Transformer」,是「同样是 Transformer,但每次只用一部分」。 如果错,会错在: 如果某一年状态空间那一类架构真的成了新主流, 那这条判断就要改成「它只是晚了几年」,而不是「押错了地方」。 依据:《DeepSeek-V3 Technical Report》(2024-12-27)https://arxiv.org/abs/2412.19437(查阅于 2026-08-25)

4. ② 什么信息都能吃:多模态与跨模态

先把两个词分清楚,这是这一节唯一的难点

书用了「多模态」和「跨模态」两个词,而且给了不一样的定义,但没有把区别点破。 点破之后其实很好记:

多模态跨模态
干什么同时吃进好几种信息,合成一个理解8从一种信息转成另一种信息9
一句话看着 X 光片、同时读病历,再下判断你写一段文字,它给你一段视频
书举的例子医疗诊断、情感分析、自动驾驶图文互转、视频摘要、文字生成视频

记住这条:多模态是「一起看」,跨模态是「翻译过去」。 全书后面提到这两个词都是这个意思。

为什么要走这条路

书给的理由朴素而正确:现实世界的信息本来就是多种多样的8

而且它举了一个很好的扩展例子:能吃的不止是文字图片声音, 还包括激光雷达扫出来的点、红外成像这类工业传感数据,以及蛋白质、基因、脑电这类生物数据8

这一句是这一节最有价值的地方: 它把「多模态」从「文字 + 图片」这个狭窄印象里拉了出来。 凡是能变成数的东西,都可以是一种模态。

多模态为什么真的更强:四条,只有两条是硬的

书列了四条好处10,我们按含金量排一下:

书说的好处含金量
信息互补:文字能补上图片里缺的背景。这是真正的增量:两种信息各自缺的那块,对方补得上
应对残缺:一种信息出问题,另一种还能顶上。这是工程上最直接的收益
数据融合:把不同来源拼成一个统一表示这是做法,不是好处
复杂交互处理:情感分析时信息更丰富这是「信息互补」的一个特例

书里最实的两个例子

  • ImageBind(Meta):一个模型同时吃文本、音频、视觉、运动、温度——这里是字面意思, 就是冷热——和深度六种信息11;
  • Sora(OpenAI):按一段短文字生成最长 1 分钟的高清视频12

为什么举这两个: 前者说明「模态可以远远超过三种」,后者说明「跨模态可以跨得很远」。

边界

书列的三条趋势里,第三条其实是个成本问题: 大家在找办法减少多模态模型吃掉的算力,思路是拿一个现成的语言模型当底子, 在它上面接别的信息,而不是从零训一个13

这条今天仍然是行业默认做法,书当时就看准了。

5. ③ 让它自己干活:智能体

先看现象:你其实一直在替它跑腿

你让模型帮你订个会议室,它会告诉你「你可以这样订」; 你让它查一下昨天的销售额,它会告诉你「你可以打开报表看看」。

它出主意,你跑腿。 智能体想改的就是这一步。

书采用的定义

书直接引用了 Octane AI 的联合创始人 Matt Schlicht 的说法14:

给定一个目标,它们能够自行创建任务、完成任务、创建新的任务、 重新确定任务列表的优先级、完成新的首要任务,并不断重复这个过程,直到达成目标。

这句话里的关键词是「重新确定优先级」。 它意味着智能体不是「按脚本执行」, 而是每做完一步都重新判断下一步该干什么——这也正是它容易跑偏的地方。

书给的三条能力,以及各自的证据

能力书举的证据这个证据说明了什么
自己学英伟达的 Voyager,2023 年 5 月,在《我的世界》里自主编写代码,全场景终身学习,完全不用人插手15在一个规则封闭、反馈即时的游戏里成立
高度自主DeepMind 的 SIMA,2024 年 3 月,在全新环境里照口头指令执行任务16说明「换个没见过的场景还能干」这一步开始有了
会协作斯坦福与谷歌的「西部世界小镇」,2023 年 4 月,25 个智能体;给其中一个设定「办情人节派对」的目标,它会拉闺蜜一起布置、主动邀请路上遇到的角色,最后大多数智能体都知道了这场派对,并约好时间出席17说明多个智能体之间会自发形成信息传播

第三个例子值得停一下。 它不是在演示「AI 会办派对」, 而是在演示信息如何在一群自主个体之间自己扩散开——这是社会科学的实验方法, 用在了 AI 上。

这一节最大的缺口:书没讲它怎么「调工具」

智能体要办事,就得调用外部的东西:查数据库、发邮件、跑一段代码。

书从头到尾没有讲这一步是怎么实现的。 它讲了愿景、列了案例, 但「模型怎么知道有哪些工具可用、怎么把参数填对、失败了怎么办」——一个字没有。

补充(不在书里): 书出版半年后,这一层出现了公开标准。 2024 年 11 月 25 日,Anthropic 公开了 Model Context Protocol,中文叫「模型上下文协议」, 缩写 MCP——官方的一句话描述是:它「为把 AI 系统连接到各种数据源提供一个通用的开放标准, 用一个协议取代零散的对接」。

它要解决的是一个很土的工程问题: 有 M 个 AI 应用、N 个数据源, 过去要写 M×N 套对接;有了统一协议之后,只需要 M+N 套。

来源:Anthropic《Introducing the Model Context Protocol》(2024-11-25) https://www.anthropic.com/news/model-context-protocol(查阅于 2026-08-25)

判断(我们的,不是书里的): 这个缺口不是疏忽,是视角决定的。 这本书是从产业和市场的角度看智能体的——谁在投、投了多少、落在哪些行业; 而「怎么调工具」是工程细节,在产业报告的取材范围之外。 实用推论:拿这本书了解「2024 年谁在做智能体」很好用,拿它了解「智能体怎么做」完全不够。 如果错,会错在: 如果书的目标读者本来就包含技术从业者(前言里确实列了这一类读者), 那这就不是视角问题,而是该讲没讲。

6. ④ 装进机器人:具身智能

一句话定义

把智能系统和一个真实的身体绑在一起,让它靠感知、认知、交互去理解并影响周围环境18

「具身」两个字的意思就是「有身体」。关键不在于长得像不像人,在于它必须处理真实世界的不确定。

书举的那个例子值得记住

加州大学伯克利分校的 LM Nav 项目:用三个模型拼起来—— 一个负责看路、一个负责理解语言、一个负责把图片和文字对上—— 让机器人不看地图,只凭一句话就走到指定地点19

为什么这个例子好: 它展示了当时最典型的做法—— 不重新训一个大模型,而是把几个现成的模型接起来用。

书给的三条演进方向

方向书的说法
形态更多样不只是人形,还有宠物机器人、工业机器人、自动驾驶20
感知与交互更丰富上海人工智能实验室的 OpenPAL、Figure 01 接入大模型、谷歌的 PaLM-E21
越试越会斯坦福 2024 年 1 月的 ALOHA,浇花、扫地、做饭、叠衣服都能干,甚至能给自己充电22

边界:书没说的那件事

这一节通篇是「能做到什么」,没有一句「多久能做到一次、成功率多少」。

演示视频里机器人叠好了一件衣服,和它能连续叠一百件而不出错, 中间隔着这个行业最难的一道坎——而这本书没有提这道坎的存在。

判断(我们的,不是书里的): 判断具身智能的进展,只需要问一个问题: 「这个演示做了几次?成功了几次?」 这一节引用的所有案例,书里都没有给出这个数。 在没有成功率的情况下,任何机器人演示都只能当成「可能性证明」,不能当成「能力证明」。 如果错,会错在: 如果某个案例的原始论文里其实公布了成功率而书只是没转述, 那这是转述的取舍问题,不是研究本身的问题——去看原始论文即可。

7. ⑤ 回头找生物学借灵感:生物智能

这一节在讲什么

这一节的性质和第 01 章那个「硅基生命」的小节相似:它是视野,不是内容。

书的意思是:今天神经网络里好几样东西,本来就是从生物学抄来的23——

现在用的东西抄自哪儿
训练时随机关掉一部分单元防止死记硬背(叫 Dropout)神经活动本身带随机性
注意力人的注意力系统
遗传算法(照「变异 + 选择」去搜答案)生物进化
蚁群、鱼群这类算法生物群体的集体行为

这张表是这一节唯一的硬内容,而且很有说服力:借鉴确实发生过,而且不止一次。

书押的两个方向

  • 脑机接口——在头上装电极,把大脑的电信号读出来、翻译成设备能懂的命令。 这个概念 1973 年由美国科学家 J. Vidal 提出;书举的进展是 2024 年 1 月 Neuralink 宣布完成首例人脑植入, 以及清华大学与宣武医院让脊髓损伤患者自主控制喝水24;

  • 数字孪生——在计算机里造一个和真实对象一一对应的副本,真的那边一变,副本跟着变; 书押的方向是「数字孪生大脑」,举的是复旦大学的数字孪生脑平台,自称与原脑的相似度达到 90%25

判断(我们的,不是书里的): 那个「90% 相似度」不能当数字用。 大脑和它的计算机副本之间,「相似」根本没有公认的度量方式—— 是神经元数量?连接结构?还是某个任务上的行为一致?书里没有交代任何一种。 一个没有定义度量方式的百分比,信息量是零。 如果错,会错在: 如果原始研究里定义了明确的度量口径而书只是没转述, 那这个数就是有意义的——但拿它去引用之前,必须先找到那个口径。

8. 作者的判断与证据:哪些有依据,哪些是押注

这一章几乎全是「有人做了什么」,判断很少,但那几处判断分量不轻。

档次这一章里的例子
有明确依据(可核对的事实)各架构的提出方与时间(但时间需要重核,见第 3 节)、ImageBind 的六种信息、Sora 的 1 分钟、西部世界小镇的 25 个智能体、Neuralink 2024 年 1 月的首例植入
转述他人观点Matt Schlicht 对智能体的定义;OpenAI 关于「把别的信息类型融进语言模型是新方向」的说法26
作者自己的押注「非 Transformer 架构预示着 AI 模型架构的新黄金时期即将到来」2;「智能体预计将成为未来大模型应用的关键竞争领域」;「脑机接口和数字孪生大脑预计将成为生物智能最先取得突破的两个重要方向」27

第三档要特别小心:它们的措辞都是「预示着」「预计将」,没有任何时间表和判据。 这类句子读起来像预测,实际上不可证伪——因为它没说什么时候、什么算成。

9. 边界与局限

这一章没覆盖的东西:

  • 没有任何一条失败记录。 五个方向、几十个案例,没有一个「试过但没成」;
  • 没有成本对比。 说新架构「表现更佳」,但没有一处给出「同样的钱能买到多少」;
  • 智能体怎么调工具、多步任务怎么保证不出错——整层工程现实缺席(见第 5 节);
  • 不同方向之间的相互关系。 比如具身智能其实高度依赖多模态,书把它们平行陈列,没有连线。

两年后对账:

书当时押的今天怎么看
换掉 Transformer没换掉。 真正大规模兑现的是「同样是 Transformer,但每次只用一部分」(混合专家),不是另起炉灶
什么信息都能吃兑现了,而且正是书说的那条路——拿现成的语言模型当底子往上接
让它自己干活方向兑现,但缺的那一层被补上了:工具怎么接有了公开标准(MCP),这正是书完全没讲的部分
装进机器人仍在演示阶段。书当年没给成功率,今天判断它的进展依然只能盯这一个数
跟生物学互相借鉴仍属长线。脑机接口有个案进展,数字孪生大脑没有公认口径

10. 可带走的

  1. 这一章是一份押注清单,不是结论——它最大的价值是可以事后对账;
  2. 同一份 8000 字的报告,五条路各动一处:Transformer 要算 8000×8000 = 6400 万次两两比对, 状态空间只留一块状态,多模态再喂一张配图,智能体自己去调一次工具,具身智能把结论变成一个机械动作;
  3. 五条路各自补的是第 02 章那四个短板,不是五条并列的赛道;
  4. 状态空间那一类架构的分歧点是「回不回看原文」——不回看就省事,但没记下来的东西找不回来;
  5. 书把 Mamba 的时间写早了半年,凡是它二手转述的技术事实都要重核;
  6. 多模态是「一起看」,跨模态是「翻译过去」——这两个词全书都是这个意思;
  7. 凡是能变成数的东西都可以是一种模态,别把多模态想窄成「文字 + 图片」;
  8. 多模态真正硬的好处只有两条:信息互补、一种信息坏了另一种能顶上;
  9. 智能体的定义里最关键的是「重新确定优先级」——这既是它的本事,也是它跑偏的原因;
  10. 书完全没讲智能体怎么调外部工具,而那正是这两年真正被补上的一层;
  11. 判断机器人演示,只问一个数:做了几次、成了几次——这一章的案例一个都没给;
  12. 神经网络借鉴生物学确有其事(随机关单元、注意力、遗传算法、蚁群算法),这是这一节唯一的硬内容;
  13. 「90% 相似度」这类没有度量口径的百分比,信息量是零,别引用。

11. 原文地图

主题原书章原文位置
五条路的总起2.2 大模型技术进化路线text/12-ch02-02-2-2.txt:16(搜「新算法框架」)
架构优化的四种动法2.2.1 新算法框架text/12-ch02-02-2-2.txt:27(搜「网络架构优化」)
非 Transformer 架构总述2.2.1text/12-ch02-02-2-2.txt:30(搜「非Transformer架构正在蓬勃发展」)
PanGuπ 与特征坍塌2.2.1text/12-ch02-02-2-2.txt:33(搜「PanGu」)
Mamba 与状态空间2.2.1text/12-ch02-02-2-2.txt:36(搜「Mamba模型架构」)
StripedHyena、UniRepLKNet2.2.1text/12-ch02-02-2-2.txt:39(搜「StripedHyena」)
RetNet、RWKV2.2.1text/12-ch02-02-2-2.txt:42(搜「RetNet」)
CyberDemo、H2O2.2.1text/12-ch02-02-2-2.txt:45(搜「CyberDemo」)
多模态的定义与信息类型2.2.2 多模态和跨模态text/12-ch02-02-2-2.txt:56(搜「GPT-4V」) · text/12-ch02-02-2-2.txt:59(搜「激光雷达点云数据」)
多模态的四条好处2.2.2text/12-ch02-02-2-2.txt:62(搜「数据融合」)
多模态的来历与场景2.2.2text/12-ch02-02-2-2.txt:74(搜「多模态学习起源于20世纪90年代」)
跨模态的定义与四个特性2.2.2text/12-ch02-02-2-2.txt:86(搜「跨模态大模型可以在不同模态」)
Sora 的一分钟2.2.2text/12-ch02-02-2-2.txt:101(搜「长达1min的高清视频」)
ImageBind 的六种信息2.2.2text/12-ch02-02-2-2.txt:107(搜「ImageBind」)
省算力的思路2.2.2text/12-ch02-02-2-2.txt:113(搜「减少多模态大模型的算力资源消耗」)
智能体的定义2.2.3 智能体text/12-ch02-02-2-2.txt:124(搜「Matt Schlicht」)
投入增幅与行业案例2.2.3text/12-ch02-02-2-2.txt:127(搜「300%」)
Voyager 自主写代码2.2.3text/12-ch02-02-2-2.txt:136(搜「Voyager」)
SIMA 的泛化能力2.2.3text/12-ch02-02-2-2.txt:142(搜「SIMA」)
西部世界小镇2.2.3text/12-ch02-02-2-2.txt:148(搜「西部世界小镇」)
具身智能的定义2.2.4 具身智能text/12-ch02-02-2-2.txt:159(搜「将智能系统与物理实体结合」)
LM Nav2.2.4text/12-ch02-02-2-2.txt:162(搜「LM Nav」)
形态多样化2.2.4text/12-ch02-02-2-2.txt:171(搜「宠物机器人」)
OpenPAL、Figure 01、PaLM-E2.2.4text/12-ch02-02-2-2.txt:177(搜「OpenPAL」)
ALOHA2.2.4text/12-ch02-02-2-2.txt:183(搜「ALOHA」)
生物智能的定义2.2.5 生物智能text/12-ch02-02-2-2.txt:194(搜「生物智能是一个跨学科的研究领域」)
从生物学借来的四样东西2.2.5text/12-ch02-02-2-2.txt:197(搜「Dropout」)
两个突破方向2.2.5text/12-ch02-02-2-2.txt:200(搜「脑机接口和数字孪生大脑」)
脑机接口的来历与进展2.2.5text/12-ch02-02-2-2.txt:206(搜「J. Vidal」)
数字孪生脑的 90%2.2.5text/12-ch02-02-2-2.txt:212(搜「相似度高达90%」)

Footnotes

  1. 出处:「2.2.1 新算法框架」第 30 段(text/12-ch02-02-2-2.txt:30,搜「非Transformer架构正在蓬勃发展」)。原文列的三条局限是「计算成本高、效率低、幻觉问题」。

  2. 出处:「2.2.1」第 30 段(text/12-ch02-02-2-2.txt:30,搜「新黄金时期」)。五类的划分是书自己给的编号,不是我们加的。 2 3

  3. 出处:「2.2.1」第 33 段(text/12-ch02-02-2-2.txt:33,搜「PanGu」)。「特征坍塌」这个词书里只出现了一次、没有解释,这里的解释是我们补的(补充,不在书里,来自通用知识):指网络越算到深处、不同输入的内部表示越趋于雷同,可区分的信息被抹平。

  4. 出处:「2.2.1」第 36 段(text/12-ch02-02-2-2.txt:36,搜「Mamba模型架构」)。原文写的是「2023年6月,研究者Albert Gu提出了Mamba模型架构」——时间与论文提交日不符,见正文判断块。原文对它的比方是「像是在阅读过程中暂存信息,读完一个文档后,可能能够回答与文档相关的问题,无需再次查阅该文档」。 2

  5. 出处:「2.2.1」第 39 段(text/12-ch02-02-2-2.txt:39,搜「StripedHyena」)。同段还提到腾讯与香港中文大学的 UniRepLKNet。

  6. 出处:「2.2.1」第 42 段(text/12-ch02-02-2-2.txt:42,搜「RetNet」)。「多尺度保留」是书里给的译名(Multi-Scale Retention)。RWKV 的提出者书写作「香港大学物理系的彭博」。

  7. 出处:「2.2.1」第 45 段(text/12-ch02-02-2-2.txt:45,搜「CyberDemo」)。同段的 H2O 出自卡内基梅隆大学,2024 年 3 月 11 日,做的是人对人形机器人的实时全身遥控。

  8. 出处:「2.2.2 多模态和跨模态」第 59 段(text/12-ch02-02-2-2.txt:59,搜「激光雷达点云数据」)。「现实世界中的信息通常是多样化的」这句理由见第 56 段(text/12-ch02-02-2-2.txt:56,搜「GPT-4V」)。 2 3

  9. 出处:「2.2.2」第 86 段(text/12-ch02-02-2-2.txt:86,搜「跨模态大模型可以在不同模态」)。书给跨模态列的第一条特性就是「输入和输出的数据形式不同」。

  10. 出处:「2.2.2」第 62 段(text/12-ch02-02-2-2.txt:62,搜「数据融合」)。四条依次是数据融合、信息互补、复杂交互处理、应对不完整或不准确的数据;含金量的排序是我们加的。

  11. 出处:「2.2.2」第 107 段(text/12-ch02-02-2-2.txt:107,搜「ImageBind」)。原文列的六种是「文本、音频、视觉、运动、温度、深度」。

  12. 出处:「2.2.2」第 101 段(text/12-ch02-02-2-2.txt:101,搜「长达1min的高清视频」)。

  13. 出处:「2.2.2」第 113 段(text/12-ch02-02-2-2.txt:113,搜「减少多模态大模型的算力资源消耗」)。原文的说法是「将大规模语言模型(LLM)作为多模态大模型的先验知识和认知提升推动力」。

  14. 出处:「2.2.3 智能体」第 124 段(text/12-ch02-02-2-2.txt:124,搜「Matt Schlicht」)。这是书转引的第三方定义,不是作者自己下的定义。

  15. 出处:「2.2.3」第 136 段(text/12-ch02-02-2-2.txt:136,搜「Voyager」)。

  16. 出处:「2.2.3」第 142 段(text/12-ch02-02-2-2.txt:142,搜「SIMA」)。书在第 127 段(text/12-ch02-02-2-2.txt:127,搜「SIMA」)也提到它,那一处强调的是游戏场景。

  17. 出处:「2.2.3」第 148 段(text/12-ch02-02-2-2.txt:148,搜「西部世界小镇」)。

  18. 出处:「2.2.4 具身智能」第 159 段(text/12-ch02-02-2-2.txt:159,搜「将智能系统与物理实体结合」)。

  19. 出处:「2.2.4」第 162 段(text/12-ch02-02-2-2.txt:162,搜「LM Nav」)。三个模型分别是视觉导航模型 ViNG、语言模型 GPT-3、图文对齐模型 CLIP。

  20. 出处:「2.2.4」第 171 段(text/12-ch02-02-2-2.txt:171,搜「宠物机器人」)。

  21. 出处:「2.2.4」第 177 段(text/12-ch02-02-2-2.txt:177,搜「OpenPAL」)。同段提到 Figure AI 在 2024 年 3 月 14 日发布的视频,以及谷歌的 PaLM-E。

  22. 出处:「2.2.4」第 183 段(text/12-ch02-02-2-2.txt:183,搜「ALOHA」)。

  23. 出处:「2.2.5 生物智能」第 197 段(text/12-ch02-02-2-2.txt:197,搜「Dropout」)。原文把 Dropout 的来历归到「神经动力学内在随机性」,注意力归到「人类注意力系统」,遗传算法归到进化论,蚁群与鱼群算法归到生物群体行为。

  24. 出处:「2.2.5」第 206 段(text/12-ch02-02-2-2.txt:206,搜「J. Vidal」)。同段有 Neuralink 2024 年 1 月完成首例人脑植入,以及清华大学与宣武医院的无线微创临床试验。

  25. 出处:「2.2.5」第 212 段(text/12-ch02-02-2-2.txt:212,搜「相似度高达90%」)。

  26. 出处:「2.2.2」第 56 段(text/12-ch02-02-2-2.txt:56,搜「GPT-4V」)。原文转述的是 OpenAI 在 GPT-4V 系统简介里的说法。

  27. 出处:「2.2.5」第 200 段(text/12-ch02-02-2-2.txt:200,搜「脑机接口和数字孪生大脑」)。智能体那句预判见「4.2.3 智能体模式」第 127 段(text/18-ch04-02-4-2.txt:127,搜「关键竞争领域」); 「未来将会是一个非常有前景的领域」见「2.2.3」第 130 段(text/12-ch02-02-2-2.txt:130,搜「非常有前景的领域」)。