下一步押注什么 — 2024 年这一行看好的五条路
这一章讲三件事: 2024 年年中这一行看好哪五个方向; 每个方向到底想解决什么问题;以及两年过去,哪几条走通了、哪几条还在原地。 第 02 章讲的是「已经成了的东西」,这一章讲的是「当时押在牌桌上的东西」—— 所以它的价值不在结论,在于它保存了一份可以事后对账的清单。
1. 先看现象:每隔几个月就冒出一个「取代 Transformer」的新名字
你大概见过这种新闻标题:「XX 架构横空出世,回答速度快 5 倍」「Transformer 时代要结束了」。
过两个月,声音没了,大家还在用 Transformer。
这不是新闻在骗人,而是**「论文上跑赢」和「产业里换掉」之间隔着很远**。 这本书恰好写在这类新闻最密集的时候,所以它把当时桌上的牌几乎全记了下来—— 这份记录今天最大的用处,是拿来对账。
2. 顶层全景:五条路,各自想补哪个窟窿
第 02 章留下的四个短板
├─ 长文章吃不消、算得太费 ──→ ① 换个造法:非 Transformer 架构
├─ 只会读文字,看不见听不见 ─→ ② 什么信息都能吃:多模态与跨模态
├─ 只会一问一答,不会办事 ──→ ③ 让它自己干活:智能体
├─ 只活在屏幕里,碰不到东西 ─→ ④ 装进机器人:具身智能
└─ 结构是拍脑袋定的,没根据 ─→ ⑤ 回头找生物学借灵感:生物智能
图说:五条路不是并列的赛道,是分别针对上一章那四个短板 + 一个「结构从哪来」的追问。
书里是并列陈述的,这条对应关系是我们整理出来的。
这张图也说明了这一章为什么可以跳着读:五条路互不依赖。
一条贯穿全章的主走查:一份 8000 字的报告
下面拿同一份东西走五条路,一条路占一步。 凡不是论文里给出的数值,都是为演示编的。
输入: 一份 8000 字的行业报告,配一张季度走势图。
第 ① 步,交给今天的 Transformer。 它要让这 8000 个字两两互相比对一遍,也就是 8000 × 8000 = 6400 万次比对。 把报告换成 16000 字,这个数变成 2.56 亿——长度翻一倍,活儿翻四倍。 这正是第 02 章那张短板表第一行说的事。
第 ① 步的另一半,交给另一类做法:状态空间——不保存全部历史,只维护一小块「当前状态」。 它不回看原文,只留着那一块状态:读第 1 个字更新一次,读第 8000 个字也是更新一次, 每个字的开销从头到尾一样,不管前面有多长。 代价当场就能说清——读到第 8000 个字的时候,前面 7999 个字只剩下这块状态里的痕迹; 报告开头那句「本季调查了 1200 家企业」如果没被记进这块状态,它就再也找不回来了。
第 ② 步,把那张走势图也喂进去。 多模态是让报告和图一起进去、合成一个理解: 正文只说「第三季度下滑」,图上那条曲线在 9 月 12 日拐头, 两样合起来才知道拐在哪一天。 跨模态是另一件事——拿这 8000 字换出一段 60 秒的视频,输入进去、输出的是另一种东西。
第 ③ 步,让它自己去补一个报告里没有的数。 报告里缺 2024 年的行业总量。智能体这一步会自己判断「我得去查一下」, 调一次查资料的工具(这个动作行话叫检索),把查回来的数填进结论, 然后重新决定下一步该干什么。 「怎么调这个工具」正是书完全没讲的那一层,见第 5 节。
第 ④ 步,把结论变成一个真实动作。 具身智能这一步是:把「第三季度下滑」这个结论交给车间里的一台机械臂, 让它把某条产线的节拍从每分钟 30 件调到 22 件。 从这一步起,判断错了不再是一句话,是一个真实动作。
第 ⑤ 步,回头问一句:第 ① 步那 6400 万次比对,本来是从哪儿抄来的? 是从人的注意力系统抄来的。生物智能这条路问的就是:还能再抄点什么?
五条路各动了一处——①换算法、②换输入的种类、③换「谁决定下一步」、 ④换输出的形态、⑤换灵感的来源。下面第 3 到第 7 节,把这五步各自展开。
3. ① 换个造法:那些「非 Transformer」架构
它想解决什么
第 02 章说过 Transformer 的头号短板:文章越长,要算的量涨得越猛。 书把这件事的后果说得很直接——基于 Transformer 的模型计算成本高、效率低、还爱编1。
于是有人问:能不能换一种造法,让「长度翻倍、成本也只翻倍」而不是涨得更猛?
书列的五类尝试
书把当时的新架构分成五类2。这张表不用记名字,记住每一类在动哪儿就行:
| 这一类在动哪儿 | 书举的例子 |
|---|---|
| 只改 Transformer 内部的细节 | 华为诺亚方舟实验室与北京大学的 PanGuπ,专门治「特征坍塌」——就是网络算到后来,不同的输入被算成了几乎一样的结果,等于把差别抹平了3 |
| 回头借循环网络的思路 | Mamba 属于一类叫状态空间——就是不保存全部历史,只维护一小块「当前状态」,读一个词就更新一次——的做法;书里给的全名是「选择性状态空间模型」,「选择性」指它会挑着记4 |
| 回头借卷积网络的思路 | TogetherAI 的 StripedHyena;腾讯与香港中文大学的 UniRepLKNet5 |
| 把两种思路缝在一起 | 微软研究院的 RetNet,用一种叫「多尺度保留」的机制替掉多头注意力;彭博提出的 RWKV,想同时要 Transformer 的训练速度和循环网络的回答速度6 |
| 干脆为某个专门任务重新设计 | 加州大学的 CyberDemo(让机器人靠看视频学动作)、卡内基梅隆大学的 H2O(人实时遥控人形机器人)7 |
为什么第二类最值得看:「不保存全部历史」意味着什么
这一类的想法值得单独说清楚,因为它和 Transformer 的分歧是根本性的。
Transformer:每写一个字,都把前面所有字重新看一遍
⟹ 前面越长,每个字的开销越大
状态空间: 只维护一小块「当前状态」,读一个字就更新一次状态,原文不再回看
⟹ 前面多长,每个字的开销都一样
图说:前者是「每次重读全书」,后者是「边读边记笔记,只留笔记」。
笔记省事,但笔记里没写的东西就永远找不回来了——这是它的代价。
补充(不在书里): Mamba 的原始论文题为《Mamba: Linear-Time Sequence Modeling with Selective State Spaces》,作者是 Albert Gu 与 Tri Dao,2023 年 12 月 1 日提交。 论文自报的结果有三条。先说其中那个词:线性——就是「长度翻倍、开销也只翻倍」,不会涨得更猛。
三条依次是:开销随长度线性增长;生成速度约为同等 Transformer 的 5 倍; 30 亿参数的 Mamba 在语言任务上能打平两倍大的 Transformer。
来源:https://arxiv.org/abs/2312.00752(查阅于 2026-08-25)
判断(我们的,不是书里的): 书这里有一处时间写错了。 书写的是「2023 年 6 月,研究者 Albert Gu 提出了 Mamba 模型架构」4, 而论文实际是同年 12 月 1 日提交的,早了将近半年。 这类偏差单独看无关紧要,但它和第 01 章那几处错误是同一种毛病: 凡是书自己没有一手接触的技术事实,时间和归属都要重核。 如果错,会错在: 如果 Albert Gu 确实在 2023 年 6 月有过一次公开报告或预印稿而我们没查到, 那书就没写错,是我们只认了论文提交日。判据是:能不能找到 6 月的公开记录。
边界:书自己也没说这些新架构什么时候能用
书的原话只说这些新架构「与同等规模的 Transformer 架构相比,普遍表现更佳」, 然后接了一句「随着这些模型架构逐渐验证成功,它们将逐步进入产业界」2。
这句话里没有判据。 「逐渐」是多久、「验证成功」的标准是什么,一个字没有。
判断(我们的,不是书里的): 两年过去,这条路兑现的方式和书的设想不一样。 Transformer 没有被换掉;真正大规模落地的改动,发生在 Transformer 内部—— 把一个大模型拆成一堆「专科医生」,每回答一个字只叫醒其中几个,这叫混合专家。 一个公开的例子是 DeepSeek-V3:总共 6710 亿参数,但每个字只用到 370 亿—— 十八分之一;它在 14.8 万亿字的材料上训练,全程约 278.8 万张 H800 显卡小时。 把这几个数换算成第 04 章那道题的口径,才看得出它有多省: 278.8 万卡时 折合六千张卡连跑 19 天; 而第 04 章那道题里,1750 亿参数的模型是「6141 张卡跑一天」,也就是约 14.7 万卡时。 DeepSeek-V3 的总参数是它的近四倍、训练材料(14.8 万亿字对 3000 亿字)是它的近五十倍, 而卡时只多了不到二十倍。 换句话说:这两年省成本的主力不是「换掉 Transformer」,是「同样是 Transformer,但每次只用一部分」。 如果错,会错在: 如果某一年状态空间那一类架构真的成了新主流, 那这条判断就要改成「它只是晚了几年」,而不是「押错了地方」。 依据:《DeepSeek-V3 Technical Report》(2024-12-27)https://arxiv.org/abs/2412.19437(查阅于 2026-08-25)