跳到主要内容

眼睛和手:它怎么接上外面的世界

这一章讲三件事: 它开始能看图了、能临时去外面取东西了、能让别人替它做事了。

它在全书链条里的位置: 前五章讲的都是「一个会写字的东西」。 这一章是全书的转折点——从这里开始,它不再只是聊天框里的一段文字, 而是能在流程里占一个位置的东西。 第 12 章那把「副驾还是代驾」的尺子、第 13–15 章所有的落地做法, 都建立在这一章的三步链上。

1. 顶层全景:一条三步链

这一节先把全章的骨架给出来,后面每一节补一格。

书里那个角色自己把这条链说清楚了:信息、模型、行动,这是三个步骤1

你的要求


①【信息】把大问题拆成小问题,再通过「信息插件」去外面取回需要的东西
│ —— 公网搜索、企业库检索……

②【模型】它自己理解、推理、把接下来要干的事排出来


③【行动】通过「行动插件」跟外面的世界打交道,把事真办了
—— 订票、订酒店、跑代码……

书里给的比方很好记:信息插件像它的耳目,行动插件像它的手脚, 它自己是中间那个大脑1

这一章的走查(第 7 节)就走这条链。

2. 它开始看图了

这一节讲第一样新东西,而且要说清它的边界。

书里的场景是:它升级了新版本,学习了许多没学过的新数据, 「我现在会看图了」2;新数据包括带字幕的图片,还有图文混合的文章和网页3

书里给的例子是一张照片,它的描述是: 「这张图讲的是一只猫睡着的姿势非常可爱,以至于它的主人在给它拍照的时候 感动得不能自已,流下了眼泪。」4

这种「不只吃文字」的本事叫多模态—— 模态就是信息的种类:文字是一种、图片是一种、声音和视频各是一种。 书里说,理想的状态是输入的时候各种模态它都看得懂听得懂, 输出的时候也能以多种模态来回答5

但要说清它当时到了哪一步: 书里那个角色自己说, 「看图只是第一步」,图片在学了,但视频知识可没那么容易6

3. 看图不只是「看图说话」

这一节给两个例子,它们说明「会看图」这件事的分量比你想的大。

第一个例子是图形推理题。 书里说,能看图之后,它还能做非文字的逻辑推理—— 书里点了一篇论文,里面那台机器做过瑞文智商测试里的图形推理题7这类题没有一个字,全是图形的排列规律。

第二个例子更实际:考卷。 书里那个角色自己说: 这几晚我做了好多人类考试题,理工科的卷子上经常会有图形和表格, 学会看图之后,这种题我就不怵了8

这两个例子说明:「会看图」打开的不是「描述图片」这一个功能, 是一整批原本连题目都读不全的任务。

而它和第 4、5 节那两类插件是互相配合的。 书里那个外行角色把这层关系说清楚了: 你学会了多模态的信息理解,信息插件就会给你搞来更丰富的、掺杂了图片视频的知识, 你就能解决更多的问题;否则,像购物、旅行、约会,无图无真相, 如果你只能看文本,那就很受限了9

4. 为什么视频难:原因出在方法本身

这一节回答一个很值得记住的技术边界,而且它和第 01 章直接相关。

书里给的原因只有一句,但这一句很硬:它用的那种「只看前面、往后写一个」的做法, 处理一个一个分开的字效果很好,但不适合视频—— 书里说这种信息又连续、又高维——高维的意思是, 一帧画面里有几十万个点,每个点还各带着颜色10

用第 01 章的话说:文字天生是一格一格的,而视频不是。 一段视频没有「下一个字」,只有连成一片的画面和时间。 这不是数据不够的问题,是方法本身对不上。

书里还提了一件更远的事,而且这件事把「模态」这个词的边界撑开了。

书里那个外行角色问:那张图上除了人类用户,怎么还有实体机器人? 回答是:不是它问我问题,而是它把自己感知的信息发送给我, 我根据这些信息做出判断,然后发指令指挥它做动作11

于是那个外行角色说出了这一节最要紧的一句: 连机器人的传感器数据、控制指令也算一种新的模态12——模态不止是「人能看能听的东西」,凡是能变成数据喂进去的都算。

为什么它想要机器人? 书里给的理由和第 04 章那一步是同一个道理: 还记得那个下棋程序自己跟自己下棋的强化学习吗?它每下一步棋,盘面形势都会发生变化, 作为它的反馈;而实体机器人在物理世界中每做一个动作,也会获得相应的环境反馈, 这也是强化学习的数据来源13

书里的落点是:我们要建立世界的模型,不光是学习已有的人类知识, 还要通过实践来获得对这个世界的深层理解14注意这是愿景,不是当时做到的事——书里那个角色自己说「这只是愿景,我还差得远呢」15

5. 有些东西必须临时去外面取

这一节讲第二样新东西,而且这一节是第 13 章的引子。

理由很实在:它脑子里的东西是训练时装进去的,装完就不再更新; 而且企业内部的东西它压根没见过

于是书里给了「信息插件」这一类: 它在回答时如果发现有些信息自己没学过、需要到网上搜,就会调用搜索那个角色去取回来, 然后接着回答16;除了公网搜索,还有到企业数据库里取信息的那一种16

取回来的东西怎么用? 这里必须说清楚,因为它决定了后面几章: 取回来的内容被拼进这一轮的提问里,它照着答。 ——回到第 01 章:它能看见的东西全在这一轮的文字里,取回来的资料也不例外。

这就带出了一个问题,而这个问题是第 13 章整章的题目: 公网可以搜,可企业库有几万页,拿什么决定取哪几页? (答案在第 13 章第 1、2 节。)

6. 它还能让别人替它做事

这一节讲第三样新东西,并且给这一整套挂上今天的名字。

书里的例子非常具体:有人要从北京去成都看大熊猫,给定兴趣偏好和预算范围之后, 它先调用各种信息插件,帮这个人做出一份旅行计划—— 推荐飞往成都的航班、合适的酒店、周边可以逛的地方、吃喝玩乐的方案17

问题来了:计划做好之后呢? 书里说得很到位: 在没有行动插件的时候,人拿着这份计划,要自己上各种应用去订票、订酒店、 买团购、预订位置,还是很麻烦的17有了行动插件,它就可以照着计划调用不同的插件,让它们分头去办,直接把活儿全干完17

书里还点名了另外两种:代码解释器(把它写的代码真正跑起来) 和实体机器人驱动18

现在挂牌。 上面这一整套——它自己把大问题拆成小问题、自己决定该调哪个插件、 拿到结果之后自己决定下一步做什么、一直走到事情办完—— 今天这种东西有一个通用的名字,叫智能体,英文写作 agent—— 两个说法是同一件事。

它调用插件这个动作,今天通行的说法叫工具调用。 这两个名字书里都没有用,但你出门一定会撞见它们—— 产品界面上、技术文档里、招聘启事上写的都是这两个词。 (它进了企业流程之后叫什么,第 12 章第 3 节讲。)

7. 主走查:从北京去成都看大熊猫

这是本章的主走查,三步链各占一步。

书里给了这个例子的前半段(信息与行动两侧),中间那些具体的航班、 酒店名和价格是我们为演示编的,不是书里的数值。

第几步这一步在做什么手里拿到什么
0你的要求我要从北京去成都看大熊猫,4 月 20 号出发玩 3 天,预算 4000 元
① 信息拆成小问题:去程航班?住哪儿?熊猫基地怎么安排?周边吃什么?四个子问题
① 信息调用搜索插件取回答案(演示数据) 4 月 20 日北京—成都直飞 8 个班次,最低 780 元;基地开放 7:30–18:00
② 模型自己排出一份计划一份三天行程:D1 抵达 + 宽窄巷子,D2 熊猫基地全天,D3 返程
③ 行动调用订票、订酒店、买门票三个插件分头去办三张确认单:机票 780 元、酒店两晚 620 元、门票 55 元,合计 1455 元
③ 行动把结果汇总回给你一句话:全部订好,共 1455 元,余额 2545 元

看清楚 ① 和 ③ 的区别:①只是取回信息,不改变外面的任何东西; ③会真的花掉你的钱。 这个区别在第 12 章会变成「放权到哪一级」, 在第 20 章会变成一笔要算的安全账。

8. 三年后:这些插头有了一份共同的规矩

这一节是书外补充,标明来源。

书里写这一段时,插件还是各家自己定各家的接法: 搜索一种接法、数据库一种接法、订票又是一种。 这种「两边事先说好、谁也不许乱来」的规矩,行话叫协议。

补充(不在书里,依据我们的协议书架):后来出现了一份这样的规矩, 让「取信息」和「做事情」这两类插头有了统一的接法,它叫模型上下文协议, 缩写 MCP——这三个字母是那三个英文词的头一个字母。

这份规矩把书里那两类插件按「谁来控制」重新分成了三件套: 工具——由它自己挑着调的那一类,相当于「手」; 资源——只读的那一类,相当于「资料」; 提示词——由用户点一下才触发的那一类,相当于「快捷指令」。 依据: shelf=ai-protocol-reference/mcp-spec#03-server-primitives.md §3.1 三件套与「谁来控制」 @4e67bdc2f3403a8602f72025b28ac27fe7fd4e44 事实=规范把提供方一侧的能力分成 tools / resources / prompts 三类, 并按「谁来控制」区分:工具由模型挑、资源是只读数据、提示词由用户触发。

这份规矩要解决的事,同一份拆解里写成了一句话:M×N 的接线问题被压成 M+N。 依据: shelf=ai-protocol-reference/mcp-spec#index.md §1 这是什么 @4e67bdc2f3403a8602f72025b28ac27fe7fd4e44 事实=三个角色分别是 AI 应用本体、它为每一个提供方单开的一条连接、以及提供方自己; 一个提供方看不到整段对话,也看不见别的提供方,完整对话历史只留在应用本体手里。

为什么值得在这里补一句? 因为书里那条三步链至今没变, 变的只是「插头怎么插」—— 理解了三步链,你就能读懂今天任何一份关于这类系统的文档。

9. 作者的判断与证据

说法性质
会看图、看图的例子事实,当时已经能做
三步链:信息、模型、行动事实,而且是全书最有用的一张图
旅行计划那个例子举例,不是已上线的产品
自回归不适合视频技术判断,书里没有展开论证
「利用实体机器人搜集世界数据」愿景。书里那个角色自己说「这只是愿景,我还差得远呢」15
「多模态和插件互相配合」作者的推断,合理但没有证据

必须点破的一处:这一章讲的三样东西,书里都只讲了「能做什么」, 没有讲「做不好会怎样」。 取回来的资料是错的怎么办? 行动插件订错了票谁负责?这两个问题书里在这一章一句没提, 要到第 12 章(谁背锅)和第 20 章(安全账)才被正面处理。

10. 这一章和后面九章的对接表

这一节是我们加的一张小地图,因为这一章的三样东西后面各自长成了一整章。

读这张表的方式:左边是这一章给你的零件,右边是它后来被装到了哪里。

这一章的东西后面长成了什么在哪
看图「多模态还差什么」被列进缺陷清单第 20 章第 2 节
信息插件「凭什么捞得准」的那套骨架第 13 章第 2 节
信息插件(企业侧)一封退货来信怎么被答上第 14 章第 4 节
行动插件放权分几级、谁背锅第 12 章第 4、7 节
三步链本身「它在流程里站哪个位置」第 12 章第 1 节
插件的成本每答一次要多花多少钱第 18 章第 2 节

这张表也解释了为什么这一章是转折点: 在它之前,这本书讲的是一台机器;在它之后,这本书讲的是一个岗位。

还有一件事这张表没列,但它其实是全书最贵的一项: 每加一个插件,就多一处可能出错的地方。 取回来的资料是错的、 订票插件订错了日期、跑代码的那一个删掉了不该删的东西—— 这三种错的严重程度完全不同,而书里在这一章一句都没有区分。 第 20 章那笔安全账,算的就是这些错各值多少钱。

11. 边界与局限

  • 书里没有讲插件是怎么被选中的。 它凭什么知道该调搜索而不是数据库? 这是这类系统最要紧的一步,书里跳过了。
  • 书里没有区分「取信息」和「做事情」在风险上的巨大差别。 前者错了只是答错,后者错了要花钱、要退票。
  • 这一章的所有例子都是单次的。 一次拆解、一次调用、一次汇总。 真实系统里它会来回好几圈,书里没有涉及。
  • 书里对视频的判断只给了结论。 「不适合连续高维的信息」这句是对的, 但为什么不适合、有什么替代路线,要到第 20 章才被另一位角色捎带提了一句。

12. 可带走的

  1. 一条三步链:信息、模型、行动。 耳目、大脑、手脚。
  2. 它开始能看图,但视频不行——原因不是数据不够,是「一格一格往下猜」这个方法对不上。
  3. 信息插件解决的是「它没学过、学过也过期了」。
  4. 取回来的资料是被拼进这一轮的提问里的,所以第 01 章那条规矩仍然成立。
  5. 企业库有几万页,凭什么取那几页——这是第 13 章的题目。
  6. 行动插件会真的花钱。 从这里开始,「答错」变成了「办错」。
  7. 这一整套今天叫智能体,它调插件那个动作叫工具调用。 书里没用这两个词,但你出门会撞见。

13. 原文地图

主题原书章原文位置
三步链与耳目手脚04 大模型的未解之谜text/06-ch04.txt:425(搜「信息—模型—行动」) · text/06-ch04.txt:429(搜「信息插件就像我的耳目」)
会看图04 大模型的未解之谜text/06-ch04.txt:319(搜「我现在会看图了」) · text/06-ch04.txt:328(搜「这张图讲的是一只猫」)
多模态这个词04 大模型的未解之谜text/06-ch04.txt:333(搜「多模态大模型的英文全称」)
看图只是第一步04 大模型的未解之谜text/06-ch04.txt:338(搜「看图只是第一步」)
视频不适合04 大模型的未解之谜text/06-ch04.txt:391(搜「不适合连续高维的视频信息」)
信息插件04 大模型的未解之谜text/06-ch04.txt:400(搜「左边这个信息插件库」)
行动插件与成都的例子04 大模型的未解之谜text/06-ch04.txt:413(搜「从北京去成都看大熊猫」) · text/06-ch04.txt:422(搜「代码解释器」)
拆解成子问题04 大模型的未解之谜text/06-ch04.txt:426(搜「将大问题拆解成子问题」)

Footnotes

  1. 出处:「04 大模型的未解之谜」第 425 段(text/06-ch04.txt:425,搜「信息—模型—行动」)与第 429 段(text/06-ch04.txt:429,搜「信息插件就像我的耳目」)。原文的完整三步是:先把大问题拆成子问题、通过信息插件从环境中获得信息;然后理解并表达信息、进行推理和行动规划;最后通过行动插件跟环境交互(text/06-ch04.txt:426,搜「将大问题拆解成子问题」)。 2

  2. 出处:「04 大模型的未解之谜」第 319 段(text/06-ch04.txt:319,搜「我现在会看图了」)。

  3. 出处:「04 大模型的未解之谜」第 321 段(text/06-ch04.txt:321,搜「新数据包括带字幕的图片」)。

  4. 出处:「04 大模型的未解之谜」第 328 段(text/06-ch04.txt:328,搜「这张图讲的是一只猫」)。

  5. 出处:「04 大模型的未解之谜」第 342 段(text/06-ch04.txt:342,搜「理想的多模态」)。名字与缩写见第 333 段(text/06-ch04.txt:333,搜「多模态大模型的英文全称」)。

  6. 出处:「04 大模型的未解之谜」第 338 段(text/06-ch04.txt:338,搜「看图只是第一步」)与第 387 段(text/06-ch04.txt:387,搜「图片我在学了」)。

  7. 出处:「04 大模型的未解之谜」第 371 段(text/06-ch04.txt:371,搜「多模态大模型还能做非文字的逻辑推理」)与第 374 段(text/06-ch04.txt:374,搜「瑞文」)。书里点了论文名《你需要的不仅仅是语言:跟语言模型对齐感知》。

  8. 出处:「04 大模型的未解之谜」第 382 段(text/06-ch04.txt:382,搜「理工科的卷子上经常会有图形和表格」)。

  9. 出处:「04 大模型的未解之谜」第 435 段(text/06-ch04.txt:435,搜「无图无真相」)。

  10. 出处:「04 大模型的未解之谜」第 390 段(text/06-ch04.txt:390,搜「处理离散文本效果很好」)与第 391 段(text/06-ch04.txt:391,搜「不适合连续高维的视频信息」)。

  11. 出处:「04 大模型的未解之谜」第 365 段(text/06-ch04.txt:365,搜「也会获得相应的环境反馈」)。

  12. 出处:「04 大模型的未解之谜」第 359 段(text/06-ch04.txt:359,搜「控制指令也算一种新的模态」)。

  13. 出处:「04 大模型的未解之谜」第 363 段(text/06-ch04.txt:363,搜「自己跟自己下棋的强化学习」)。

  14. 出处:「04 大模型的未解之谜」第 361 段(text/06-ch04.txt:361,搜「我们大模型要建立世界的模型」)。

  15. 出处:「04 大模型的未解之谜」第 438 段(text/06-ch04.txt:438,搜「这只是愿景」)。 2

  16. 出处:「04 大模型的未解之谜」第 400 段(text/06-ch04.txt:400,搜「左边这个信息插件库」)与第 405 段(text/06-ch04.txt:405,搜「业数据库里检索信息的插件」)。后一条在原文里被折行了,所以「企」字落在上一段。 2

  17. 出处:「04 大模型的未解之谜」第 413 段(text/06-ch04.txt:413,搜「从北京去成都看大熊猫」)。这一段一直讲到「让它们分头行动,直接把活儿全干完」(text/06-ch04.txt:419,搜「直接把活儿全干完」)。 2 3

  18. 出处:「04 大模型的未解之谜」第 422 段(text/06-ch04.txt:422,搜「代码解释器」)。