AI Agents in Action — 本课题摘录
读了哪几章: 第 1 章(agent 与它的世界)、第 5 章(给 agent 加动作)、第 11 章(规划与反馈)。 全书十一章,其余本轮没读。
这本书对本课题的贡献集中在两处:一个分档表,和一个可复现的对照实验。
它对本课题回答了什么
按"谁在决定"分成四档 —— 这张表值得进讲义
| 档 | 谁在决定 | 例子 |
|---|---|---|
| 直接对话 | 全是人 | 你直接跟模型说话,中间没有任何东西 |
| 代理改写 | 模型替你改写请求 | 你说"画一张图",模型把它改写成更适合下游的说法 |
| 有审批的助手 | 模型准备好调用,但要人点头 | 调用前需要用户批准,批准后执行、结果回给模型、模型再用自然语言包一层还给用户 |
| 自治 agent | 模型自己定计划、自己做决定 | 只在里程碑处可能问一句,其余时候自己跑 |
(依据:书 · AI Agents in Action §1 —— 按交互形态分四档——直接与 LLM 对话、代理 agent(替你把请求改写成更适合任务的形式)、有审批的 agent/助手(LLM 准备好调用但需用户批准,执行后结果返回 LLM 再包成自然语言)、自治 agent(自己解释请求、构造计划、识别决策点并独立执行,可能在里程碑处请求反馈))
本课题第三圈("人怎么看见与插手")一直被当成一个开关:要不要审批。 这张表说它是一条谱系,而且四档之间的差别不是"批不批",是"谁在做决定"。
对我们的最小原型有一个直接推论:先做第三档(有审批),不要一上来做第四档。 第三档的循环结构和第四档完全一样,只是多一个暂停点——而那个暂停点让你能看清它每一步在干什么。
它还提到:某些厂商刻意避免用"agent"这个词,因为在机器学习的历史里 agent 指的是自主决策的那一类。