跳到主要内容

一条可选路径:从零搭出一个 AI Agent 产品

这一页管什么: 如果要一路搭出我们自己的 AI Agent 产品,推荐按什么顺序走。

它不是课题的来源,也不是清单。 这个库开课题不设门:主人说想搞清楚什么就开一个, 跟这张表有没有关系都行(立意见 README.md)。这张表只干一件事——当主人想不好先做哪个时, 给一个默认顺序。产品是方向,不是门槛。

规矩

  • 先读透,再动手。一个课题的主线是:全库判定 → 相关源逐个摘录 → 汇总地图 → 写讲义 → 搭原型;
  • 一个课题 = 一个自包含的包(问题/摘录/地图/讲义/论文/书/决策/原型),编号就是课题号; 地图在摘录期会一版版长大,这是正常形态,不是没写完;
  • 原型只有一个,住在仓库根的 prototypes/agent-product/,每个课题往上加一层,不为每个课题另起新项目; 课题包里的 _prototype/ 只放本课题这一轮做了什么改动、跑出什么数(results/),共享的可运行原型不切碎;
  • 配方是产出:每个课题收尾写一张配方卡(最小实现 + 坑 + 什么时候该升级),攒起来就是我们自己的那本配方。

读什么、什么时候才去看代码

四类料各有各的活,不可互相替代:

回答什么在讲义里当什么
三个代码书架的 teardown别人的代码实际怎么写的事实、可抄的形状、各家的分歧点
书库这个概念标准怎么定义、为什么这么设计、前人踩过什么坑讲义的骨架与术语——书本来就是写给人读的教材
论文某个做法为什么成立、边界在哪原理支撑,按需取用
克隆源码teardown 说不清的细节只在结论要落成配方时才翻

书按「本」判定,按「章」读。 判为相关的书不是整本啃:先看它的章节表,只挑能改变本课题决定的那几章, 摘录里写清读了哪几章、跳过什么、为什么;引用锚到章(book=<书id> §章名)。

判定尺子(四类通用):这一篇/这一章能不能改变本课题的某个决定? 不能就是 laterunrelated

不做的事: 不按库名从 A 读到 Z、不靠标题和 essence 猜内容、不写没有出处的"业界普遍认为"。

一个内核,四圈外壳

一个 agent 产品的全部结构:中间是一个循环,外面四圈都是往这个循环上加东西。

你的代码
| 发出去 = 一段说明 + 到现在为止的全部历史 + 能用的工具清单
v
模型
| 它只会回两种话
+--> A. "我要调 X,参数是 Y"
| |
| v
| 你的代码真去执行 X,把结果追加进历史 --> 回最上面,再来一轮
|
+--> B. "我说完了" --> 收工

这张图就是 agent 的定义。 它和聊天机器人的差别只在 A 那条线上: 模型自己不执行任何东西,是你的代码去执行。四圈外壳分别管:喂它什么 / 它能做什么 / 人怎么看见与插手 / 怎么知道它好不好。

推荐顺序

第 1 站是内核,绕不开也不建议后放;其余按圈归类,顺序随便挑。编号只是排版序号。

属于哪一圈能力原型上能看见什么
1内核最小 agent 循环控制台丢一句话,它调工具 → 看结果 → 再决定,最后给结论
2喂它什么多轮与上下文它记得刚才说过什么;超长了会自己裁
3它能做什么工具层多个工具、参数校验、工具报错不炸掉循环
4人怎么看见最小可见回路浏览器里说一句话,答案一个字一个字冒出来
5人怎么看见事件流与可视化每一轮的思考、调用、结果在界面上实时滚
6人怎么看见中断、叫停与审批危险动作先问你;中途能喊停
7人怎么看见持久化与会话刷新不丢,能开多个会话来回切
8它能做什么接外部能力(MCP)挂一个 MCP server 就多一组工具,不改代码
9它能做什么沙箱与权限边界注入内容不能指挥它;危险动作跑在隔离环境里
10喂它什么记忆隔天回来还记得你的偏好
11怎么知道好不好评测与可观测改完能说清"变好了还是变坏了"
12怎么知道好不好上线与成本部署出去、算得清一次跑多少钱

多 agent 不在这条路径上——它是"循环里嵌循环",内核没稳之前谈它没有意义。

怎么读(这是"真读"的意思)

做法不做什么
课题组织阅读,不按库——同一个课题把各家的同一处摊平比不按库名从 A 读到 Z
一篇 teardown 从头读到尾,取出可锚的事实不靠 essence/标题猜内容
每条结论落成带 事实= 的锚不写"业界普遍认为"这种没出处的话
读过的篇目记进该级的阅读清单,标已读/未读不假装读完了

覆盖是分轮递增的:一个课题的第一轮判完全库、摘完当轮判为相关的源;原型跑起来发现新问题, 就开第二轮——只补增量(新判为相关的源、上游改过的篇目、新拆出的子课题),不重来。 账本里的判定可以中途改:发现某个源其实相关,改判定、补一篇摘录即可。

现在到哪了

研究台总览的课题表。