跳到主要内容

把模型包成按次收费的服务

这一章讲三件事: 怎么衡量一个模型的好坏; 公开出来的那一类是怎么做出来的;以及企业该选哪一条路。

它在全书链条里的位置: 第 16 章讲完了底下两层。 这一章讲第三层。 第 18 章讲最上面那一层,以及贯穿全部四层的那条钱线。

1. 这一层在卖什么

这一节先说清楚这一层的位置,它容易被跳过。

书里的定位很直接:这一层是大模型产业的核心。 我们使用的应用必须通过这一层的模型提供的能力, 来实现对话、写作、分析、写代码等各种用户级功能1

这一层在书里和业内都有一个正式名字,叫模型即服务,缩写 MaaS—— 就是「把一台练好的机器当水电一样,按用量卖给别人」1这个缩写你在任何一份云厂商的产品页上都会撞见。

它对外卖的是一组可以按次调用的能力,书里列了五样: 模型推理、微调训练、强化学习训练、插件库、私域模型托管2

「按次调用」具体是怎么调的? 你的程序按对方规定的格式把请求发过去, 对方按规定的格式把结果发回来;中文里管这个约好的收发口子叫接口, 英文缩写就是你到处能看到的那三个字母:API——书里用的全称是「应用程序编程接口」2你只要去读任何一家的开发文档,第一页就会撞见它。

关键在于:这一层不生产模型本身,也不生产算力。 它做的是把模型包起来,变成一件别人可以按次买的东西。

2. 六把尺子,而且它们互相打架

这一节讲怎么衡量一个模型,书里列了六条3:

尺子量的是什么
生成文本的质量是否流畅、连贯、与输入强相关、符合预期,是否存在偏见或错误信息
没学过也能干的能力在没有接受特定任务训练的情况下处理相关问题的能力
生成样本的多样性同样的输入,能不能给出多种合理的回应
对烂输入的容错能不能处理拼写错误、句子写得不通,面对恶意输入时能否保持稳定
计算资源需求训练和使用时要多少卡、多少内存;需求越小,越有可能大规模铺开
可解释性和可审计性有助于理解它的工作原理,以及怎么改进它以减少偏见和错误

这六把尺子互相打架,而书里自己给了例子: 新一代在生成质量、任务表现、没学过也能干这三项上优于上一代, 然而它可能也需要更多的计算资源,导致部署和使用时的成本增加4

这就是这一层全部的商业张力:更好的东西更贵,而更贵的东西未必卖得动。 (这条张力在第 18 章会变成一条可以画出来的横线。)

3. 公开出来的那一类:两个特色

这一节讲开源那一边,它是这一章故事的主角。

书里说,一家公司在 2023 年 2 月放出了一个大模型,这个模型叫 LLaMA; 它主打两个特色5:

  • 开放:可以在非商业许可下提供给政府、开发社区和学术界的研究人员, 让更多机构和个人能参与研究和探索,实现大模型的民主化;
  • 性价比:可以在大数据集的基础上缩小模型规模, 找到模型性能和推理部署成本的最佳平衡

具体的数:它基于 1 万亿到 1.4 万亿 token 的数据集, 训练出 4 种规模大小的模型(70 亿、130 亿、330 亿和 650 亿参数)6—— 作为对比,书里在同一句里点了另一个数:GPT-3 的 1750 亿。 也就是说,最小的那个是它的二十五分之一。

那 1 万亿到 1.4 万亿又是多少? 拿第 02 章那个数比: GPT-3 读的是 5000 亿左右——这一次读的量是上一代的两到三倍,而个头只有它的四十分之一。 「参数少一大截、字读得更多」正是这个模型能便宜的全部原因。

它用的数据全部来自公共领域,书里列了七类: 网页爬取数据集、另一个公共网页数据集、代码托管平台上的程序代码 (为保证合规,只使用了三种特定许可下的代码库)、 百科、图书、论文库、一个高质量问答网站7

开放这件事的产业后果,书里记录得很具体: 在它发布的一个多月内,就涌现了许多扩展版本8

书里给这件事起了个名字,而这个名字来自画画那一侧,值得记住。

2022 年 8 月,一家公司把一个出图模型公开放了出来——这个模型叫 Stable Diffusion; 你可以把它下载到自己的电脑上跑,也可以改脚本、包装自己的界面并且商用, 只要守住许可证条款9

在那之前,同类里最出名的两个(DALL·E 2 和 Midjourney)都是闭着的; 放出来之后,它的影响力一下子超过了那两个, 社区里冒出一大堆基于它的新模型、新应用9

所以书里管这种时刻叫「Stable Diffusion 时刻」:某个领域里出现了一个高质量的开放模型, 引爆社区、把全世界的研究者和开发者拉进来,激发出一大批创新。 书里的判断是:2023 年 2 月这一次,意味着写字这一侧也到了这个时刻9

4. 主走查:7 万条对话 + 8 张卡跑一天

这是本章的主走查,四步,每一步都有可核的数。

书里挑的例子是几所大学的联合团队做的扩展版,它的名字叫 Vicuna10:

第几步干什么具体的数
1 拿底座用上一节那个模型的 130 亿参数版本作为底子这一步不花钱,从社区下载(见第 16 章第 9 节)
2 拿数据从一个浏览器插件的公开页面获得 7 万个用户对话数据,当作带答案的样本7 万条11
3 微调用那批数据做监督微调;在「一来一回好几轮」和「一次说很长」这两件事上做了改进8 张 A100 显卡,跑了一天12
4 评测造 8 大类共 80 个问题,拿它和另外四个模型比让当时最强的那个(GPT-4)当裁判,给五个模型的输出打分13

为什么这条走查值得逐步看? 因为它把「做一个像样的模型」的门槛拆开摆在了台面上:

这一步花了多少对比第 16 章那笔账
预训练0(用别人的)13.5 万卡时、1000 张卡跑 5 天半、卡钱约 1 亿元14
微调8 张卡 × 1 天差着几个数量级

结果呢? 书里给的评价是:它完胜两个开源前辈(LLaMA 和 Alpaca), 略优于另一家大公司的产品(谷歌的 Bard),相比当时那个最流行的免费版本 (ChatGPT 用的 GPT-3.5)略有不足15

这就是这一层最重要的一条产业事实: 预训练的钱花过一次之后,后面的人可以用极小的代价站上去。 书里把好处列得很清楚:可以充分利用大厂在预训练阶段的巨大投入, 不需要自己建巨大的集群,不需要庞杂的数据收集和清洗, 也规避了预训练阶段调优的复杂工作16

5. 用模型给模型打分:方便,但要人复核

这一节单独拎出走查的第 4 步,因为它今天已经成了通行做法。

书里的做法是:把问答文本输入给一个更强的模型,请它评估五个模型的输出质量, 评判维度包括回答的有用性、相关性、准确性和细节程度13

书里还照抄了那段给裁判的提示语,其中两句很值得学17:

  • 「首先,请输出一行仅包含两个值的文本,分别表示助手 1 和助手 2 的得分」—— 先出分,再说理由,免得它先编一段理由再凑一个分。
  • 「请提供对您评价的全面解释,避免任何潜在偏见, 并确保回答呈现的顺序不会影响您的判断」—— 它承认了一件事:顺序会影响判断。

书里对这个做法的判断很平衡:利用水平高一级的模型给其他模型做评价, 是一种简便高效的方法;但团队成员对评价结果做了人肉审核, 以确保评价的合理性和有效性18

这一节和第 05 章第 7 节要连起来看: 那一节讲的是「怎么量它编了多少」,这一节讲的是「怎么量它答得好不好」。 两件事都在往「让机器当裁判」的方向走,而两件事都还需要人复核。

6. 企业选底座:三条岔路

这一节给出这一章最实用的一张岔路图,它出自书里那场对话。

先立一个词:跟开源相对的那一类,源码和那一堆数都不公开、你只能按次买它的服务, 这种叫闭源。

书里那位创业者角色的顺序很清楚:如果是做应用、做垂直市场业务的, 并且明确自己的应用需求,那大多数企业首先不是去看开源模型, 而是先看商业化的闭源模型能不能用—— 因为这样做快速、轻松,只要费用算得过来就好19

那什么时候才走另外两条路? 书里列了四种诉求20:

诉求原话
数据安全「我的数据放你那,不安全」
定制「我要定制某个功能,你没有」
成本「我要用的量很大,你的成本不划算」
差异化「我就要在模型预训练这层做出应用的差异化竞争力,我不能跟竞争对手用同一个大模型底座」

三条岔路是这样分的:

① 先看闭源的能不能用 ────── 能用就用。快、轻松,只算费用
│ 不行

② 拿开源的来私有化 + 微调 + 强化学习训练
│ ← 这条路额外的算力成本比较低,大多数企业都承受得起,
│ 这也是开源模型最常见的用法[^20]
│ 还不行(必须改预训练那一层)

③ 重做预训练 ── 先看这个开源项目开放到什么程度(代码?数据?参数?),
再准备大算力 ── 第 16 章那笔账躲不开[^21]

书里给第 ③ 条路留了一个产业机会,值得记: 预训练是阶段性集中使用算力,如果不同企业错开训练排期, 一个企业的闲时完全可以给另一个企业用——通过资源复用降成本, 也能缓解供应链紧张21

7. 这一层到底卖哪几样

这一节把这一层的商品清单列全,它比你想的多。

卖什么干什么用关键细节
模型推理最基础的能力,属于服务必选项开发者把用户的提示语发过去,拿回答案;成本和时延取决于模型规模、硬件环境、输入输出的大小22
二次微调把通用模型调成适应特定领域的三种场景:领域特定任务、定制化应用、数据敏感任务;书里提醒:微调后在特定任务上表现提高,但在其他任务上可能略有下降23
二次强化学习同上,换一种训法
私域模型托管把私有模型部署到企业专有空间给非常看重数据敏感性、模型可控性的客户24
模型裁剪把模型压小、变轻,把不重要的连接剪掉可能导致部分场景表现变差,但能明显降低推理成本25
插件库补足两个缺陷:只能从训练数据学、无法实时更新知识;只能回答、不能执行操作分三类:数据获取型、操作执行型、内容审核型(对输入和输出各审一道)26

注意最后一行那个「内容审核型」——它就是第 01 章第 6 节那两道筛子的产品形态。

这一层怎么收钱? 书里列了三种27: 按使用量付费(按输入和回答的 token 数计费,或按训练量计费)、 项目定制服务费、以及自己也做应用,在应用层赚钱

8. 三年后:这一层前面多了一个网关,而且价格降了

这一节是书外补充,标明来源。

书里这一章讲的是「一家模型提供商怎么把自己卖出去」。 而今天的现实是:很多企业不直接连任何一家,中间还隔着一层。

补充(不在书里,依据我们的前沿书架):今天普遍的做法是在应用和模型之间 再加一层网关——对上暴露一套统一的调用形状,对下把请求翻译成各家自己的格式, 再把各家的返回翻译回来。 依据: shelf=ai-frontier-reference/litellm#index.md §1 这是什么 · §2.4 规模感 @3f15dc32871c8026295e0fdbac4be7710263861c 事实=这类网关对上只露出一套统一的调用形状、对下适配上百家供应商; 克隆目录里按供应商分的适配子目录有 137 个。

这一层为什么会长出来? 因为它顺手解决了第 6 节那四种诉求里的两种 (定制和成本),还多解决了一个书里没提的问题:谁能调、能调多少、花了多少。 同一份拆解把网关的六道工序写成了一条链。 依据: shelf=ai-frontier-reference/litellm#06-proxy-gateway.md §6.2 一次请求穿过网关的六道工序 @3f15dc32871c8026295e0fdbac4be7710263861c 事实=网关在库之上加一层服务,做「虚拟 key → 认出是谁 → 限流和查预算 → 分发 → 事后把账记进库」; 它要解决的是库解决不了的三件事:请求是谁发的、他还能发几个、这次花了多少钱。

价格呢?

判断(我们的,不是书里的):同等能力的调用价格,三年里降了一个数量级以上; 一次能塞进去的内容长度,也长了一个数量级以上。 我们不给精确倍数,因为各家计价口径不同、模型档位不同, 任何一个精确倍数都会在几个月内失效。 如果错,会错在: 如果你比较的是「最强档对最强档」而不是「同等能力对同等能力」, 那么降幅会小得多——最强档的价格一直没怎么降,降的是「达到当年最强水平所需的价格」。

这个判断会直接改变第 18 章那条横线的位置,那一章第 3 节会接上。

9. 作者的判断与证据

说法性质
六把尺子作者归纳的评价框架,没有对应的测评数据
开源那个模型的两个特色与数据构成论文事实,书里点了论文名
「Stable Diffusion 时刻」这个说法书里角色的类比,不是行业公认的术语;它描述的那段出图模型的历史是事实
7 万条对话 + 8 张卡一天项目公开数据
让更强的模型当裁判实践事实,而且书里照抄了提示语
「完胜两个前辈,略优于某家产品,略逊于某个免费版本」该团队自己的评测结论——注意裁判是被测者之一的同门
三条岔路书里对话中的经验判断
「闲时资源复用」一种设想,不是已有做法

必须点破的一处:第 4 节那个评测有一个明显的方法问题,而书里没有提。 当裁判的模型和被测的模型之一来自同一家, 而这个团队本身是被测方——「让最强的那个当裁判」在这里既是方法,也是利益关系。 书里只写了「团队做了人肉审核」,没有讨论这层关系。

10. 边界与局限

  • 书里没有讲这一层的毛利。 卖推理到底赚不赚钱?书里在第 18 章给了应用侧的账, 但这一层自己的账一个数都没有。
  • 书里没有讲版本更迭。 你今天基于某个版本做的微调,人家升级之后还能用吗? 这是这一层最现实的风险,书里没提。
  • 六把尺子里没有一把量「安全」。 而这恰恰是第 20 章那笔账的另一半。
  • 书里对国内几家的模型服务只有点名。 文心、通义各出现了一次,没有拆解。

11. 可带走的

  1. 这一层不生产模型,也不生产算力,它把模型包成按次收费的服务。
  2. 六把尺子互相打架:更好的通常更贵,更贵的未必卖得动。
  3. 开源那一边靠两个特色活着:开放,和「缩小规模换性价比」。 书里管这种「高质量开放模型引爆社区」的时刻叫「Stable Diffusion 时刻」。
  4. 预训练的钱花过一次之后,后面的人可以用极小的代价站上去—— 7 万条对话 + 8 张卡跑一天,对上 1000 张卡跑五天半。
  5. 让更强的模型当裁判是通行做法,但要人复核,而且要看裁判和被测的关系。
  6. 企业选底座三条岔路:先试闭源 → 拿开源微调 → 万不得已才重做预训练。
  7. 今天这一层前面还多了一个网关,它解决的是「谁能调、能调多少、花了多少」。

12. 原文地图

主题原书章原文位置
这一层是核心14 大模型产业拆解text/16-ch14.txt:381(搜「模型即服务(MaaS)层是大模型产业的核心」)
六把尺子14 大模型产业拆解text/16-ch14.txt:405(搜「生成文本的质量」) · text/16-ch14.txt:422(搜「可解释性和可审计性」)
开源那个模型的两个特色14 大模型产业拆解text/16-ch14.txt:449(搜「LLaMA主打两个特色」) · text/16-ch14.txt:454(搜「4种规模大小」)
「Stable Diffusion 时刻」15 关于大模型产业的对话:第1集text/17-ch15-15-1.txt:224(搜「文本类的大语言模型正处于Stable Diffusion时刻」) · text/17-ch15-15-1.txt:237(搜「Stable Diffusion时刻就是指在某个人工智能领域出现了高质」)
那个扩展版叫什么14 大模型产业拆解text/16-ch14.txt:499(搜「以及来自加州大学伯」) · text/16-ch14.txt:539(搜「略优于谷歌的Bard」)
7 万条对话14 大模型产业拆解text/16-ch14.txt:508(搜「从ShareGPT」) · text/16-ch14.txt:509(搜「获得了7万个ChatGPT用户对话数据」)
8 张卡跑一天14 大模型产业拆解text/16-ch14.txt:515(搜「微调训练使用了8个A100 GPU」)
80 题与裁判14 大模型产业拆解text/16-ch14.txt:521(搜「共计80个问题」) · text/16-ch14.txt:522(搜「让GPT-4作为裁判」)
人肉审核14 大模型产业拆解text/16-ch14.txt:547(搜「human in the loop」)
服务清单14 大模型产业拆解text/16-ch14.txt:588(搜「模型推理是通过最终用户」) · text/16-ch14.txt:634(搜「模型裁剪」)
三条岔路15 关于大模型产业的对话:第1集text/17-ch15-15-1.txt:67(搜「先看商业化的闭源模型能不能用」) · text/17-ch15-15-1.txt:81(搜「这些情况下,都可以来试试开源模型」)
四种诉求15 关于大模型产业的对话:第1集text/17-ch15-15-1.txt:77(搜「我的数据放你那,不安全」)

Footnotes

  1. 出处:「14 大模型产业拆解」第 381 段(text/16-ch14.txt:381,搜「模型即服务(MaaS)层是大模型产业的核心」)。「模型即服务(MaaS)」这个名字就在这一句的开头;那句「按用量卖」的大白话解释是我们补的。 2

  2. 出处:「14 大模型产业拆解」第 384 段(text/16-ch14.txt:384,搜「向企业客户或应用开发者提供多种能」)。同一段里原文写的是「通过企业服务模块的应用程序编程接口(API)形式」——这是全书正文里唯一一次把 API 的中文全称写出来。 2

  3. 出处:「14 大模型产业拆解」第 405 段(text/16-ch14.txt:405,搜「生成文本的质量」)到第 422 段(text/16-ch14.txt:422,搜「可解释性和可审计性」)。

  4. 出处:「14 大模型产业拆解」第 425 段(text/16-ch14.txt:425,搜「在生成文本质量」)。

  5. 出处:「14 大模型产业拆解」第 449 段(text/16-ch14.txt:449,搜「LLaMA主打两个特色」)。模型名 LLaMA 就在这一句的开头,由 Meta 在 2023 年 2 月放出。

  6. 出处:「14 大模型产业拆解」第 454 段(text/16-ch14.txt:454,搜「4种规模大小」)。原文在同一句里给出了对照:GPT-3 是 1750 亿参数(text/16-ch14.txt:455,搜「而GPT-3是1750亿参数」)。拿来跟 5000 亿比的那个数出自第 02 章第 4 节,是我们做的对照,不在这一句里。

  7. 出处:「14 大模型产业拆解」第 465 段(text/16-ch14.txt:465,搜「互联网网页爬取数据集」)到第 481 段。合规那一条在第 470 段(text/16-ch14.txt:470,搜「为保证数据合规性」)。

  8. 出处:「14 大模型产业拆解」第 498 段(text/16-ch14.txt:498,搜「在LLaMA发布的一个多月内」)。

  9. 出处:「15 关于大模型产业的对话:第1集」第 224 段(text/17-ch15-15-1.txt:224,搜「文本类的大语言模型正处于Stable Diffusion时刻」)、第 231 段(text/17-ch15-15-1.txt:231,搜「总部位于美国硅谷的人工智能公司Stability.ai」)与第 237 段(text/17-ch15-15-1.txt:237,搜「Stable Diffusion时刻就是指在某个人工智能领域出现了高质」)。两个闭源出图模型的名字在第 230 段(text/17-ch15-15-1.txt:230,搜「Midjourney闭源」)——其中一个正是第 14 章第 5 节那家电商用来出图的工具。 「2023 年 2 月这一次」指的是本节那个开放模型的发布(text/17-ch15-15-1.txt:239,搜「意味着文本类的大语」)。 2 3

  10. 出处:「14 大模型产业拆解」第 503 段(text/16-ch14.txt:503,搜「以LLaMA 130亿参数的预训练模型」)。这个扩展版的名字叫 Vicuna,团队来自加州大学伯克利分校、卡内基梅隆大学、斯坦福大学和加州大学圣地亚哥分校(text/16-ch14.txt:499,搜「以及来自加州大学伯」);同一段还点了另一个扩展版 Alpaca。

  11. 出处:「14 大模型产业拆解」第 508 段(text/16-ch14.txt:508,搜「从ShareGPT」)与第 509 段(text/16-ch14.txt:509,搜「获得了7万个ChatGPT用户对话数据」)。这批数据的来源正是第 16 章第 8 节说的第三类:公域或三方数据。

  12. 出处:「14 大模型产业拆解」第 515 段(text/16-ch14.txt:515,搜「微调训练使用了8个A100 GPU」)。

  13. 出处:「14 大模型产业拆解」第 521 段(text/16-ch14.txt:521,搜「共计80个问题」)与第 522 段(text/16-ch14.txt:522,搜「让GPT-4作为裁判」)。**当裁判的那个模型原文点了名:GPT-4。**八大类是复杂写作、角色场景处理、常识解释、数量级估计、反事实假设、代码和数学、领域知识、一般性问题。 2

  14. 出处:「14 大模型产业拆解」第 488 段(text/16-ch14.txt:488,搜「花了13.5万GPU」)。1000 张卡那笔换算见「15 关于大模型产业的对话:第1集」第 51 段(text/17-ch15-15-1.txt:51,搜「相当于5天半左右」)。

  15. 出处:「14 大模型产业拆解」第 538 段(text/16-ch14.txt:538,搜「Vicuna完胜两个开源前辈」)。原文点名的四个被比对象是 LLaMA、Alpaca、谷歌的 Bard 和 ChatGPT-3.5(text/16-ch14.txt:539,搜「略优于谷歌的Bard」)。

  16. 出处:「14 大模型产业拆解」第 562 段(text/16-ch14.txt:562,搜「可以充分利用AI大厂在」)。

  17. 出处:「14 大模型产业拆解」第 533 段(text/16-ch14.txt:533,搜「请输出一行仅包含两个值的文本」)与第 535 段(text/16-ch14.txt:535,搜「避免任何潜在偏」)。

  18. 出处:「14 大模型产业拆解」第 545 段(text/16-ch14.txt:545,搜「是一种简」)与第 547 段(text/16-ch14.txt:547,搜「human in the loop」)。

  19. 出处:「15 关于大模型产业的对话:第1集」第 67 段(text/17-ch15-15-1.txt:67,搜「先看商业化的闭源模型能不能用」)。

  20. 出处:「15 关于大模型产业的对话:第1集」第 77 段(text/17-ch15-15-1.txt:77,搜「我的数据放你那,不安全」)。

  21. 出处:「15 关于大模型产业的对话:第1集」第 93 段(text/17-ch15-15-1.txt:93,搜「预训练是阶段性集中使用算力」)。

  22. 出处:「14 大模型产业拆解」第 588 段(text/16-ch14.txt:588,搜「模型推理是通过最终用户」)与第 592 段(text/16-ch14.txt:592,搜「大模型推理的成本和时延的影响因素」)。

  23. 出处:「14 大模型产业拆解」第 595 段(text/16-ch14.txt:595,搜「二次微调」)与第 621 段(text/16-ch14.txt:621,搜「在其他任务上」)。

  24. 出处:「14 大模型产业拆解」第 629 段(text/16-ch14.txt:629,搜「私域模型托管」)。

  25. 出处:「14 大模型产业拆解」第 634 段(text/16-ch14.txt:634,搜「模型裁剪」)。

  26. 出处:「14 大模型产业拆解」第 642 段(text/16-ch14.txt:642,搜「大模型只能从训练数」)与第 673 段(text/16-ch14.txt:673,搜「内容审核型插件」)。

  27. 出处:「14 大模型产业拆解」第 689 段(text/16-ch14.txt:689,搜「按模型使用付费」)。