数据截至 (上游 commit 11cea575561f)
GUI-Owl 与 v3/v3.5:把感知·定位·规划·反思内化进原生基座模型
30 秒导读: 前三章(v1/v2/E)都是「通用大模型 + 一堆外挂工具」——OCR 认字、DINO 找图标、 CLIP 配图。这一章讲家族的范式转折:训练一个原生跨平台 GUI 基座模型 GUI-Owl,让它自己看截图、 自己吐出「点这个坐标」。v3 在这个基座外面套一层多智能体(规划/反思/记忆);v3.5 更进一步, 让手机、网页、PC 共用同一个基座,只换一份工具描述。
本章属于 Mobile-Agent 家族系列。建议先读 家族总览 建立坐标系;本章多次和 v1 单智能体、v2 多智能体、 E 与 PC-Agent 对照;基座模型怎么训出来的在 训练与批判器。
1. 这是什么(零基础也能懂)
一句话定义: GUI-Owl 是一个原生的图形界面基座模型——你给它一张手机/电脑截图和一句任务, 它直接回你「下一步做什么、点屏幕哪个坐标」,不需要任何外部的文字识别或图标检测工具帮忙。
它要取代的旧做法。 回想 v1 的流水线(01 章):一张截图进来,先过 OCR 读出所有文字框、再过图标检测模型(DINO)框出所有图标、必要时还要 CLIP 判断「哪个图标最像用户说的那个」, 把这些结果拼成一段文字喂给一个通用 VLM(如 GPT-4V),让它在文字描述里选一个框。感知和决策是两拨模型、 两个阶段。
GUI-Owl 的新做法。 把这一切压进一个模型的一次前向:
v1 旧路子(多模型、多阶段):
截图 ──OCR──▶ 文字框
──DINO─▶ 图标框 ┐
──CLIP─▶ 相似度 ├─ ─拼成文本──▶ 通用VLM ──▶ "点第 3 个框"
┘
GUI-Owl 新路子(一个基座、一次前向):
截图 + 任务 ──▶ GUI-Owl ──▶ {"action":"click","coordinate":[480,633]}
(看图 + 定位 + 决策 全在模型内部)
给谁用、解决什么。 给做手机/电脑自动化的人。旧路子的痛点是:外挂工具是误差源——OCR 认错字、 DINO 漏检图标,后面的决策再聪明也白搭;而且每加一个平台(从手机到 PC)就要重配一套感知工具。GUI-Owl 把「看懂界面」这件事变成模型的内生能力,于是定位更准、也天然跨平台。
用起来什么样。 v3.5 的手机版启动就是一行命令(源码 Mobile-Agent-v3.5/mobile_use/run_gui_owl_1_5_for_mobile.py:1-11 的 docstring):
python run_gui_owl_1_5_for_mobile.py \
--adb_path "你的 adb 路径" \
--base_url "GUI-Owl 的 vllm 服务地址" \
--model "模型名" \
--instruction "帮我在设置里打开飞行模式"
一句话直觉/类比。 旧做法像「让一个盲人破案,先请三个助手(读字的、认脸的、比对的)口述现场, 他再推理」;GUI-Owl 是「让侦探自己长了眼睛」——看和想不再分家。