数据截至 (上游 commit 6a6b6383eb6a)
感知层:把网页变成 LLM 能读的东西
30 秒导读: LLM 看不懂原始 HTML(几万行、噪声满天),也不能直接"点第三个按钮"。 Skyvern 的感知层把整张网页压成两样东西喂给模型:一棵只留可交互元素、每个元素带唯一 ID 的精简 HTML 树,加上滚动分屏的截图。这个"唯一 ID"(
unique_id)是全书的锚点—— 后面决策层(ch02)让模型输出"点 ID=Abcd的元素",执行层 (ch03)再用这个 ID 反查真实 DOM 节点去点。没有这一层,整个 agent 是瞎的。
本章只讲"眼睛":网页 → LLM 可读数据。模型怎么用这些数据(ch02)、动作怎么落到真实元素(ch03) 不在这里。