你在这里。看看这个问题与其他知识怎样相连。
选择节点前往页面 · 展开后可留在地图中阅读
一个问题
按钮背后,agent 能看见什么?
视觉控件可以对应有名字的结构、状态和动作,而不只是一片像素。
设想一个以卡片显示的任务。人从标题和状态理解它;agent 可以通过对应地址和支持的操作处理它,不必先从截图推测系统已经知道的事实。
其他系统也能通过 DOM、无障碍树和 API 提供结构。AFS-UI 关注的是:这些结构怎样与应用的其他部分一起,进入同一套资源和操作模型。
这里的对应是语义上的对应,不要求每个阴影或装饰像素都有单独路径。布局、图表与外观仍然需要视觉检查。
教学模型 · 示例路径、本地状态
动手理解
改变任务状态,再切换它的呈现方式。观察对象的地址是否改变。
人看到的界面
准备演讲
进行中
Agent 可寻址的结构 · 示例工作空间
- /work/tasks/keynote/title
- 准备演讲
- /work/tasks/keynote/status
in-progress
同一个对象,不同的表示。
这个模型解释语义上的对应关系,不是当前浏览器 AFS 会话的实时检查器。
检查一下理解
给每个阴影像素一条路径,会帮助 agent 操作任务吗?
通常不会。先明确对象、有意义的状态以及允许的动作。
沿着学习路径继续
- 从两面理解一个界面第 2 / 5 步