手机端的自动操作 Agent(如 AutoGLM 这类)技术上难在哪?和网页 Agent 有什么区别?
先这样答
网页 Agent 有 DOM 可读:元素结构、可点击属性、文本内容都是结构化数据,理解难度低。手机 Agent 拿不到这些,App 界面渲染成位图,系统出于安全不给第三方完整的界面树,所以手机 Agent 的感知只能主要靠截屏加视觉理解,起点就比网页难一档。
具体难点有五个。界面异构:每个 App 的设计语言、控件风格、交互习惯都不同,跨 App 的长任务要在几十种界面风格间保持稳定的元素识别。权限和沙箱:Agent 能执行的操作受系统权限约束,模拟点击、模拟输入的通道在不同系统版本上行为不一,还有前台服务的生命周期限制。输入通道:没有键盘事件的完整控制权,复杂表单填写容易在输入法环节出错。性能:手机端算力有限,视觉模型要么放云端引入延迟,要么端侧小模型牺牲精度。隐私:屏幕上可能有聊天记录、支付信息,截屏数据上传云端处理必须脱敏,用户对「Agent 看我屏幕」的容忍度远低于网页场景。
工程上的主流架构是端云协同:端侧跑轻量模型做截屏感知和简单操作,云端大模型做任务规划和复杂推理,中间靠压缩的界面状态同步。操作执行走系统提供的无障碍服务接口,把「点哪个坐标、输入什么文本」翻译成系统级事件。
面试官会怎么追问
- 「无障碍服务的权限风险怎么控制?」 最小化原则:只申请模拟点击和读屏所需权限,敏感 App 加白名单排除,操作全程留审计日志,涉及支付的步骤强制用户二次确认。
- 「端云协同的状态怎么同步?」 端侧把截屏压缩成结构化的界面摘要(元素列表加坐标)上传,而不是传原图,带宽和隐私都可控。云端的规划指令下行为操作序列,端侧执行并回报结果。
- 「App 改版了怎么办?」 视觉方案对改版相对鲁棒,因为识别的是「这是一个按钮」而不是「这个按钮的 resource id」。但要维护主流 App 的界面变化监控,识别率骤降时告警并针对性补充训练数据。
回答的坑
- 拿网页 Agent 的 DOM 思路硬套手机。先讲清「没有 DOM」这个根本差异,后面的设计才立得住。
- 忽略隐私和权限,只谈模型能力。手机场景这两个是产品能不能上线的硬门槛。
同系列的题
—— 本题完 ——