五厂面经真题集智谱面经高频高频考点GUI Agent移动端速答 · 约 6 分钟更新 2026-09-30

手机端的自动操作 Agent(如 AutoGLM 这类)技术上难在哪?和网页 Agent 有什么区别?

一句话结论

手机 Agent 难在跨 App 的界面异构、系统权限与沙箱限制、输入通道单一、隐私敏感度高;与网页 Agent 的核心区别是拿不到 DOM、操作通道受限、场景碎片化更严重。

手机端的自动操作 Agent(如 AutoGLM 这类)技术上难在哪?和网页 Agent 有什么区别?

先这样答

网页 Agent 有 DOM 可读:元素结构、可点击属性、文本内容都是结构化数据,理解难度低。手机 Agent 拿不到这些,App 界面渲染成位图,系统出于安全不给第三方完整的界面树,所以手机 Agent 的感知只能主要靠截屏加视觉理解,起点就比网页难一档。

具体难点有五个。界面异构:每个 App 的设计语言、控件风格、交互习惯都不同,跨 App 的长任务要在几十种界面风格间保持稳定的元素识别。权限和沙箱:Agent 能执行的操作受系统权限约束,模拟点击、模拟输入的通道在不同系统版本上行为不一,还有前台服务的生命周期限制。输入通道:没有键盘事件的完整控制权,复杂表单填写容易在输入法环节出错。性能:手机端算力有限,视觉模型要么放云端引入延迟,要么端侧小模型牺牲精度。隐私:屏幕上可能有聊天记录、支付信息,截屏数据上传云端处理必须脱敏,用户对「Agent 看我屏幕」的容忍度远低于网页场景。

工程上的主流架构是端云协同:端侧跑轻量模型做截屏感知和简单操作,云端大模型做任务规划和复杂推理,中间靠压缩的界面状态同步。操作执行走系统提供的无障碍服务接口,把「点哪个坐标、输入什么文本」翻译成系统级事件。

面试官会怎么追问

  • 「无障碍服务的权限风险怎么控制?」 最小化原则:只申请模拟点击和读屏所需权限,敏感 App 加白名单排除,操作全程留审计日志,涉及支付的步骤强制用户二次确认。
  • 「端云协同的状态怎么同步?」 端侧把截屏压缩成结构化的界面摘要(元素列表加坐标)上传,而不是传原图,带宽和隐私都可控。云端的规划指令下行为操作序列,端侧执行并回报结果。
  • 「App 改版了怎么办?」 视觉方案对改版相对鲁棒,因为识别的是「这是一个按钮」而不是「这个按钮的 resource id」。但要维护主流 App 的界面变化监控,识别率骤降时告警并针对性补充训练数据。

回答的坑

  • 拿网页 Agent 的 DOM 思路硬套手机。先讲清「没有 DOM」这个根本差异,后面的设计才立得住。
  • 忽略隐私和权限,只谈模型能力。手机场景这两个是产品能不能上线的硬门槛。
—— 本题完 ——