五厂面经真题集华为面经高频华为真题端侧推理端云协同速答 · 约 5 分钟更新 2026-09-29

端侧设备上部署大模型 Agent,有哪些关键挑战?

一句话结论

端侧部署大模型 Agent,主要要解决算力内存、功耗发热、响应延迟和能力降级问题,核心是做好手机与 IoT 场景下的端云路由。

先这样答

端侧部署大模型 Agent,关键挑战集中在算力与内存、功耗与发热、响应延迟和能力降级四个方面,核心设计是针对手机和 IoT 场景做好端云路由。

第一,端侧设备的算力和内存有限。可以使用 int4 量化,选择更小的基座模型,也可以做层裁剪。这样才能让模型适配设备资源。第二,持续推理会带来功耗和发热问题。系统需要安排好推理调度,也要处理设备降频后的运行状态。调度不能只看单次结果,还要考虑设备持续运行时的稳定性。

第三,用户会直接感知响应延迟。设计时要优先保证首 token 尽快返回,并让 KV 管理保持紧凑。第四,端侧模型的能力会出现降级。简单任务可以放在端侧处理,复杂任务再上传云端。端侧还具备隐私优势,因此不能只把所有任务都交给云端。手机和 IoT 场景的路由策略,决定了任务放在哪里执行,也是这类 Agent 的核心设计。

面试官会怎么追问

  • 「为什么端侧模型需要做 int4 量化、小基座和层裁剪?」 端侧设备的算力和内存有限,完整模型不一定能直接运行。int4 量化、小基座和层裁剪都在减少模型的资源需求。实际设计要在资源约束和模型能力之间做取舍。

  • 「端侧推理为什么既要关注功耗发热,也要关注首 token 延迟?」 功耗和发热会影响设备持续运行,设备还可能因为发热而降频。首 token 延迟则直接影响用户对响应速度的感受。推理调度需要同时处理这两个目标,并配合紧凑的 KV 管理。

  • 「什么情况下应该把任务从端侧路由到云端?」 简单任务可以由端侧直接处理,复杂任务再上传云端。路由策略要结合任务复杂度和端侧能力做判断。端侧有隐私优势,所以不能默认所有请求都上传云端。

回答的坑

  • 只讲量化和模型压缩,却不讲功耗、延迟、能力降级和端云路由,答案会停留在模型部署层面。

  • 把端侧能力不足直接等同于全部上云,忽略了端侧的隐私优势和简单任务的本地处理价值。

—— 本题完 ——