先这样答
端侧部署大模型 Agent,关键挑战集中在算力与内存、功耗与发热、响应延迟和能力降级四个方面,核心设计是针对手机和 IoT 场景做好端云路由。
第一,端侧设备的算力和内存有限。可以使用 int4 量化,选择更小的基座模型,也可以做层裁剪。这样才能让模型适配设备资源。第二,持续推理会带来功耗和发热问题。系统需要安排好推理调度,也要处理设备降频后的运行状态。调度不能只看单次结果,还要考虑设备持续运行时的稳定性。
第三,用户会直接感知响应延迟。设计时要优先保证首 token 尽快返回,并让 KV 管理保持紧凑。第四,端侧模型的能力会出现降级。简单任务可以放在端侧处理,复杂任务再上传云端。端侧还具备隐私优势,因此不能只把所有任务都交给云端。手机和 IoT 场景的路由策略,决定了任务放在哪里执行,也是这类 Agent 的核心设计。
面试官会怎么追问
-
「为什么端侧模型需要做 int4 量化、小基座和层裁剪?」 端侧设备的算力和内存有限,完整模型不一定能直接运行。int4 量化、小基座和层裁剪都在减少模型的资源需求。实际设计要在资源约束和模型能力之间做取舍。
-
「端侧推理为什么既要关注功耗发热,也要关注首 token 延迟?」 功耗和发热会影响设备持续运行,设备还可能因为发热而降频。首 token 延迟则直接影响用户对响应速度的感受。推理调度需要同时处理这两个目标,并配合紧凑的 KV 管理。
-
「什么情况下应该把任务从端侧路由到云端?」 简单任务可以由端侧直接处理,复杂任务再上传云端。路由策略要结合任务复杂度和端侧能力做判断。端侧有隐私优势,所以不能默认所有请求都上传云端。
回答的坑
-
只讲量化和模型压缩,却不讲功耗、延迟、能力降级和端云路由,答案会停留在模型部署层面。
-
把端侧能力不足直接等同于全部上云,忽略了端侧的隐私优势和简单任务的本地处理价值。
同系列的题