推理与部署推理优化端侧速答 · 约 4 分钟更新 2026-09-19

手机和边缘设备能跑大模型吗?瓶颈在哪

一句话结论

能跑,但要换预期:现实目标是几 B 到十几 B 参数的量化模型,瓶颈不在算力而在内存容量与带宽,外加功耗散热,能力上和云端大模型仍有可感知的差距。

先这样答

能跑,先把规模定准。现在手机内存普遍 8 到 16 GB,还要留给系统和应用,INT4 量化后的 7B 模型权重约三个多 GB,十几 B 的模型就顶到内存上限。所以端侧现实的目标是几 B 到十几 B 参数的量化模型,跑不了云端那种几百 B 参数的模型,产品预期要按这个规模定。

瓶颈按顺序排。第一是内存容量:模型权重必须整个装进内存,装不下就跑不了,这决定了端侧模型的上限。第二是内存带宽:解码阶段每出一个 token 都要把全部权重读一遍,手机内存带宽远低于独立显卡,吐字速度被它直接限住。第三是功耗和散热:持续推理就是持续高负载,芯片一降频速度就掉。算力反而排不上第一,NPU 的算力应付量化后的小模型大体够用。

明知小还要上端侧,图的是四件事:数据不出设备、断网可用、没有网络往返所以延迟低、不按 token 付费。所以现实的产品形态是分工:端侧小模型处理敏感、即时、高频的轻任务,复杂问题再交给云端。总结一句:端侧跑大模型受内存、带宽、功耗三个约束,模型选型和量化方案都要围着它们做。

面试官会怎么追问

  • 「为什么端侧吐字速度特别难提?」 解码卡在带宽,每步都要完整读一遍权重,这个搬运量由模型大小和内存带宽决定,而端侧带宽提升慢。批处理也帮不上忙,端侧通常就是单用户,没有别的请求来分摊。
  • 「量化在端侧为什么是必选项?」 内存放不下是硬约束:FP16 的 7B 模型光权重就 14 GB,超出大多数手机的可用内存,INT4 压到三个多 GB 才装得下。端侧方案都从低比特量化起步,然后才谈效果优化。
  • 「什么任务适合放端侧?」 高频、轻量、对隐私敏感的:输入纠错、短文本摘要、通知归类、语音转写后的本地处理。需要长上下文、强知识、多步推理的,仍然交给云端,两边是分工不是替代。

回答的坑

  • 把「手机能跑」等同于「体验接近云端」。参数量差一个量级以上,长上下文和复杂推理的差距用户能感知,预期要按端侧模型的真实能力定。
  • 只看算力参数评估芯片。解码卡在内存带宽和散热,算力再强吐字也快不起来,评估端侧方案先看内存带宽和持续散热能力。
—— 本题完 ——