推理与部署投机解码推理更新 2026-09-28

投机解码Speculative Decoding

一句话定义

投机解码是一种加速机制,由小模型起草若干候选 token,大模型一次并行验证,接受通过的前缀并从分歧点重算。它保证输出分布与直接用大模型等价,在草稿接受率高的任务上提速明显。

是什么

投机解码的流程分为起草与验证。草稿模型先自回归生成多个候选 token,目标大模型接着通过一次前向计算,并行得出这些位置的概率分布。大模型从左到右验证并接受与自身分布一致的候选,遇到首个分歧点时停止接受,给出修正 token 后进入下一轮。

验证机制保证输出分布与目标模型直接采样完全一致,属于无损加速。实际加速比取决于草稿接受率与草稿模型速度。

该技术也衍生出了自起草机制、非自回归草稿和树状草稿并行验证等变体。自起草指利用模型自身的早期层或多头来输出候选。

解决什么问题

常规的大模型解码是串行逐 token 生成的。此模式下内存带宽瓶颈会导致单步生成慢,计算资源利用率偏低。

投机解码通过引入草稿机制,将串行验证转化为批量并行处理。其本质是用更多算力换取更低延迟,解决了内存带宽受限的瓶颈。

面试怎么考

面试中常考小模型凭什么能给大模型加速。答题重点在于说明大模型推理受限于内存带宽,而并行验证是用算力换取了延迟。

另一核心考点是为何输出无损,需解释验证过程严格对齐了目标模型的概率分布。此外,面试官常问不同任务的收益差异,应指出代码或格式化文本等可预测性强的任务接受率高,而开放性任务收益低。

又称:投机解码 · Speculative Decoding · 推测解码 · 草稿模型

—— 本条完 ——