是什么
投机解码的流程分为起草与验证。草稿模型先自回归生成多个候选 token,目标大模型接着通过一次前向计算,并行得出这些位置的概率分布。大模型从左到右验证并接受与自身分布一致的候选,遇到首个分歧点时停止接受,给出修正 token 后进入下一轮。
验证机制保证输出分布与目标模型直接采样完全一致,属于无损加速。实际加速比取决于草稿接受率与草稿模型速度。
该技术也衍生出了自起草机制、非自回归草稿和树状草稿并行验证等变体。自起草指利用模型自身的早期层或多头来输出候选。
解决什么问题
常规的大模型解码是串行逐 token 生成的。此模式下内存带宽瓶颈会导致单步生成慢,计算资源利用率偏低。
投机解码通过引入草稿机制,将串行验证转化为批量并行处理。其本质是用更多算力换取更低延迟,解决了内存带宽受限的瓶颈。
面试怎么考
面试中常考小模型凭什么能给大模型加速。答题重点在于说明大模型推理受限于内存带宽,而并行验证是用算力换取了延迟。
另一核心考点是为何输出无损,需解释验证过程严格对齐了目标模型的概率分布。此外,面试官常问不同任务的收益差异,应指出代码或格式化文本等可预测性强的任务接受率高,而开放性任务收益低。
又称:投机解码 · Speculative Decoding · 推测解码 · 草稿模型
接着做点什么
—— 本条完 ——