训练与微调采样训练更新 2026-09-28

拒绝采样 / Best-of-NRejection Sampling / Best-of-N

一句话定义

拒绝采样与 Best-of-N 是对同一提示词采样 N 个回答并按判据挑选最优解的机制。推理时直接输出最优解即 Best-of-N,将优质输出作为数据迭代训练即拒绝采样,它是强化学习的离线朴素形态。

是什么

Best-of-N 是指针对同一提示词生成 N 个回答,通过奖励模型或判据挑选最优输出给用户。计算成本随 N 的增加而线性增长。

拒绝采样训练将 Best-of-N 选出的优质样本作为监督微调数据进行迭代训练,即采样、筛选、再训练,是推理数据自举的主流做法。它与强化学习存在对应关系:拒绝采样通过硬筛选只保留好样本,强化学习则通过优势加权区分好坏。前者是后者的粗糙近似,两者的探索均依赖随机采样。

该机制的风险在于判据质量决定模型上限,且多轮迭代容易导致分布坍缩,使样本逐渐趋同。

解决什么问题

拒绝采样在缺乏复杂强化学习基础设施的情况下,提供了一种半自动化提升模型能力的途径。

它通过生成和过滤机制,让模型基于自身输出进行迭代。这构成了理解推理模型数据管线与强化学习关系的过渡,使工程团队能以较低复杂度实现类似强化学习的对齐效果。

面试怎么考

面试中常见的考法主要围绕以下三个方向:

一是 Best-of-N 的成本账。答题要点需明确算力消耗与采样数量成正比,以及对推理延迟的影响。二是拒绝采样与强化学习的等价与差距。答题应指出两者探索机制的相似性,并对比硬筛选与优势加权在参数更新上的差异。三是怎么防分布坍缩。答题要点在于控制迭代轮次或在判据中加入差异性考量。

又称:拒绝采样 · Best-of-N · BoN · Rejection Sampling

相关术语

—— 本条完 ——