是什么
Best-of-N 是指针对同一提示词生成 N 个回答,通过奖励模型或判据挑选最优输出给用户。计算成本随 N 的增加而线性增长。
拒绝采样训练将 Best-of-N 选出的优质样本作为监督微调数据进行迭代训练,即采样、筛选、再训练,是推理数据自举的主流做法。它与强化学习存在对应关系:拒绝采样通过硬筛选只保留好样本,强化学习则通过优势加权区分好坏。前者是后者的粗糙近似,两者的探索均依赖随机采样。
该机制的风险在于判据质量决定模型上限,且多轮迭代容易导致分布坍缩,使样本逐渐趋同。
解决什么问题
拒绝采样在缺乏复杂强化学习基础设施的情况下,提供了一种半自动化提升模型能力的途径。
它通过生成和过滤机制,让模型基于自身输出进行迭代。这构成了理解推理模型数据管线与强化学习关系的过渡,使工程团队能以较低复杂度实现类似强化学习的对齐效果。
面试怎么考
面试中常见的考法主要围绕以下三个方向:
一是 Best-of-N 的成本账。答题要点需明确算力消耗与采样数量成正比,以及对推理延迟的影响。二是拒绝采样与强化学习的等价与差距。答题应指出两者探索机制的相似性,并对比硬筛选与优势加权在参数更新上的差异。三是怎么防分布坍缩。答题要点在于控制迭代轮次或在判据中加入差异性考量。
又称:拒绝采样 · Best-of-N · BoN · Rejection Sampling
考这个术语的题
接着做点什么
—— 本条完 ——