先这样答
筛选线上轨迹不能只看最终结果,必须评估每步决策的合理性。线上环境存在很多偶然因素。工具恰好返回了能用的结果会导致任务成功。这种成功属于运气。把碰巧成功的轨迹加入强化学习训练集会破坏模型的策略。我们需要剔除这些假阳性样本。
具体筛选方法包含三个维度。第一是过程质量审查。我们不只看最终状态。我们要评估模型每一步调用工具和推理的逻辑是否合理。第二是可复现性。我们需要提取轨迹中的核心策略。我们在同类任务上测试该策略能否稳定成功。第三是结果归因。我们要拆解任务成功的真正原因。我们需要明确区分成功是来自模型的优秀策略还是外部环境的巧合。
工程实现通常分为三步。第一步是规则过滤。我们先写硬规则筛掉明显的坏例。这步直接剔除死循环或格式错误的轨迹。第二步是模型打分。我们用强模型对候选轨迹的过程质量打分。强模型按步骤判断推理与动作的匹配度。第三步是人工校准。我们安排人工抽检高分轨迹。人工评估打分结果。我们根据人工反馈校准强模型的评分标准。
面试官会怎么追问
-
「怎么具体做过程质量审查?」 我们让强模型逐步检查轨迹。强模型对比当前步骤的推理文本和实际执行的动作。强模型判断动作是否脱离推理逻辑。脱离逻辑的步骤会被判定为不合格。只要有一步不合格就丢弃整条轨迹。
-
「规则过滤一般会拦截哪些明显的坏例?」 规则主要拦截基础错误。我们拦截重复调用相同工具且参数不变的死循环。我们也拦截输出不符合预定格式的轨迹。规则也会直接丢弃调用不存在工具的轨迹。
-
「人工抽检发现模型打分不准怎么处理?」 我们收集人工标注的校准数据。我们将这些数据写成少样本提示词。我们把提示词加入打分模型的输入中。这能修正打分模型对特定错误模式的判断偏差。
回答的坑
只提用规则过滤最终失败的轨迹,忽略了对成功轨迹的归因分析。 把强模型打分当成绝对真理,缺少人工抽检校准环节。
同系列的题