五厂面经真题集字节跳动面经高频字节真题强化学习数据清洗速答 · 约 5 分钟更新 2026-09-29

怎么从线上轨迹筛选 Agent RL 数据,避免把偶然成功当优质样本?

一句话结论

筛选线上轨迹不能只看最终成功,必须做过程质量审查、可复现性验证和结果归因。实现上先用规则过滤坏例,再用模型打分,最后人工校准。

先这样答

筛选线上轨迹不能只看最终结果,必须评估每步决策的合理性。线上环境存在很多偶然因素。工具恰好返回了能用的结果会导致任务成功。这种成功属于运气。把碰巧成功的轨迹加入强化学习训练集会破坏模型的策略。我们需要剔除这些假阳性样本。

具体筛选方法包含三个维度。第一是过程质量审查。我们不只看最终状态。我们要评估模型每一步调用工具和推理的逻辑是否合理。第二是可复现性。我们需要提取轨迹中的核心策略。我们在同类任务上测试该策略能否稳定成功。第三是结果归因。我们要拆解任务成功的真正原因。我们需要明确区分成功是来自模型的优秀策略还是外部环境的巧合。

工程实现通常分为三步。第一步是规则过滤。我们先写硬规则筛掉明显的坏例。这步直接剔除死循环或格式错误的轨迹。第二步是模型打分。我们用强模型对候选轨迹的过程质量打分。强模型按步骤判断推理与动作的匹配度。第三步是人工校准。我们安排人工抽检高分轨迹。人工评估打分结果。我们根据人工反馈校准强模型的评分标准。

面试官会怎么追问

  • 「怎么具体做过程质量审查?」 我们让强模型逐步检查轨迹。强模型对比当前步骤的推理文本和实际执行的动作。强模型判断动作是否脱离推理逻辑。脱离逻辑的步骤会被判定为不合格。只要有一步不合格就丢弃整条轨迹。

  • 「规则过滤一般会拦截哪些明显的坏例?」 规则主要拦截基础错误。我们拦截重复调用相同工具且参数不变的死循环。我们也拦截输出不符合预定格式的轨迹。规则也会直接丢弃调用不存在工具的轨迹。

  • 「人工抽检发现模型打分不准怎么处理?」 我们收集人工标注的校准数据。我们将这些数据写成少样本提示词。我们把提示词加入打分模型的输入中。这能修正打分模型对特定错误模式的判断偏差。

回答的坑

只提用规则过滤最终失败的轨迹,忽略了对成功轨迹的归因分析。 把强模型打分当成绝对真理,缺少人工抽检校准环节。

—— 本题完 ——