先这样答
SFT 之后的 Post-Training 技术,可以按对齐、能力、安全三组来答。对齐主要处理模型偏好,让模型的输出更符合目标偏好。常见方法有 RLHF、DPO、GRPO 系。
能力增强主要围绕模型能不能完成更复杂的任务。第一类是工具调用训练,让模型学习调用工具。第二类是 Agent 轨迹训练,也就是 agentic RL,让模型学习 Agent 执行任务时的轨迹。第三类是推理链训练,属于 o1 类的训练方向,让模型学习更长的推理过程。
安全训练主要包括红队数据对齐和拒绝训练。红队数据对齐把安全场景中的数据用于训练。拒绝训练让模型在不适合回答的场景下进行拒绝。面试里我会先报出这三组,再分别举出对应技术。这样可以说明我区分了偏好对齐、任务能力和安全行为,而不是把所有 Post-Training 方法混在一起。
面试官会怎么追问
-
「RLHF、DPO 和 GRPO 系都属于偏好对齐吗?」
是。它们都放在偏好对齐这一组里。回答时不必把它们和工具调用训练、Agent 轨迹训练混为一谈。 -
「工具调用训练和 Agent 轨迹训练有什么区别?」
工具调用训练关注模型如何调用工具。Agent 轨迹训练关注 Agent 执行任务时的完整轨迹。两者都属于能力增强,但训练对象的范围不同。 -
「推理链训练为什么单独列出来?」
因为它关注模型的推理过程。它和工具调用训练、Agent 轨迹训练一样属于能力增强,但对应的是 o1 类的推理链训练方向。
回答的坑
不要只罗列 RLHF、DPO、GRPO,而要明确它们属于偏好对齐,并补上能力增强和安全两组。
不要把红队数据对齐、拒绝训练说成偏好对齐,它们在这道题里应归到安全训练。
同系列的题
这家公司的面经实录
相关深度笔记