训练一个多模态 Agent,数据怎么收集和标注?整条数据链路是什么样的?
先这样答
多模态 Agent 的训练数据核心形态是「指令、操作对」:一条用户指令、任务执行过程中的图像或视频、对应的正确操作序列,三者配对。收集渠道有四类。人工标注:标注员实际执行任务,录屏和操作日志同步采集,质量最高也最贵。程序生成:在模拟环境里自动构造任务和标准操作,量大成本低,但和真实场景有分布差异。模型合成:强模型生成指令,弱模型尝试执行,再由强模型判断执行是否正确,筛出成功配对。线上回流:把生产环境里用户明确确认成功的操作序列回收再利用,分布最真实,要注意脱敏和授权。
训练流程分三段。预训练阶段在大量图文对上做视觉语言对齐,让模型看得懂图。SFT 阶段在指令操作对上做监督微调,学会把「看到什么、要做什么」映射成动作。偏好对齐阶段用 RLHF 或 DPO 处理人类偏好,比如同类任务里更简洁、更稳妥的操作路径。
多模态标注的成本远高于纯文本。一条视频的操作序列标注可能要十几分钟到半小时,所以标注工具的效率直接决定数据产能:要有快捷的元素框选、操作回放校对、多人交叉质检。数据质量上要做抽检复核和一致性过滤,标注错误的操作序列教给模型就是学犯错。
面试官会怎么追问
- 「模型合成的数据怎么保证质量?」 三道关:合成时用强模型把关指令的清晰度,执行后用强模型判断结果是否达成目标,最后人工抽检一个比例校准自动判断的准确率。自动过滤的阈值要定期用人工标注校准。
- 「线上回流数据有什么风险?」 一是隐私,截图和输入里可能有用户敏感信息,要脱敏;二是分布偏,回流的是当前模型已经会做的任务,拿它训练会强化现有路径、覆盖不了新场景,要和探索性新任务数据配比。
- 「为什么不能直接全用模拟环境生成?」 模拟环境的视觉渲染和真实界面有差距,Agent 会在仿真特定纹理上过拟合,真机上识别率掉。模拟数据适合教任务结构,真实数据负责视觉泛化,两者要混着用。
回答的坑
- 只讲数据来源清单,不讲质检和成本控制。数据工程的面试重点恰恰在「怎么便宜地拿到可信数据」。
- 把 SFT 和 RLHF 的顺序或作用说混。先模仿学习再偏好对齐,这个次序要讲清。
同系列的题
—— 本题完 ——