美团 · JD 拆解

大模型算法岗位拆解:LongCat 大模型算法

LongCat 大模型的后训练与评测岗:SFT/DPO 数据构造、reward 设计层层追问,线下评测与线上效果怎么对齐是重心。

岗位族:大模型算法层级:校招 / 社招 1-3 年方向:训练与微调 / 评测与可观测

更新于 2026-09-29 · 口径:该方向公开 JD 与公开面经的高频归纳

这条 JD 在招什么人

做 LongCat 大模型后训练与效果评测的算法工程师。美团口径是业务落地色彩重:LongCat 最终要接到店、外卖、客服这些真实场景里,模型好坏直接由业务指标说话。这个岗位两头都要管:一头是 SFT、DPO 的数据构造与 RL 训练,一头是评测体系——线上效果怎么看、离线评测怎么对得上线上。美团面经在这个方向密度很高:数据怎么配、reward 怎么设、OOD 场景崩了怎么救、线上线下不一致怎么排查,每一环都有对应的面经方向。

业务场景推测

大概率是 LongCat 的对话与理解能力迭代:客服对话、到店评价理解、外卖场景的商家与用户文案任务;评测侧大概率要建线上线下一致性体系(置信度:中,基于公开业务布局推断)。美团场景数据的特点:短文本、口语化、地点与商品实体密集,配送与售后话术对安全性的要求高。

硬技能:必须会什么

  • 后训练数据:SFT 与 DPO 数据怎么造、怎么配(SFT/DPO 数据)
  • 偏好与奖励:reward 设计的常见坑(reward 设计)
  • RL 训练:这个场景为什么选 GRPO 不选 PPO(GRPO vs PPO)
  • 稳定性:OOD 场景效果崩塌的判读与应对(OOD 崩塌)
  • 评测:LLM 裁判的用法与失效场景(LLM 裁判)、金标集怎么建(金标集)
  • 线上评测:线上线下指标怎么对齐(线上评测)

加分项:什么能拉开差距

  • 数据分布变化有实战:训练分布与线上分布漂移的监控和处理(分布漂移)
  • 业务指标与模型指标的映射经验:答准率提升怎么折算成客服转人工率下降
  • 独立跑通过 DPO 或 GRPO,能展示数据规格与训练曲线
  • 本地生活领域的实体理解经验(店名、菜品、地址)

JD 没写但面试会问

  • SFT 数据和 DPO 数据的构造差异、各要多少条(美团面经高频)
  • reward 被钻空子怎么发现、怎么改
  • 线下评测涨点、线上没效果,怎么排查(高频)
  • OOD 请求效果崩了,数据层面怎么补
  • LLM 裁判打分不可信怎么办

能力模型

| 层 | 内容 | 达标线 | | --- | --- | --- | | 基础层 | SFT/DPO/RL 流程 | 公式级理解 | | 数据层 | 数据构造与配比 | 有完整方法论 | | 评测层 | 离线评测、线上对齐 | 搭过评测集 | | 业务层 | 场景指标折算 | 能对到业务指标 |

简历怎么改

  • 训练经历写「数据-配置-指标」;评测经历写「集怎么建、信度怎么验」
  • 线上线下对齐的经历直接写进第一行,这是最稀缺的经验
  • 业务场景词显式写:客服、到店、外卖,帮面试官对号入座
  • 别只写「负责模型效果」,写清楚哪次迭代带来了什么变化

项目建议

  • 评测集复现:给一个开源对话模型建金标集,测 LLM 裁判与人工标注的一致率
  • DPO 数据消融:不同偏好对构造方式的效果对比
  • 美团全部方向的题库见美团公司聚合页
  • 直接用项目匹配器按你的基础和可用时间生成方案

准备计划

  • 7 天:后训练与评测题库速答过两遍;数据构造类问题练到能画流程
  • 21 天:建一个小型评测集并做裁判一致性实验;简历体检
  • 45 天:RL 训练与线上对齐专题补齐,用差距测试定位短板,模拟面试三轮以上

对应面试题:直接刷这几题

下面是这个方向的高频题(站内真实题库,一题一页带答案)。面试前按这个清单过一遍。

相似岗位拆解

下一步

口径说明:本页是该方向公开 JD 与公开面经的高频归纳,不对应某一篇特定 JD,不包含具体薪资与编制信息; 业务场景为推断并标注了置信度,AI 辅助整理、已按站内核查流程过题。招聘以官方发布为准。