这条 JD 在招什么人
Seed 是字节的大模型研发团队,这条 JD 招的是后训练方向的算法工程师:SFT、RLHF、蒸馏,以及喂给这些环节的数据构造。和纯应用算法岗不同,这里要下到训练本身:损失函数怎么写、数据怎么配、训练曲线怎么看。字节这个方向的面试风格是往下钻:从一个概念问到公式,从公式问到异常情况,中途换题的余地小。站内面经里有两道题能代表这个风格:Decoder-only 架构为什么是主流(Decoder-only 为什么主流)、微调后的 Agent 为什么会忘掉旧能力(Agent 遗忘)。这两题答不干净,基本过不了。
业务场景推测
大概率是豆包与 Seed 系列模型的后训练迭代:指令数据构造、偏好对齐、面向 Agent 能力的 RL 训练;也可能包含为扣子平台和内部业务做定制模型的蒸馏与小模型化(置信度:中高,基于公开业务布局推断)。字节的模型要同时服务 C 端产品和大量内部业务线,后训练数据来源杂、口径多,数据清洗与配比的工作量会比一般公司大,这部分能力大概率是隐性考察点。
硬技能:必须会什么
- 后训练流程:SFT、RLHF、DPO/GRPO 各自的适用场景(RLHF 是什么、为什么要后训练)
- 数据构造:指令数据怎么造、怎么洗、怎么配比,坏数据怎么识别(SFT 数据准备)
- 训练监控:奖励、熵、KL 这些曲线怎么看、异常怎么诊断(训练指标)
- 蒸馏:教师与学生模型的选型、蒸馏损失的设计(蒸馏)
- 边界判断:什么任务 SFT 就够、什么任务必须上 RL(RL 与 SFT 的边界)
- 基础底子:Transformer、交叉熵、采样参数,公式级掌握
加分项:什么能拉开差距
- 造过高质量指令或偏好数据:有数据规格、有配比实验、有效果对比
- 处理过灾难性遗忘:混入通用数据、调学习率、分阶段训练,有具体数字
- Agent 能力的 RL 训练经验:工具调用、多轮任务上的 reward 设计
- 读过主流模型的技术报告,能讲清别家后训练是怎么做的
JD 没写但面试会问
- Decoder-only 为什么主流、训练效率高在哪(字节面经高频)
- 微调后模型忘掉旧能力怎么办(字节面经高频)
- SFT 数据多少条够用、质量和数量怎么权衡
- 奖励模型被钻空子了吗、怎么发现的
- 给你一批脏指令数据,处理流程是什么(白板题)
能力模型
| 层 | 内容 | 达标线 | | --- | --- | --- | | 基础层 | Transformer、损失函数、采样 | 公式级,能手推 | | 数据层 | 指令/偏好数据构造与清洗 | 有完整方法论 | | 训练层 | SFT/RLHF/蒸馏 | 独立跑通过 | | 诊断层 | 曲线判读、遗忘处理 | 有案例有数字 |
简历怎么改
- 训练经历写「数据-配置-指标」三件套:数据规模、超参、效果变化
- 数据工作前置:造数据、洗数据的价值不比调参小,别藏在「其他工作」里
- 写清用什么框架跑了什么任务、遇到什么病态、怎么解决
- 别写「精通 RLHF」:写的每一层都会被往深里问
项目建议
- 指令数据配比消融:同一基座不同数据配比,比效果与遗忘程度
- 小模型 RL 复现:记录奖励、熵、KL 三条曲线并写分析
- 字节全部方向的题库见字节跳动公司聚合页
- 直接用项目匹配器按你的基础和可用时间生成方案