这条 JD 在招什么人
做通义千问 Qwen-VL 系列多模态模型的算法工程师:视觉编码器设计、图文对齐训练、多模态指令微调、幻觉治理。多模态岗的特点是横跨两条线:视觉侧的 ViT、CLIP 传统,和语言侧的 LLM 后训练,两边都要能答。阿里面经在这个方向追问得很具体:对齐损失怎么设计、视觉 token 为什么这么贵、模态失衡怎么诊断。只会说「用了 Qwen-VL」过不了关,要能看着模型结构图讲出每一块为什么存在。
业务场景推测
大概率是 Qwen-VL 系列的迭代训练:图文理解、文档解析、视频理解,服务夸克搜索、钉钉助手和电商图文场景(置信度:中高,基于公开业务布局推断)。阿里电商场景的多模态需求有自己的特点:商品主图、详情页长图、直播截帧,图里的文字密度高,OCR 与文档理解可能占不小比重。
硬技能:必须会什么
- VLM 结构:视觉编码器、连接器、LLM 三段式,每一段的作用(VLM 是什么)
- 图文对齐:对比学习预训练、对齐阶段的损失与数据(对比预训练、对齐训练)
- 多模态微调:LoRA 在 VLM 上的用法、秩怎么选(LoRA 为什么低秩)
- 视觉 token:数量怎么定、为什么贵、怎么压(视觉 token 成本、token 压缩)
- 幻觉治理:物体幻觉、图文不一致的评测与缓解(幻觉缓解)
- 基础底子:ViT、注意力、交叉熵,公式级掌握
加分项:什么能拉开差距
- 独立训过开源 VLM(LLaVA 量级的复现),能展示训练配置与效果数据
- 模态失衡有处理经验:语言强视觉弱怎么发现、数据怎么调(模态失衡)
- 视频理解方向:帧采样策略、时序建模有实践
- 自建过多模态评测集,知道公开评测集测不出什么
JD 没写但面试会问
- CLIP 为什么用对比学习、损失每一项的含义(阿里面经高频)
- 图进了 LLM 之前发生了什么、分辨率怎么动态调
- 图里有猫模型说没有,怎么定位是编码器的问题还是 LLM 的问题(高频)
- LoRA 微调 VLM 时视觉侧要不要动、为什么
- 高分辨率长图把 token 撑爆了怎么办
能力模型
| 层 | 内容 | 达标线 | | --- | --- | --- | | 视觉层 | ViT、CLIP、分辨率策略 | 能画结构讲取舍 | | 对齐层 | 对比学习、连接器设计 | 损失级掌握 | | 微调层 | 多模态 SFT、LoRA | 独立跑通过 | | 治理层 | 幻觉评测与缓解 | 有方法有数字 |
简历怎么改
- 多模态经历写清模型结构上的改动点,别只写「基于 Qwen-VL 微调」
- 每个结果挂指标:识别准确率、幻觉率、token 成本变化
- 视觉与语言两条线的能力分开举证,面试官会挑弱的一条问
- 自建评测集的经历一定写上,这是区分度最高的一项
项目建议
- LLaVA 量级复现:小规模图文数据训一个 VLM,记录对齐前后的效果对比
- 视觉 token 压缩实验:不同 token 数下的效果-成本曲线
- 阿里全部方向的题库见阿里巴巴公司聚合页
- 直接用项目匹配器按你的基础和可用时间生成方案