阿里淘天 AI Agent 岗:三场面试的追问全记录
淘天集团 AI Agent 方向(应用开发线)
岗位:淘天集团 AI Agent 方向(应用开发线) 轮次:一面至三面,二面 13 问为主记录 一句话定性:这是一场「简历驱动」面试,你的项目写什么它挖什么,RAG 只在你简历里写了才被问。 素材时间线:2026 年 3 月至 7 月的多场阿里系 Agent 岗面试,整理时间 2026-09-28
0. 一分钟速览
| 项目 | 内容 |
|---|---|
| 公司 / 岗位 | 阿里巴巴 · 淘天 AI Agent 方向 |
| 形式 | 线上技术面,一面偏基础与通信,二面深挖项目,三面考架构判断 |
| 有手撕吗 | 有。编辑距离、手写多头注意力都出现过 |
| 有八股吗 | 有。训练侧八股密度明显高于字节,LoRA、DPO、SFT 问到公式 |
| 考察重心 | RAG 项目细节、评估指标、微调原理、推荐系统迁移能力 |
| 难度感受 | 二面最难,13 问基本不给喘息;面试官会交叉验证前后回答 |
| 准备方向 | 简历上每个项目准备四层追问:架构、错误处理、优化、边界 |
1. 面试流程与时间分配
流程:自我介绍 → RAG 项目四连深挖 → 评估指标 → 训练侧八股 → 交叉题(推荐 / SQL / 手撕)→ 反问
| 环节 | 时长 | 面试官在听什么 | 常见失分点 |
|---|---|---|---|
| 项目深挖 | 20 min | 架构说得出分层,错误处理有真实案例 | 只讲「用了 LangChain 搭了一套」 |
| 评估指标 | 10 min | 有没有分层评估的框架感 | 只答「看准确率、看用户反馈」 |
| 训练侧八股 | 15 min | LoRA、DPO 能不能落到公式和数值 | 背结论说不出机制 |
| 交叉题 | 10 min | 岗位匹配度(推荐背景会被问推荐模型) | 认为「我是来面 Agent 的,为什么问推荐」 |
| 手撕 | 10 min | 编辑距离这类经典 DP | 状态转移写错边界 |
2. 追问机制:RAG 四连
淘天二面对 RAG 项目的追问链是固定四连:
- 架构:「你的 RAG 架构是什么?分几层?」
- 错误处理:「召回错了怎么处理?」
- 优化:「漏召怎么优化?」
- 评估:「怎么知道你优化有效?」
四连的每一环都可能再往下挖。比如「漏召怎么优化」之后会接「你说的查询改写,改写错了怎么办」。准备方式是把这四连在自己项目上完整过一遍,每环准备一个真实发生的 case。
3. 一面:通信与基础
3.1 WebSocket 和 SSE 的区别及局限
问法:「说说 WebSocket 和 SSE 通信的区别,各自的局限是什么?」
答题要点:WebSocket 是全双工长连接,双向都能推,适合协作编辑、实时对话这类双方都要主动发消息的场景;SSE 是服务器单向推流的 HTTP 长连接,实现简单、自带断线重连,适合大模型逐 token 流式输出。局限各说一条:WebSocket 连接状态要自己管理(心跳、重连、网关超时),SSE 只能服务器到客户端、HTTP/1.1 下有连接数限制。追问「流式输出为什么主流用 SSE」,答请求响应模型不用改,客户端只发一次请求。
3.2 图数据库增强向量检索
问法:「什么场景下你会选择用图数据库来增强传统的向量检索?」
答题要点:向量检索擅长「语义相近」,不擅长「多跳关系」。当问题需要沿着实体关系走多步(比如「这个供应商的下级经销商里谁有资质」),纯向量召回会把每一跳都变成猜测,图数据库的遍历是精确的。合理的组合是图管结构化关系、向量管语义入口,先向量定位实体、再图上扩展。追问:「引入图之后增量更新怎么做」,答实体节点和边的变更要设计成事件驱动,别全量重建。
4. 二面:RAG 深挖 + 训练侧八股(13 问)
4.1 RAG 评估指标(必考)
问法:「如何评估 RAG 系统的效果?有哪些评估指标?」
答题要点分两层。检索层:Hit@K 看该召回的有没有在前 K 条里,MRR 看正确内容排多前。生成层:忠实度(答案每句话有没有检索内容做依据)、答案相关性、上下文召回率,RAGAs 这类框架可以直接用。落点放在「离线指标只在业务数据上跑才有意义,线上看解决率和转人工率」。
坑:只答「人工抽查」或「看用户反馈」。面试官会直接反问:用户投诉到达时错误答案已经伤害多少人了。
4.2 LoRA 低秩分解
问法:「讲讲 LoRA 的原理,低秩分解为什么有效?」
答题要点:微调时的权重更新量 ΔW 是低秩的,LoRA 用两个小矩阵 B(d×r)和 A(r×d)的乘积近似它,r 远小于 d,可训练参数量骤降。追问两个常见方向:秩怎么选(8 到 64 之间按任务试,越大表达能力越强也越容易过拟合);B 用零初始化、A 随机初始化,保证训练起点和原模型等价。
4.3 DPO 为什么输出会变长
问法:「DPO 训练后模型输出变长,什么原因?」
答题要点:偏好数据里被选中的回答普遍更长,DPO 直接对着偏好对优化,长度本身成了可利用的信号,模型学会「写长一点更容易被选」。缓解:偏好对构造时控制长度均衡,或在奖励里加长度惩罚项。
4.4 复读机现象与 SFT 后遗忘
问法:「模型出现复读机现象怎么解释?」「SFT 之后通用能力下降怎么办?」
复读机:训练数据里存在重复模式、解码温度低、重复惩罚项缺失共同作用;处理从数据去重和解码参数两端入手。SFT 遗忘:专用数据分布太窄,混入通用数据按比例配比,或改用 LoRA 这类参数高效方式降低对基座的扰动。
4.5 交叉题:推荐模型 + SQL + 手撕
推荐算法背景的候选人会被问 Wide&Deep 和 DIN 的结构差异(宽部分记忆、深部分泛化,DIN 用注意力对用户行为做目标相关加权)。SQL 手写去重查询。手撕题是编辑距离(LeetCode 72),经典二维 DP,注意边界条件。另一场阿里线的手撕是手写多头注意力的 causal mask 部分。
5. 三面:RAG 落地的难点判断
问法:「实际落地中,你觉得 RAG 最难的地方在哪里?」
这是三面的定调题,答得好坏直接决定面试官对候选人层级的判断。答题框架按三块展开:
- 文档预处理:PDF 表格、双栏排版解析成乱码,垃圾进垃圾出,生产系统的预处理代码量常超过 RAG 核心逻辑;
- 检索质量调优:召回不准的原因分散在 Chunking、Embedding、Query 改写多个环节,定位靠分层指标而不是猜;
- 效果评估:没有评估体系,所有优化都是盲调。
坑:只答「Embedding 选型」。那是其中一个点,面试官要的是分层说清楚难在哪的能力。
6. 复盘与准备清单
- 简历驱动的深挖是阿里系的特点:写上去的每个项目都要备好四层追问,没做深的别写。
- 训练侧八股比字节重:LoRA、DPO、SFT 要能落到公式和初始化细节,准备深度参考训练与微调分类的题库。
- 推荐背景是加分项也是考点:淘天的 Agent 岗大量和推荐、搜广投结合,Wide&Deep、DIN 这类基础要捡起来。
- 阿里云的 Agent 实习线(后端方向)另有一场「23 问追问链」的考法:从什么是 Agent 一路问到工具调用失败兜底与上下文工程,追问风格和淘天一致,可以对照准备。
相关题目:站内题库的「RAG 怎么评估」「LoRA 的秩怎么选」「DPO 和 PPO 的区别」都对应这场面试的原题。