阿里巴巴一面至三面 · 二面约 13 问深挖 · 有手撕 25 分钟读完

阿里淘天 AI Agent 岗:三场面试的追问全记录

淘天集团 AI Agent 方向(应用开发线)

面经阿里RAGLoRADPO评估

岗位:淘天集团 AI Agent 方向(应用开发线) 轮次:一面至三面,二面 13 问为主记录 一句话定性:这是一场「简历驱动」面试,你的项目写什么它挖什么,RAG 只在你简历里写了才被问。 素材时间线:2026 年 3 月至 7 月的多场阿里系 Agent 岗面试,整理时间 2026-09-28


0. 一分钟速览

项目内容
公司 / 岗位阿里巴巴 · 淘天 AI Agent 方向
形式线上技术面,一面偏基础与通信,二面深挖项目,三面考架构判断
有手撕吗有。编辑距离、手写多头注意力都出现过
有八股吗有。训练侧八股密度明显高于字节,LoRA、DPO、SFT 问到公式
考察重心RAG 项目细节、评估指标、微调原理、推荐系统迁移能力
难度感受二面最难,13 问基本不给喘息;面试官会交叉验证前后回答
准备方向简历上每个项目准备四层追问:架构、错误处理、优化、边界

1. 面试流程与时间分配

流程:自我介绍 → RAG 项目四连深挖 → 评估指标 → 训练侧八股 → 交叉题(推荐 / SQL / 手撕)→ 反问

环节时长面试官在听什么常见失分点
项目深挖20 min架构说得出分层,错误处理有真实案例只讲「用了 LangChain 搭了一套」
评估指标10 min有没有分层评估的框架感只答「看准确率、看用户反馈」
训练侧八股15 minLoRA、DPO 能不能落到公式和数值背结论说不出机制
交叉题10 min岗位匹配度(推荐背景会被问推荐模型)认为「我是来面 Agent 的,为什么问推荐」
手撕10 min编辑距离这类经典 DP状态转移写错边界

2. 追问机制:RAG 四连

淘天二面对 RAG 项目的追问链是固定四连:

  1. 架构:「你的 RAG 架构是什么?分几层?」
  2. 错误处理:「召回错了怎么处理?」
  3. 优化:「漏召怎么优化?」
  4. 评估:「怎么知道你优化有效?」

四连的每一环都可能再往下挖。比如「漏召怎么优化」之后会接「你说的查询改写,改写错了怎么办」。准备方式是把这四连在自己项目上完整过一遍,每环准备一个真实发生的 case。


3. 一面:通信与基础

3.1 WebSocket 和 SSE 的区别及局限

问法:「说说 WebSocket 和 SSE 通信的区别,各自的局限是什么?」

答题要点:WebSocket 是全双工长连接,双向都能推,适合协作编辑、实时对话这类双方都要主动发消息的场景;SSE 是服务器单向推流的 HTTP 长连接,实现简单、自带断线重连,适合大模型逐 token 流式输出。局限各说一条:WebSocket 连接状态要自己管理(心跳、重连、网关超时),SSE 只能服务器到客户端、HTTP/1.1 下有连接数限制。追问「流式输出为什么主流用 SSE」,答请求响应模型不用改,客户端只发一次请求。

3.2 图数据库增强向量检索

问法:「什么场景下你会选择用图数据库来增强传统的向量检索?」

答题要点:向量检索擅长「语义相近」,不擅长「多跳关系」。当问题需要沿着实体关系走多步(比如「这个供应商的下级经销商里谁有资质」),纯向量召回会把每一跳都变成猜测,图数据库的遍历是精确的。合理的组合是图管结构化关系、向量管语义入口,先向量定位实体、再图上扩展。追问:「引入图之后增量更新怎么做」,答实体节点和边的变更要设计成事件驱动,别全量重建。


4. 二面:RAG 深挖 + 训练侧八股(13 问)

4.1 RAG 评估指标(必考)

问法:「如何评估 RAG 系统的效果?有哪些评估指标?」

答题要点分两层。检索层:Hit@K 看该召回的有没有在前 K 条里,MRR 看正确内容排多前。生成层:忠实度(答案每句话有没有检索内容做依据)、答案相关性、上下文召回率,RAGAs 这类框架可以直接用。落点放在「离线指标只在业务数据上跑才有意义,线上看解决率和转人工率」。

坑:只答「人工抽查」或「看用户反馈」。面试官会直接反问:用户投诉到达时错误答案已经伤害多少人了。

4.2 LoRA 低秩分解

问法:「讲讲 LoRA 的原理,低秩分解为什么有效?」

答题要点:微调时的权重更新量 ΔW 是低秩的,LoRA 用两个小矩阵 B(d×r)和 A(r×d)的乘积近似它,r 远小于 d,可训练参数量骤降。追问两个常见方向:秩怎么选(8 到 64 之间按任务试,越大表达能力越强也越容易过拟合);B 用零初始化、A 随机初始化,保证训练起点和原模型等价。

4.3 DPO 为什么输出会变长

问法:「DPO 训练后模型输出变长,什么原因?」

答题要点:偏好数据里被选中的回答普遍更长,DPO 直接对着偏好对优化,长度本身成了可利用的信号,模型学会「写长一点更容易被选」。缓解:偏好对构造时控制长度均衡,或在奖励里加长度惩罚项。

4.4 复读机现象与 SFT 后遗忘

问法:「模型出现复读机现象怎么解释?」「SFT 之后通用能力下降怎么办?」

复读机:训练数据里存在重复模式、解码温度低、重复惩罚项缺失共同作用;处理从数据去重和解码参数两端入手。SFT 遗忘:专用数据分布太窄,混入通用数据按比例配比,或改用 LoRA 这类参数高效方式降低对基座的扰动。

4.5 交叉题:推荐模型 + SQL + 手撕

推荐算法背景的候选人会被问 Wide&Deep 和 DIN 的结构差异(宽部分记忆、深部分泛化,DIN 用注意力对用户行为做目标相关加权)。SQL 手写去重查询。手撕题是编辑距离(LeetCode 72),经典二维 DP,注意边界条件。另一场阿里线的手撕是手写多头注意力的 causal mask 部分。


5. 三面:RAG 落地的难点判断

问法:「实际落地中,你觉得 RAG 最难的地方在哪里?」

这是三面的定调题,答得好坏直接决定面试官对候选人层级的判断。答题框架按三块展开:

  1. 文档预处理:PDF 表格、双栏排版解析成乱码,垃圾进垃圾出,生产系统的预处理代码量常超过 RAG 核心逻辑;
  2. 检索质量调优:召回不准的原因分散在 Chunking、Embedding、Query 改写多个环节,定位靠分层指标而不是猜;
  3. 效果评估:没有评估体系,所有优化都是盲调。

坑:只答「Embedding 选型」。那是其中一个点,面试官要的是分层说清楚难在哪的能力。


6. 复盘与准备清单

  • 简历驱动的深挖是阿里系的特点:写上去的每个项目都要备好四层追问,没做深的别写。
  • 训练侧八股比字节重:LoRA、DPO、SFT 要能落到公式和初始化细节,准备深度参考训练与微调分类的题库。
  • 推荐背景是加分项也是考点:淘天的 Agent 岗大量和推荐、搜广投结合,Wide&Deep、DIN 这类基础要捡起来。
  • 阿里云的 Agent 实习线(后端方向)另有一场「23 问追问链」的考法:从什么是 Agent 一路问到工具调用失败兜底与上下文工程,追问风格和淘天一致,可以对照准备。

相关题目:站内题库的「RAG 怎么评估」「LoRA 的秩怎么选」「DPO 和 PPO 的区别」都对应这场面试的原题。