腾讯 · JD 拆解

AI Infra岗位拆解:混元推理工程

混元大模型推理工程岗:serving 部署、KV Cache 与量化优化,TTFT、吞吐、单 token 成本这类硬指标直接对内交付。

岗位族:AI Infra层级:校招 / 社招 1-3 年方向:推理与部署

更新于 2026-09-29 · 口径:该方向公开 JD 与公开面经的高频归纳

这条 JD 在招什么人

让混元大模型在腾讯内部海量业务里跑得快、跑得省的工程师。方向包括推理引擎部署、批调度、KV Cache 优化、量化与显存管理。腾讯的特点是接入方极多:元宝、微信场景的 AI 助手、游戏与广告业务都在调混元,同一套服务要面对差异很大的流量形态——有的重首字延迟,有的重吞吐,有的重长上下文。这个岗位的产出直接体现在机器成本上,面试也按这个口径出题:每个优化点都要能算清收益。

业务场景推测

大概率是混元推理服务的建设与迭代:元宝与微信 AI 助手的在线 serving、内部业务的私有化部署包,也可能包含端侧小模型的落地(置信度:中,基于公开业务布局推断)。社交场景对话短、并发高,首字延迟敏感;游戏与内容场景可能带图文多模态请求。混合流量下的调度与容量规划,大概率是这个岗位的日常。

硬技能:必须会什么

  • KV Cache:原理、命中与失效、为什么缓存 KV 不缓存 Q(KV Cache)
  • 量化:权重量化与 KV 量化(INT8/FP8),精度损失怎么测(量化、KV 量化)
  • 推理引擎:vLLM 为什么快、PagedAttention、continuous batching(vLLM 为什么快、批调度)
  • 前缀缓存:多轮对话场景的命中率优化(前缀缓存)
  • 架构取舍:PD 分离适用什么流量形态(PD 分离)
  • 性能分析:TTFT 与解码速度分别被什么限制(TTFT 与解码速度)、显存怎么估

加分项:什么能拉开差距

  • 给 vLLM 或 SGLang 提过 PR,或自己写过 attention kernel
  • 大流量在线服务的调优经验:压测、容量规划、热点排查
  • 读过混元开源模型的技术材料,能讲清优化点落在模型结构的哪里
  • 成本账算得清:换一档量化后单 token 成本怎么变、质量掉多少

JD 没写但面试会问

  • TTFT 高、解码慢,分别怎么排查、优化手段各是什么(高频)
  • KV Cache 量化后效果掉了,怎么归因到量化而不是别的原因
  • continuous batching 和静态批处理的具体区别、抢占怎么处理
  • 多轮对话场景前缀缓存命中率上不去,可能哪里出了问题
  • 给一张卡和一个模型,显存怎么估、放不放得下

能力模型

| 层 | 内容 | 达标线 | | --- | --- | --- | | 基础层 | Transformer 推理、自回归 | 能画数据流 | | 引擎层 | 批调度、显存管理、缓存 | 讲得出实现 | | 优化层 | 量化、PD 分离、投机解码 | 有数字佐证 | | 业务层 | 延迟、吞吐、成本权衡 | 按流量形态选方案 |

简历怎么改

  • 优化经历必须带数字:TTFT 降多少、吞吐升多少、显存省多少、精度掉几点
  • 「熟悉 vLLM」换成「基于 vLLM 做了 X 改动,解决了 Y 瓶颈,指标 Z」
  • 在线服务经验单列:QPS 量级、SLO 达成情况、故障案例
  • 开源贡献附 PR 链接,写清改了什么

项目建议

  • 推理引擎横评:同模型同卡下 vLLM/SGLang 的吞吐-延迟曲线与量化三档对比
  • 前缀缓存专项:多轮对话流量回放的命中率与延迟收益
  • 腾讯全部方向的题库见腾讯公司聚合页
  • 直接用项目匹配器按你的基础和可用时间生成方案

准备计划

对应面试题:直接刷这几题

下面是这个方向的高频题(站内真实题库,一题一页带答案)。面试前按这个清单过一遍。

相似岗位拆解

下一步

口径说明:本页是该方向公开 JD 与公开面经的高频归纳,不对应某一篇特定 JD,不包含具体薪资与编制信息; 业务场景为推断并标注了置信度,AI 辅助整理、已按站内核查流程过题。招聘以官方发布为准。