AI Infra推理引擎训练框架43 道速答题在范围内

AI Infra学习路线

推理与训练的底层:KV Cache、推理框架、量化与显存账,深挖工程细节。

这条路线是什么

AI Infra 面试的每道题最后都落到带宽与算力的账上。用 Roofline 模型判断算子是带宽瓶颈还是计算瓶颈:Decode 阶段每步只算一个 token 却要读全部权重,所以慢;KV Cache 的显存随序列长度线性增长,所以大;量化压低权重位宽,省的是访存字节。答题时把底层硬件资源和上层模型结构逐项对应起来,这就是这条路线反复训练的分析方式。

走完这条路线,你需要具备两方面的能力。在推理侧,要能讲清从输入到输出的各个优化环节,包括 KV Cache、PagedAttention、连续批处理、量化、投机解码以及 PD 分离,并能熟练计算显存与带宽开销。在训练侧,要懂各类并行策略与显存四件套。此外,这个方向的面试普遍要求动手写代码,手撕算子实现或推导访存流量是常态,这也是路线中必须攻克的部分。

怎么走

学习顺序紧贴面试的考查重心。首先从第 2 章 LLM 基础切入,这里的重点是推理优化内容,帮你建立对显存和带宽消耗的直觉。理论打底后,直接进入第 9 章编程题。手写 Attention 和 KV Cache 是面试的硬指标,不可跳过,趁着理论热度理顺代码逻辑,能验证你对底层机制的理解深度。

完成推理与编程题两章后,转向第 3 章 LLM 训练,集中解决训练侧的并行策略与显存管理问题。基础知识夯实后,再通过第 12 章五厂真题进行实战演练,熟悉头部公司的出题风格和侧重点。最后以第 11 章通用来收尾,补齐常规的计算机基础与工程问题。

适合谁

这条路线面向准备求职 AI Infra、推理引擎或训练框架岗位的工程师。对应的业务场景通常是推理服务部署、训练平台搭建以及底层的算力优化。

适合有系统编程基础,对计算机体系结构、操作系统或高性能计算有了解的候选人。如果你平时关注 GPU 架构,喜欢研究内存管理、并发调度,或者对挖掘硬件性能有兴趣,这个方向会很契合你的背景。转岗者需要做好阅读底层源码和推导计算逻辑的准备。

章节路线

  1. 01
    第 2 章 · LLM 基础

    地基就是这章。Transformer、Attention、MoE、KV Cache,绕不开,问得又细又勤。

    60+ 题 · 建议 2-3 天

  2. 02
    第 9 章 · 编程题

    手写代码那一关。字符串、树和图、动态规划,再配几道 LLM 推理优化的实现题。

    65+ 题 · 建议 2-3 天

  3. 03
    第 3 章 · LLM 训练

    决定你能不能聊深。SFT、RLHF、DPO 和 PPO,训练稳不稳、数据怎么喂,都在这儿。

    35+ 题 · 建议 2-3 天

  4. 04
    第 12 章 · 五厂高频面试题

    按字节、阿里、腾讯、美团、百度各 100 题。先能把结论说出口,再谈细节。

    500 题 · 建议 3-5 天

  5. 05
    第 11 章 · 通用与软实力

    题最多的地方。八股、系统设计、行为面试,还有职业规划和你的技术口味,建议拉长战线。

    800+ 题 · 建议 7-10 天

范围内的题库分类

相关术语(全部术语)

可以写进简历的项目方向

  • KV-cache 实现与性能分析产出:KV-cache 代码 + 加速比曲线

项目怎么讲才能扛住追问,看第一个项目面试包:企业知识库 RAG 助手。

其他方向

—— 路线完 ——