本章是准备大模型与 Agent 岗位面试的基础,所有上层应用与工程优化的讨论都建立在对这部分机制的理解之上。适合刚开始备战、需要建立底层认知框架的工程师优先学习,建议安排 2-4 天时间集中突破。掌握这部分内容不仅是为了应对概念提问,更是为了在后续遇到上下文受限、推理延迟过高等实际工程场景时,能够从模型结构层面找到原因。
考点地图
Transformer 架构与自回归生成
面试通常从整体架构切入,要求说明数据如何从输入文本转化为模型可以处理的表示,并按顺序生成输出。面试官会追问编码器与解码器视角的差异,以及残差连接和归一化在信息传递中的具体作用。这部分是后续所有机制讨论的物理载体,结构上的每一个箭头都代表一次张量运算,理解这些运算的先后顺序,是回答并行计算与显存占用问题的前提。
Attention 机制与位置编码
注意力机制负责在上下文中建立词元之间的交互关系,而位置编码则负责向这种无序的交互中注入顺序信息。考点集中在查询、键、值的物理意义、缩放点积的计算过程,以及旋转位置编码如何通过复数乘法实现相对位置的注入。理解这里是解答长文本外推与显存瓶颈问题的前提,面试官通常要求候选人手推注意力分数的计算过程,并解释除以维度根号的具体数学原因。
MoE 稀疏激活机制
当模型参数量增加时,混合专家架构被用来在不增加单次计算量的前提下扩大总容量。面试官的追问方向通常会从基础的路由选择机制,延伸到专家负载不均时的处理策略以及跨设备通信成本。它与基础架构相连,是当前主流模型控制训练与推理成本的标准做法,在考察时通常会要求对比稠密模型与稀疏模型在同等计算资源下的表现差异。
推理优化 与显存调度
模型进入线上服务后,计算资源的分配方式会发生改变,考查重点转向延迟与吞吐的平衡。核心考点是键值缓存的工作原理及其对显存占用的影响,并经常伴随连续批处理或量化策略的讨论。这部分直接决定了候选人是否具备将理论模型转化为工程可用服务的常识,面试官会设定具体的并发请求数量,要求计算显存占用并给出优化方案。
站内学习路线
本分类站内现有速答 14 篇,深度长文 0 篇。深度长文目前正在补充编制中,当前的复习路径以速答与自测为主。建议按照先打地基、再攻高频、最后自测的顺序进行。
先打地基:建立从离散文本到连续张量,再到序列生成的物理认知。 首先阅读 Token 是什么?为什么大模型按 Token 计费,理解文本切分规则与词表映射过程,这是后续所有矩阵运算的输入起点。 接着进入 Transformer 和注意力机制是什么?为什么大模型都基于它,理清编码器与解码器的结构差异,观察数据在多头注意力层与前馈网络中的流动方向。 随后通过 大模型为什么一个字一个字往外蹦?什么是自回归生成 掌握因果遮罩的作用,明确解码阶段只能依赖历史信息的串行生成限制。
再攻高频:针对面试中最常被深挖的三个机制,理解其背后的资源约束。 阅读 RoPE 位置编码是什么?长上下文外推怎么做?,在基础注意力机制之上补充顺序感知机制,并掌握复数旋转操作如何将相对位置信息注入内积计算中。 转向 MoE(混合专家)是什么?为什么新模型纷纷改用 MoE,了解在参数规模扩张时,如何通过门控网络控制单次前向传播的激活计算量。 结合 上下文窗口是什么?为什么 128K 不等于能塞 128K,将理论窗口长度与实际推理时的显存占用、注意力计算复杂度建立联系,理解工程部署时的物理限制。
最后自测:将孤立机制代入完整的模型生命周期与输出控制中。 通过 大模型是怎么训练出来的?预训练、SFT、RLHF 各阶段都在做什么 串联前面的结构知识,明确不同训练阶段的数据形态与交叉熵优化目标。 最后以 同一个问题为什么每次答得不一样?大模型输出的不确定性从哪来 收尾,结合温度系数与核采样参数,理解模型输出概率分布的物理意义。
完成上述 8 篇速答的阅读后,建议前往 模拟面试抽题 进行自测,或在 LLM 基础概念 分类页查漏补缺。
高频追问与避坑
面试官的追问原话:既然 KV Cache 避免了重复计算历史上下文,为什么随着生成序列变长,模型的推理速度还是会明显下降? 答法方向:需要将推理过程拆分为 Prefill 和 Decode 两个阶段。指出在 Decode 阶段,虽然计算量被降低到了仅针对当前单个位置的矩阵向量乘法,但系统必须将历史所有位置的键值张量从显存中读取到计算单元。随着序列变长,显存带宽的读取耗时逐渐超过了算子的计算耗时,导致系统进入内存受限状态。 浅答错在哪:单纯回答计算量减少只看到了算术层面的变化,忽略了底层硬件执行时的访存瓶颈。面试官希望听到候选人对算术强度的理解,即计算量与访存量的比值。浅答者通常不知道 Decode 阶段是一个典型的访存密集型任务,没有点出显存带宽才是此时真正的物理短板。
面试官的追问原话:模型在预训练时只见过 4K 长度的文本,如果直接用 RoPE 机制推理 8K 长度的文本,注意力分数会发生什么变化? 答法方向:说明 RoPE 依赖查询与键向量旋转后的内积来体现相对距离。当推理长度超过训练长度时,模型会遇到未见过的旋转角度差值,导致注意力分数的计算脱离原有的训练分布,表现为注意力机制失效和生成质量崩溃。需要补充说明位置插值或 NTK 感知插值等外推策略的必要性。 浅答错在哪:回答 RoPE 天然支持无限长文本忽略了经验分布的限制。相对位置编码在数学形式上确实可以无限延伸,但在实际模型中,未经训练的相对距离会导致内积结果呈现不可预测的震荡。浅答者混淆了数学公式的定义域与神经网络的泛化边界。
面试官的追问原话:MoE 模型把总参数量扩大了数倍,既然单次只激活少量专家,为什么它的推理延迟没有比同等激活参数量的 Dense 模型低? 答法方向:指出所有专家参数在推理时仍需常驻显存,这会挤压用于批处理的可用显存空间,导致并发量受限。当模型分布在多张显卡上时,门控网络完成路由后,需要通过全对全通信将数据分发给对应专家,计算完成后再进行结果的聚合通信。网络传输的开销往往会抵消稀疏计算带来的时间收益。 浅答错在哪:将稀疏激活直接等同于低延迟,忽视了分布式系统中的通信成本与显存占用。面试官考察的是候选人对系统整体开销的评估能力。浅答者只计算了浮点运算次数的减少,却没有将数据在不同计算节点间的搬运时间计入总延迟。
刷完站内分类下的速答内容后,建议前往飞书专项真题集进行几十道大厂真实面经的延伸练习,检验对这些机制的综合应用能力。基础概念的复习不应止步于名词解释,将其还原为数据流与显存状态,才是应对复杂工程面试的正确路径。