高频合集 · CHEAT SHEET
大模型面试八股文(60 问,含答案)
大模型岗绕不开的地基题:架构、训练、推理三层各 20 问。每题一句话答案先行——面试现场先给结论再展开,完整解析看右侧链接。
本页 60 题同页给全答案,可直接背结论;每题链到 2431+ 篇真题解析库与逐题深挖。更新于 2026-10-01,持续补充。
LLM 基础概念
- Q1
大模型是怎么训练出来的?预训练、SFT、RLHF 各阶段都在做什么
预训练用海量文本做「预测下一个词」,让模型学会语言和知识;SFT 用高质量问答对教它按指令回答;RLHF 用人类偏好反馈把回答调得更符合人的期望。三步各解决一个问题。
- Q2
Transformer 和注意力机制是什么?为什么大模型都基于它
Transformer 是 2017 年提出的神经网络结构,核心是注意力机制:算每个词的表示时直接去看序列里所有位置并按相关性加权。它可并行、能抓长距离依赖,适合堆大规模训练。
- Q3
Token 是什么?为什么大模型按 Token 计费
Token 是模型处理文本的最小单位,由分词器把文字切开得到,一个 token 约半个到一个英文单词或一到两个汉字。按 token 计费是因为计算量和显存占用都由 token 数决定。
- Q4
Embedding 是什么?它和向量检索是什么关系
Embedding 把文本映射成高维向量,语义相近的文本在向量空间里距离也近;向量检索就是拿查询向量和库内向量算距离,把语义最相近的内容找回来。
- Q5
大模型为什么一个字一个字往外蹦?什么是自回归生成
自回归指模型每步只生成一个 token,把它拼回输入再预测下一个,循环直到结束。「一个字一个字往外蹦」就是逐 token 生成在界面上的直接表现。
- Q6
Temperature 和 Top-p 是什么?采样参数怎么设
两者都控制采样的随机程度:temperature 调整每步概率分布的平缓或尖锐,top-p 限制只在累计概率前 p 的候选里采样。调低更稳,调高更多样,按任务实测来定。
- Q7
上下文窗口是什么?为什么 128K 不等于能塞 128K
上下文窗口是模型一次能处理的最大 token 数,输入输出都算在内。但塞满不等于用好:长文本下注意力会稀释、成本随长度上涨,有效上下文通常明显短于标称值。
- Q8
7B、70B 指的是什么?参数量怎么影响能力、速度和成本
7B、70B 指模型可学习参数的数量,B 是十亿。参数量大致决定知识容量和能力上限,同时决定显存占用和速度,是能力、成本、部署三边的折中。
- Q9
MoE(混合专家)是什么?为什么新模型纷纷改用 MoE
MoE 是一种稀疏结构:模型总参数量很大,但每个 token 只激活其中一小部分专家。容量大、单步计算少,代价是所有参数都要常驻显存,部署门槛在显存。
- Q10
Scaling Law 是什么?为什么大家相信堆算力有用
Scaling Law 指模型 loss 随参数量、数据量、算力的增长按幂律平滑下降的经验规律。它让加大投入的收益变得可预测,是行业敢持续堆算力的主要依据。
- Q11
预训练完的模型为什么不能直接用?后训练补了什么
预训练产出的是一个续写器:会语言、有知识,但不会以助手身份对话。后训练用 SFT 和偏好对齐把续写能力改造成会听话、答得好的产品形态,这一步决定好不好用。
- Q12
同一个问题为什么每次答得不一样?大模型输出的不确定性从哪来
默认设置下模型每步从概率分布里采样,而不是固定取最高分,采样路径不同输出就不同。temperature 设 0 能基本消除随机,但工程实现层面仍做不到绝对逐字可复现。
- Q13
交叉熵损失是什么?训练大模型时模型到底在优化什么?
交叉熵衡量模型预测分布和真实分布的差距,训练大模型就是让真实的下一个 token 概率更高,也就是最大化它的对数似然。
- Q14
RoPE 位置编码是什么?长上下文外推怎么做?
RoPE 是一种将位置信息通过旋转矩阵注入注意力的机制,具备绝对位置的形式和相对位置的效果。长上下文扩展通常采用位置插值、调整频率基数或按波长分段处理来解决未见高频旋转角度导致的注意力异常问题。
- Q15
扩散模型的训练目标和推理过程分别是什么?
扩散模型的训练目标是让网络从加噪数据中预测出所加的噪声,常使用均方误差损失。推理则是从纯高斯噪声出发,按调度逆向迭代去噪,每步通过交叉注意力注入文本条件,最终生成清晰数据。
- Q16
为什么 Stable Diffusion 要在潜空间做扩散?VAE 起什么作用?
核心原因是直接在像素空间做扩散计算量太大。VAE 负责将高维像素图像压缩到低维潜空间,让扩散模型在低计算量下运行,生成结束后再由 VAE 解码回像素图像,它决定了图像细节的上限。
- Q17
Flow Matching 相比扩散模型好在哪?
核心在于学的东西和路径不同。扩散模型学习逐步去噪的随机路径,而流匹配学习噪声到数据的确定性速度场,常采用直线路径。这使得流匹配训练目标更简单稳定,推理时步数更少、成本更低。
- Q18
SwiGLU 是什么?为什么现代大模型都用它替 ReLU/GELU?
SwiGLU 是带有门控机制的激活函数结构。它在 FFN 里用两个线性投影分别生成内容和门控信号再相乘,通过可学习的乘性开关控制信息通过,同等参数预算下表达能力更强。
- Q19
ALiBi 位置编码是什么?和 RoPE 怎么选?
ALiBi 是在注意力分数上直接加线性距离惩罚,RoPE 是对查询和键向量进行旋转。选型上,需要长程精确检索选表达力更强的 RoPE,看重零参数天然外推选 ALiBi。
- Q20
大模型的涌现能力是什么?和 Scaling Law 什么关系?
Scaling Law 描述整体损失随算力、数据、参数增加呈幂律可预测下降,而涌现能力是规模跨过阈值后,模型在特定任务上表现从随机突变到可用的非平滑现象。
训练与微调
- Q1
SFT(监督微调)是什么?和预训练有什么区别
预训练是让模型在海量无标注文本上学「下一个词怎么接」,SFT 是用人工写好的问答对教它「别人问什么该怎么答」。前者给能力,后者给用法。
- Q2
LoRA 是什么?为什么微调大家都在用它
LoRA 冻结原模型权重,在旁边加一对小矩阵只训练它们,用远小于全量微调的参数量达到接近的效果。省显存、好切换、可插拔,所以成了默认选择。
- Q3
LoRA 的 rank(秩)怎么选?是不是越大越好
不是。rank 是 LoRA 旁路矩阵的宽度,决定能学多少变化:小了容量不够,大了费显存还容易过拟合,常见做法从个位数到几十之间起步按任务调。
- Q4
QLoRA 是什么?一张消费级显卡怎么微调大模型
QLoRA 先把冻结的基座模型量化到低位宽省显存,再在它上面做普通 LoRA 训练。权重占用的显存大幅下降,训练精度由 LoRA 部分保持,单张消费级显卡就能调很大的模型。
- Q5
RLHF 是什么?为什么要做人类反馈强化学习这一步
RLHF 先用人类对回答的偏好训练一个奖励模型,再用强化学习让模型朝「人觉得更好」的方向优化。它补的是 SFT 给不了的东西:在多个都对的说法里选出人更满意的那个。
- Q6
DPO 和 PPO 有什么区别?为什么很多团队改用 DPO
PPO 是在 RLHF 里用强化学习:奖励模型打分,模型在训练循环里反复采样更新。DPO 把同一目标改写成直接在偏好对上优化,不需要奖励模型,也没有采样循环,工程上省事得多。
- Q7
GRPO 是什么?它比 PPO 省在哪
GRPO 用「组内比较」代替价值网络:同一个问题让模型采出一组回答,按组内相对好坏分配奖励来更新策略。省掉了和策略模型差不多大的价值模型,显存和算力都省下来。
- Q8
微调的数据怎么准备?多少条数据才够
先定任务和输出格式,再收集贴近真实输入的数据,清洗、统一格式、划分训练验证集。数量没有定论,几千到几万条这个量级常见,但质量比条数重要得多。
- Q9
微调完模型「变笨」了怎么办?灾难性遗忘怎么防
灾难性遗忘是模型在新任务数据上训练后,原有的通用能力明显退化的现象。防法核心是别让训练分布太窄:混入通用数据、控制训练强度、用 LoRA 这类只动小部分参数的方法。
- Q10
用大模型给小模型当老师(蒸馏)是怎么回事?怎么做才有效
蒸馏是让小模型学习大模型的输出行为,把老师的能力压进更小的模型里。有效的关键在三处:老师的输出质量要高、训练数据的覆盖要贴真实任务、学生模型容量要给够。
- Q11
什么情况该微调?什么情况改提示词就够了
判断标准看差距在哪:模型缺知识或知识老变,用检索不改模型;行为、格式、风格不对,先改提示词,反复调仍不稳再微调。微调是最后动的那一档,不是第一档。
- Q12
Reward Model 是什么?Reward Hacking 怎么发现、怎么防?
Reward Model 把人类偏好学成奖励分数,在强化学习阶段指导策略;Reward Hacking 是策略刷高分但实际变差,要靠人评对照、漂移监控、策略约束和持续重训来控制。
- Q13
MoE 的负载均衡是什么?专家并行怎么切?
负载均衡是为了防止路由偏科导致专家塌缩,传统靠辅助损失函数,现在有无损的偏置调整法;专家并行则是把不同专家放到不同GPU上,通过两次all-to-all通信完成分发和合并。
- Q14
Agentic RL 和 SFT 训出来的 Agent 有什么区别?什么时候值得上 RL?
SFT 学的是模仿标注轨迹,只会数据里见过的路径;Agentic RL 让模型在环境里多步试错、按任务成败拿奖励,能长出标注数据没有的策略。代价是要有能自动判分的环境、不容易被钻空子的奖励设计,训练门槛远高于 SFT。
- Q15
Agent RL 的奖励怎么设计?Outcome、Process、规则奖励各适合什么场景?
Agent RL 奖励设计采用组合策略,以结果奖励为主导,规则罚分作兜底,过程奖励辅助冷启动。结果奖励适合结果可校验的任务,过程奖励解决长链路信号稀疏问题,规则奖励用于格式和权限约束。
- Q16
长链路 Agent 任务为什么信用分配难?PRM 怎么参与?
难在只有最终奖励且轨迹长,无法区分哪一步导致成败,优势估计方差大;PRM 可作过程奖励拼进总回报,或直接转成优势信号参与更新。
- Q17
GRPO 之后有哪些衍生改进?DAPO 改了什么?
先讲清GRPO组内相对优势、截断比率和KL惩罚三要素。再说明DAPO用Token级损失归一解决长度偏差,用动态采样过滤无效组,放宽截断上界防熵塌缩,最后补充移除方差归一等衍生思路。
- Q18
DPO 训练时 chosen 和 rejected 的概率同时下降,是什么原因、怎么处理?
DPO损失只关注相对概率差,不保证绝对概率上升。当数据存在标注颠倒或同质化严重时,模型会同时压低两者概率。处理时首要检查清洗数据,其次考虑在训练侧增加SFT损失项托底或采用变体。
- Q19
GAE 的公式是什么?λ 和 γ 各是什么含义?为什么有了 Reward Model 还需要 Critic?
GAE是多步TD误差的加权和,γ决定未来奖励视野,λ调节偏差与方差。Reward Model只提供最终的标量奖励,而Critic用于估计状态价值并作为基线,用来降低策略梯度更新时的方差。
- Q20
梯度累积和直接增大 batch size,效果完全等价吗?
数学上在理想条件下近似等价,但在工程实现中,由于批次统计层、梯度裁剪粒度、调度器计步以及浮点误差的存在,两者并不完全等价。
推理与部署
- Q1
KV Cache 是什么?没有它为什么就快不起来
生成每个新词都要和前面所有词做注意力计算,KV Cache 把前面词算好的键值中间结果存下来复用,每步只算新词自己那份,省掉绝大部分重复计算。
- Q2
vLLM 为什么快?PagedAttention 解决了什么问题
vLLM 快的核心是 PagedAttention:把 KV Cache 像操作系统管内存分页那样按小块管理,显存几乎零浪费,同样显存能装下更多并发请求,吞吐自然上去。
- Q3
部署一个 7B、70B 模型要多少显存?怎么估算
记住一个加法:权重等于参数量乘每参数字节数,加 KV Cache(随上下文和并发涨),加运行时开销,最后乘一点二到一点五的余量,就是你要准备的显存。
- Q4
模型量化是什么?INT4、INT8 压缩会不会伤效果
量化把权重从 FP16 这类高精度数映射到 INT8、INT4 的低精度数,显存和搬运量降到二分之一或四分之一;做得细损失很小,做得糙会明显掉点,上线前要用目标任务验证。
- Q5
Continuous Batching 是什么?它和攒一批再处理差在哪
攒批是凑满一批一起算、等最慢的跑完才散场,短任务全程陪跑,GPU 大量空转;连续批处理按每一步生成调度,谁完成谁退出、新请求随时补位,GPU 一直有活干。
- Q6
Prefix Caching(前缀缓存)是什么?怎么靠它省钱提速
大量请求的开头一模一样,比如同一段系统提示词。把这段公共开头算好的 KV Cache 存下来跨请求复用,后来的请求跳过这部分预填充,首 token 更快,费用也更低。
- Q7
投机解码是什么?小模型凭什么能给大模型加速
小模型一口气猜出几个 token,大模型用一次前向并行验证,对的留下、错的从错处重猜。权重每步只读一次却可能产出多个 token,输出分布和大模型自己生成完全一致。
- Q8
张量并行、流水线并行、数据并行有什么区别?多卡怎么拆
数据并行复制整个模型、分摊请求,解决请求多;张量并行把每层的矩阵切开、多卡合算一层,解决单层算不动;流水线并行把层分段接力,解决模型太深装不下。
- Q9
首 Token 延迟和吐字速度分别由什么决定?怎么优化
首 token 延迟花在排队和预填充整个提示词上,是算力问题;吐字速度取决于每步把权重搬进计算单元的带宽,是内存带宽问题。瓶颈不同,优化手段要对号入座。
- Q10
大模型自己部署还是直接调 API?这笔账怎么算
API 按 token 计费、零运维、随开随用,代价是数据出域和单价刚性;自建前期投卡投人,换来数据可控和低边际成本。量小波动大用 API,量大、平稳、敏感才自建。
- Q11
手机和边缘设备能跑大模型吗?瓶颈在哪
能跑,但要换预期:现实目标是几 B 到十几 B 参数的量化模型,瓶颈不在算力而在内存容量与带宽,外加功耗散热,能力上和云端大模型仍有可感知的差距。
- Q12
PD 分离是什么?为什么推理框架要把 Prefill 和 Decode 分开部署?
PD 分离是把负责整段输入计算的 Prefill 和逐 token 生成的 Decode 放到不同实例,让两类资源各自调度,但要承担 KV Cache 传输和系统复杂度。
- Q13
KV Cache 也能量化吗?显存还能怎么省?
KV Cache 可以通过非对称量化压缩到 INT8 或 INT4,结合模型结构优化、注意力机制调整和底层的分页显存管理,能把长文本推理的并发上限提升数倍。
- Q14
GQA、MQA、MLA 是什么?为什么推理部署都在用?
它们都是为缩减大模型推理时 KV 缓存显存占用而设计的注意力变体。MQA 共享一个 KV 头,GQA 分组共享,MLA 则将 KV 压缩成低秩潜在向量并解耦 RoPE。
- Q15
Flash Attention 是什么?它到底在优化什么?
Flash Attention 是一种精确的注意力算法,通过分块计算和在线 Softmax 技术减少中间矩阵的显存读写,重点优化的是访存通信瓶颈而非计算量。
- Q16
怎么判断一个算子是带宽瓶颈还是计算瓶颈?Roofline 模型是什么?
判断瓶颈的核心是对比算子的计算强度与硬件的拐点。Roofline 模型通过横轴计算强度和纵轴性能,直观展现算子是被内存带宽限制还是被算力限制。
- Q17
投机解码的工程细节:树状草稿怎么组织?未命中的候选怎么处理?草稿长度为什么不是越长越好?
树状草稿通过保留多分支和树注意力掩码让大模型一次性并行验证多条路径;未命中的分支会被丢弃并由大模型重采样修正;草稿长度过长会导致尾部接受率极低白耗算力,需根据任务动态调节。
- Q18
KV Cache 为什么只缓存 K 和 V,不缓存 Q?
因为在生成任务中,历史 token 的 K 和 V 会在后续每一步被反复用到,而 Q 只对当前正在生成的那个 token 有意义,用完即弃。缓存的本质是复用数据,只有 K 和 V 具备复用价值。
- Q19
模型服务的降级链路怎么设计?
降级链路设计要按故障类型分层处理,限流超时做退避重试,模型不可用切备用厂商,质量劣化切旧版本,同时必须做好多供应商热切换、能力对齐检查以及全局熔断,防止主备模型发生连锁故障。
- Q20
多模型分级路由落地时要注意什么?
落地多模型分级路由的核心是平衡成本与质量,重点在于设计合理的路由策略、防范延迟叠加与误判陷阱,并通过线上日志持续迭代路由分类器。