目录
AgentAlpha
· 面试间
← 返回主站
目录
开始
面试间首页
模拟面试 · 抽题自测
简历体检
系统学习
LLM 基础概念
209
RAG 检索增强
609
Agent 架构
275
工具调用
106
多智能体
94
记忆系统
7
评测与可观测
107
项目实战与企业级
797
训练与微调
334
推理与部署
23
多模态
68
提示工程
8
安全与合规
8
五厂面经真题集
217
题库与工具
速答题库
术语表
五厂真题集
学习路线
Agent 应用开发
RAG 工程师
LLM 应用开发
AI Infra
按公司刷
百度
76
美团
70
字节跳动
64
腾讯
62
阿里巴巴
51
拼多多
14
小红书
7
滴滴
5
快手
5
DeepSeek
4
蚂蚁集团
3
小米
3
项目面试包
企业知识库 RAG 助手
Text2SQL 数据查询 Agent
数据分析 Agent(ChatBI)
题目来自公开面经与社区真实面经
持续更新 ·
agentalpha.top
首页
/
面试间
/
大厂真题库
/
通用算法基础
岗位方向 · TRACK
通用算法基础面试题
各岗通用底座:Transformer、注意力、采样参数、正则化等基础原理。
31 道题 · 题目口径为公开面经与岗位 JD 的高频归纳
Q · 为什么 Decoder-only 成了大模型的主流架构?
Decoder-only 成为主流是因为它的训练效率高、训练与推理目标一致,且同构的网络层在放大参数时工程实现简单,最适合通用生成基座赛道。
查看答案 →
Q · self-attention 为什么要把矩阵拆成 Q、K、V?
核心是为了让匹配与内容解耦。Q 和 K 负责相似度匹配,决定找什么和去哪找。V 携带实际提取出的内容。拆分能避免单矩阵自乘导致的表达力受限,让同一批词用不同关注模式取不同信息。
查看答案 →
Q · Wide&Deep 和 DIN 的区别是什么?
核心区别在于 DIN 引入了目标注意力机制。Wide&Deep 采用双路联合训练,Wide 侧负责特征共现的记忆,Deep 侧负责泛化。DIN 在此基础上按候选商品与用户历史行为的相关度加权,激活相关兴趣。
查看答案 →
Q · L1 和 L2 正则的稀疏性有什么区别?
L1正则产生稀疏解,最优解常落在坐标轴上,权重精确为零。L2正则产生平滑解,权重被整体压小但不为零。两者的差异源于几何等高线分布与先验分布的不同。
查看答案 →
Q · 做过 NLP,那 NLP 和 LLM 的区别是什么?
核心区别在于范式变化。NLP 时代任务定义在数据集上,模型为任务定制。LLM 时代任务定义在提示词上,预训练加指令微调打通了任务边界。
查看答案 →
Q · ZeRO-2 和 ZeRO-3 怎么选?
显存够用选 ZeRO-2,模型大到放不下再上 ZeRO-3。ZeRO-2 通信开销较小,是多数微调场景的默认选择。
查看答案 →
Q · LayerNorm 和 BatchNorm 的区别?为什么 Transformer 用前者?
BatchNorm 沿 batch 维度归一化,依赖批统计量,处理变长序列不稳。LayerNorm 沿特征维度逐样本归一化,与 batch 无关,适合 Transformer 处理变长文本。
查看答案 →
Q · Prefix、Causal、Encoder-Decoder 三种注意力架构的区别?
三者区别在于注意力方向。Prefix 前缀双向生成单向,Causal 全程单向,Encoder-Decoder 编码双向解码单向。主流选 Causal,赢在训练目标统一及无限自回归。
查看答案 →
Q · bf16 和 fp16 怎么选?
大模型训练默认选 bf16,推理对精度敏感场景选 fp16。bf16 牺牲尾数精度换取大指数范围,能有效避免训练溢出。fp16 尾数精度高但动态范围小。硬件上 A 系及之后架构才全面支持 bf16。
查看答案 →
Q · Pre-LN、Post-LN 和 Sandwich-LN 对深层训练稳定性有什么影响?
稳定性上 Pre-LN 最好,深层模型默认采用;原始 Transformer 采用 Post-LN,需要 warmup 精调;Sandwich-LN 作为折中方案前后都加。
查看答案 →
Q · RoPE、ALiBi 和可学习位置编码各有什么优缺点?
核心差异在于外推能力与实现成本的取舍。可学习编码绝对查表但无法外推;RoPE 靠内积产生相对位置,配合技巧可扩长,是主流;ALiBi 在注意力分数加惩罚,外推平滑但表达力弱。
查看答案 →
Q · GQA 为什么能降低推理成本?它可能牺牲哪些能力?
GQA 通过让多个查询头共享一组 KV 头,按共享比例缩小 KV Cache 体积,从而节省显存和带宽。代价是头多样性下降,可能导致复杂推理与细粒度模式捕捉能力退化。
查看答案 →
Q · 事实性幻觉、逻辑幻觉、引用幻觉与指令冲突怎么区分?
区分这四者要看错误根因。事实性幻觉是知识缺失,逻辑幻觉是推理断裂,引用幻觉是检索用错,指令冲突是没按要求做。治理它们分别对应RAG、推理链校验、溯源核对与约束层。
查看答案 →
Q · 大模型的上下文学习为什么有效?它和参数更新有什么本质区别?
上下文学习的本质是将学习变成条件生成,模型通过模式匹配与组合泛化完成任务,不更新参数。参数更新是将知识永久写入权重。频繁变化的知识用上下文学习或RAG,稳定行为用微调。
查看答案 →
Q · 跨境电商多语言场景,怎么选基座模型并设计能力评测?
选型看目标语言覆盖、电商适配、上下文与成本;评测需按语言独立建集分项测试,严禁英语外推,并增加跨语言一致性检查。
查看答案 →
Q · RMSNorm 和 LayerNorm 的核心差异是什么?部署时怎么取舍?
LayerNorm 计算均值和方差,RMSNorm 只计算均方根,省去均值计算和一次遍历。多数任务效果相当,后者更快、显存略省;从零训练选后者,已有前者权重不必改造。
查看答案 →
Q · 海量向量查 Top-K 近邻,精确检索和近似检索怎么取舍?
精确检索结果完美,但延迟随数据量线性增长;百万级以上通常选 HNSW 或 IVF,再根据延迟 SLA 和召回率调参数。
查看答案 →
Q · 模型上下文长度和知识切片长度,这两个概念怎么区分?
上下文长度是模型一次处理的总 token 预算,知识切片长度是单个检索单元的 token 数;召回内容还要和历史、提示词、生成预留共同占用上下文。
查看答案 →
Q · 你的 SFT 本质上在教模型什么?教知识、风格还是行为边界?
SFT 主要教模型稳定的输出风格和行为边界,而不是把知识硬塞进参数;知识更新快、参数化成本高,知识更适合用 RAG,数据应多数围绕边界设计。
查看答案 →
Q · DPO 的 chosen 和 rejected 差异太小,会发生什么?
差异太小会让偏好信号变弱,梯度方向不稳定,训练在两答案间摇摆,收敛变慢甚至不收敛,模型还可能学到噪声而非真实偏好。
查看答案 →
Q · 怎么证明 rejected 是有效负样本,而不是误杀?
用来源可溯、人工盲评和对照重训三层验证 rejected,先确认拒答理由可靠,再看误杀率,最后看替换后效果是否变差。
查看答案 →
Q · 推理模型的思考链为什么不能中途打断?
推理模型先连续生成完整思考,再给出答案;工具调用却要求暂停生成、等待结果后再继续。中断会让前面的推理上下文断开,两种生成范式因此冲突。
查看答案 →
Q · 推理模型和工具调用的冲突,后来是怎么解决的?
核心折中是让模型先完整结束一轮思考,再发起工具调用;需要外部信息时,再开启下一轮。MCP 也受到底层 Function Calling 支持的限制。
查看答案 →
Q · RNN 的两个致命缺陷是什么?Attention 怎么解决的?
RNN 的问题是顺序计算不能并行,且长距离信息会衰减;Self-Attention 让每个 token 直接访问任意位置,并行计算全部位置。
查看答案 →
Q · 为什么主流大模型都选 Decoder-only?
Decoder-only 把任务统一成预测下一个 token,能在海量无标注文本上自监督训练。相比不同架构各自适配任务,它的目标和数据更统一。
查看答案 →
Q · 大模型训练有哪些步骤?
大模型训练通常分四阶段:预训练学语言与知识,SFT 学指令行为,RLHF 或 DPO 做偏好对齐,最后按业务需要用领域数据微调。
查看答案 →
Q · 知道哪些注意力机制?
我会按族谱回答:MHA 是基线,MQA、GQA 和 MLA 主要围绕 KV Cache 做压缩,稀疏注意力降低长文本复杂度,Flash Attention 做算子级优化。
查看答案 →
Q · 模型的涌现现象是什么?原因是什么?
模型规模较小时能力近乎为零,超过某个阈值后表现突然跳变。原因有两种解释:评测指标制造了假象,或组合任务中的多个子能力同时达到要求。
查看答案 →
Q · 百川、千问、LLaMA 的位置编码怎么做的?有什么区别?
LLaMA 和千问主要采用 RoPE,百川部分版本采用可学习绝对位置编码,核心差别在于相对位置方案更容易配合外推技巧扩展上下文。
查看答案 →
Q · LLaMA 的输入可以无限长吗?输入变长会有哪些变化?
不能。输入变长会推高注意力计算成本和延迟,也会线性增加 KV Cache 显存占用;超过训练长度后,外推能力可能退化,长文中部信息也更难被有效利用。
查看答案 →
Q · 讲讲 Transformer 的结构。
Transformer 按数据流由输入嵌入、位置信息、N 层网络和输出层组成;每层用多头自注意力交换信息,用前馈网络变换特征,并用残差连接与归一化保证训练稳定。
查看答案 →
其他岗位方向
Agent 开发 · 104 题
Agent 应用与平台工程:工具调用、上下文工程、记忆系统、多 Agent 编排、上线与稳定性。
进入 →
Agent 算法 · 27 题
Agentic RL 与后训练:SFT/RLHF/DPO/GRPO、奖励设计、轨迹数据、评测对齐。
进入 →
AI 算法应用 · 37 题
大模型应用算法:RAG 全链路、检索排序、微调选型、业务效果优化。
进入 →
多模态算法 · 6 题
视觉语言模型与多模态:融合架构、CLIP 系、VLM 评估与训练。
进入 →
AI Infra · 11 题
推理与训练系统:vLLM、量化、并行策略、显存与吞吐优化、服务化。
进入 →