BASICS · ALL

LLM 基础概念 · 全部题目

共 196 篇,本页第 1-48 篇。← 回到学习路径视图

No.1002Encoder与decoder的中Attention区别面试官想考察你对Transformer架构底层原理的掌握深度,而非简单背诵。核心是区分三种注意力机制的角色:Encode…→No.1003Attention如何计算?为什么除以根号下Dk?mask attention是如何实现的面试官想考察你对 Transformer 核心机制的理解深度,而非简单背诵公式。这是典型的“概念 + 数学 + 工程”三…→No.1004Transformer的位置编码作用及局限性面试官想看你是否真正理解位置编码的设计动机,而不是只会背“Transformer用正弦编码”。考察类型是工程取舍+系统设…→No.1005Transformer在哪里做了权重共享面试官想考察你对 Transformer 参数效率的深度理解,而非简单背诵架构图。这是“工程取舍”型问题,刁钻点在于:权…→No.1006Transformer模型中,最占用参数的是MLP层吗面试官想看你是否真正理解 Transformer 架构的“参数账本”,而非仅停留在“MLP 很大”的直觉层面。这是典型的…→No.1007Sparse Attention(稀疏注意力)是什么面试官想考察你对Transformer核心瓶颈(O(n²)复杂度)的深度理解,以及是否具备“工程取舍”思维。这不是背概念…→No.1008What is the purpose of scaling in the self-attention mechanism in the Transformer model面试官真正想看的是你对 Transformer 核心机制的理解深度,而非简单背诵“除以√d_k”。考察类型是工程取舍 +…→No.1009Why does the Transformer model use multiple self-attention heads instead of a single self-attention head面试官想验证你是否真正理解多头注意力(MHA)的设计动机,而非仅背诵“多个头能关注不同位置”。这是典型的工程取舍考察:为…→No.1010What are the fundamental limitations of the Transformer model面试官想看你是否真正理解Transformer的“阿喀琉斯之踵”,而非仅仅背诵“注意力机制好”。这是典型的系统设计+工程…→No.1011How do transformers address the limitations of traditional deep learning models like CNNs and RNNs面试官想看你是否真正理解Transformer的设计动机,而非背诵架构图。这题是典型的“系统设计动机”类问题,刁钻点在于…→No.1012How does Transformer model address the vanishing gradient problem面试官想考察你对 Transformer 架构底层机制的理解深度,而非仅停留在“用了残差连接”的表面。这是典型的工程取舍…→No.1013What is the purpose of the position-wise feed-forward sublayer in the Transformer model面试官想考察你对 Transformer 架构的深度理解,而非简单背诵“FFN 就是两层线性+ReLU”。真正意图是:你…→No.1014| Q11 | How do Transformer models address the vanishing gradient problem面试官想考察你对 Transformer 架构底层机制的理解深度,而非简单背诵“用了残差和层归一化”。刁钻点在于:能否从…→No.1015| Q15 | What is the role of self-attention in the Transformer model, and why is it called “self-attention”面试官想确认你是否真正理解Transformer的核心创新,而非仅仅背诵“QKV点积”的公式。考察类型是概念+工程取舍:…→No.1016| Q16 | What is the purpose of the encoder in a Transformer model面试官想看你是否真正理解Transformer编码器的核心功能,而非仅背诵“自注意力+前馈网络”的结构。这道题属于概念+…→No.1017| Q17 | What is the purpose of the decoder in a Transformer model面试官想看你是否真懂Transformer解码器的核心机制,而非仅背结构图。这是“背概念+工程取舍”混合题,刁钻点在于:…→No.1018| Q18 | How does the encoder-decoder structure work at a high level in the Transformer model面试官想确认你是否真正理解 Transformer 编码器-解码器架构的核心设计哲学,而非仅仅背诵“编码器处理输入,解码…→No.1019| Q19 | What is the purpose of scaling in the self-attention mechanism in the Transformer model面试官想考察你对 Transformer 核心机制的理解深度,而非简单背诵“除以 sqrt(d_k)”。这属于工程取舍 …→No.1020| Q20 | Why does the Transformer model use multiple self-attention heads instead of a single self-attention head面试官想考察你对 Transformer 核心组件——多头注意力(Multi-Head Attention)的设计动机和…→No.1021| Q21 | How are the outputs of multiple heads combined and projected back in the multi-head attention in the Transformer model面试官想验证你对Transformer核心组件——多头注意力(Multi-Head Attention)——的实现细节是…→No.1023| Q24 | What is the purpose of masked self-attention in the Transformer decoder面试官想验证你是否真正理解 Transformer 解码器的自回归本质,而非仅仅背诵“防止看到未来 token”。这是典…→No.1024| Q26 | Explain why self-attention in the decoder is referred to as cross-attention. How does it differ from self-attention in the encoder面试官想确认你是否真正理解 Transformer 解码器的内部机制,而非停留在“背图”层面。这道题表面是术语辨析,实则…→No.1029Attention 为什么比 RNN 更适合大规模建模面试官想考察你对序列建模本质瓶颈的理解,而非简单背诵“Attention 能并行”。刁钻点在于:是否清楚 RNN 的计算…→No.1033Attention机制和传统的Seq2Seq模型有什么区别面试官想考察你对序列建模核心演进的理解,而非单纯背概念。这是典型的“概念对比+工程取舍”题,刁钻点在于:你是否能跳出“A…→No.1043ALiBi (Attention with Linear Biases)思路是什么面试官想考察你对位置编码的深度理解,尤其是长度外推这一关键工程问题。ALiBi 是 2022 年由 Press 等人提出…→No.1051为什么对GPT来说,in context Learning是有效的面试官想看你是否真正理解In-Context Learning(ICL)的底层机制,而非停留在“给几个例子就能学”的表面…→No.1052flash attention呢面试官想看你是否真正理解FlashAttention的IO感知(IO-aware) 核心,而非只背“分块+重计算”的皮毛…→No.1054还有其他的attention吗?(QKV的改进回答)面试官想看你是否只停留在“背出 MHA、MQA、GQA 名字”的层面,还是能深入理解每种变体背后的工程取舍和场景适配。刁…→No.1055在 Agent 多轮对话任务中,你觉得 Attention 的局限性体现在哪些方面面试官想考察你对 Attention 机制在工程落地中的真实理解,而非背论文。刁钻点在于:多轮对话不仅是长文本,还有状态…→No.1056What is the difference between local attention and global attention面试官想考察你对稀疏注意力机制(Sparse Attention)的底层理解,而非简单背诵概念。这是一道典型的“工程取舍…→No.1059在常规attention中,一般有k=v,那self-attention 可以吗这道题是典型的“概念辨析 + 工程取舍”型面试题,难度在 P1 进阶。面试官真正想看的是:你是否真正理解 Attenti…→No.1061深度学习中attention与全连接层的区别何在面试官想看你是否真正理解Attention机制的本质,而不仅仅是背公式。考察类型是工程取舍+概念辨析,刁钻点在于:很多人…→No.1068Flash Attention 和标准 Attention 输出完全一样吗面试官想验证你是否真正理解 Flash Attention 的算法本质,而非停留在“它更快更省显存”的营销话术上。考察类…→No.1069**Q31:FlashAttention 为什么快面试官想考察你是否真正理解 FlashAttention 的底层加速机制,而非仅仅背诵“IO 感知”或“tiling”等…→No.1070八股:Attention 计算中有哪些显存优化策略?(如 KV Cache 复用、batch 拼接)面试官想考察你对 LLM 推理/训练中显存瓶颈的系统性理解,而非单纯背概念。刁钻点在于:你是否能区分“训练 vs 推理”…→No.1074MLA (Multi-head Latent Attention) 是什么面试官想考察你对新型注意力机制的深度理解,特别是从工程优化和系统设计角度,而非仅仅背诵论文。刁钻点在于:MLA 不是简单…→No.1258如何估算 LLaMA-7B 模型推理时的显存占用面试官想看你是否真正理解 LLM 推理的显存构成,而非死记硬背数字。这是典型的“工程取舍+debug”题,刁钻点在于:很…→No.1260八股:如何估算 LLaMA-7B 模型推理时的显存占用面试官想看的不是背公式,而是你能否量化拆解推理显存,并区分训练与推理的差异。这是典型的工程估算题,刁钻点在于:很多人只记…→No.1261参数量计算:Qwen-14B 的 「14B「 怎么算出来的?推理时FLOPs大概多少面试官想看你是否真正理解大模型“参数量”的构成,而非只会背数字。考察类型是工程取舍 + 系统设计:从架构层面拆解 Qwe…→No.1262| Q41 | How can techniques like mixture-of-experts (MoE) optimize inference efficiency面试官想考察你对 MoE 架构的工程落地理解,而非仅仅背诵“稀疏激活”概念。刁钻点在于:MoE 看似减少计算量,但实际推…→No.1264MoE大模型具备哪些优势面试官想考察你对 MoE(Mixture of Experts)架构优势的系统性理解,而非简单背诵“稀疏激活”四个字。这…→No.1266在MoE(混合专家模型)架构中,专家网络的数量通常由哪些因素决定?请结合模型性能、计算资源与任务特性进行分析面试官想考察你对MoE架构设计核心权衡的深度理解,而非简单背诵“专家数量越多越好”。这是一道系统设计+工程取舍题,刁钻点…→No.1267请说明MoE模型中GATE(门控机制)的数量是如何确定的,其数量选择对模型推理效率和任务适应性有何影响面试官想考察你对MoE架构的工程落地细节理解,而非表面概念。刁钻点在于:门控数量不等于专家数量,而是由路由策略和专家分组…→No.1268What are mixture of expert models (MoE)面试官想考察你对 MoE 的理解是否停留在“多个专家”的表面概念,还是能深入其稀疏激活的核心机制、门控网络的负载均衡设计…→No.1269**MoE如何解决Fine-Tuning过程中的过拟合问题面试官想看你是否真正理解MoE架构在微调场景下的独特过拟合机制,而非泛泛谈正则化。考察类型是工程取舍+debug:刁钻点…→No.1270MoE 的专家会真正「专业化「吗面试官想看你是否真正理解 MoE 路由机制与负载均衡之间的根本矛盾,而不是只会背“专家网络”的概念。这道题是典型的工程取…→No.1271为什么说 MoE 是「参数变大了,但计算不一定变大「面试官想看你是否真正理解MoE(Mixture of Experts)的核心机制——稀疏激活(Sparse Activa…→No.1272**Q35:MoE Routing Collapse 怎么防面试官想考察你对 MoE 训练稳定性的实战理解,而非单纯背诵概念。核心是区分“理论方法”与“工程落地”的取舍。刁钻点在于…→