BASICS · ALL
LLM 基础概念 · 全部题目
共 196 篇,本页第 145-192 篇。← 回到学习路径视图
No.940How does the encoder-decoder structure work at a high level in the Transformer model面试官想确认你是否真正理解 Transformer 编码器-解码器架构的核心分工逻辑,而非仅仅背诵“编码器处理输入,解码…→No.941How are the outputs of multiple heads combined and projected back in the multi-head attention in the Transformer model面试官想确认你是否真正理解 Transformer 中多头注意力(MHA)的实现细节,而非只背公式。这是典型的背概念 +…→No.942How does masked self-attention differ from regular self-attention, and where is it used in a Transformer面试官想确认你是否真正理解 Transformer 架构中 encoder 和 decoder 的核心设计差异,而不仅仅…→No.943What is the purpose of masked self-attention in the Transformer decoder面试官想确认你是否真正理解 Transformer decoder 中因果掩码(causal mask)的必要性,而非仅…→No.944Explain why self-attention in the decoder is referred to as cross-attention. How does it differ from self-attention in the encoder这道题看似是背概念,实则考察你对 Transformer 架构中注意力机制数据流的底层理解。面试官想确认你是否清楚:“s…→No.945What is the softmax function, and where is it applied in the Transformer model面试官想验证你对 Transformer 基础组件的理解是否停留在“背公式”层面,还是能深入其工程角色。这道题看似简单,…→No.946What is the purpose of residual (skip) connections in Transformer model layers面试官想考察你对 Transformer 架构底层设计原理的理解,而非简单背诵“残差连接解决梯度消失”。刁钻点在于:能否…→No.947Why is layer normalization used, and where is it applied in Transformer面试官想确认你是否真正理解 LayerNorm 在 Transformer 中的设计动机,而非死记硬背“稳定训练”。考察…→No.948What is cross-entropy loss, and how is it applied during transformer training面试官想确认你是否真正理解交叉熵损失在 Transformer 训练中的角色,而非仅背公式。考察类型是“背概念 + 工程…→No.949| Q10 | What is the computational complexity of self-attention in the Transformer model这道题看似是背概念,实则考察三个层次:第一,是否真正理解复杂度推导过程,而非死记 O(n²d);第二,能否区分计算复杂度…→No.950| Q27 | What is the softmax function, and where is it applied in Transformers面试官想确认你对Transformer核心机制的理解深度,而非单纯背公式。考察类型是“工程取舍+系统设计”。刁钻点在于:…→No.951| Q28 | What is the purpose of residual (skip) connections in Transformer layers面试官想确认你是否真正理解残差连接在 Transformer 中的不可替代性,而非仅仅背诵“缓解梯度消失”。考察类型是工…→No.952| Q29 | Why is layer normalization used, and where is it applied in Transformers面试官想确认你是否真正理解 LayerNorm 在 Transformer 中的工程价值,而非仅背诵“稳定训练”的结论。…→No.953| Q30 | What is cross-entropy loss, and how is it applied during Transformer training这道题看似基础,但面试官真正想看的不是你能背出交叉熵公式,而是你能否从工程和训练优化的角度,解释为什么交叉熵是Trans…→No.954| Q33 | How do Transformers address the limitations of CNNs and RNNs面试官想考察你对深度学习架构演进本质的理解,而非简单背诵。这是典型的“架构对比+工程取舍”题,刁钻点在于:候选人常只答“…→No.955| Q34 | How do Transformer models address the vanishing gradient problem面试官想考察你对 Transformer 训练稳定性的底层理解,而非简单背诵“用了残差连接和层归一化”。真正的刁钻点在于…→No.956Transformer模型和BERT模型之间存在着哪些本质的区别?请从结构、功能等方面进行分析面试官想看你是否真正理解Transformer家族的设计哲学,而非死记硬背结构图。考察类型是架构对比+工程取舍。刁钻点在…→No.957Transformer模型在设计时为什么要采用多头注意力(Multi - head Attention)机制?这种机制带来了哪些好处面试官想考察你对 Transformer 核心设计动机的深度理解,而非简单背诵“多头注意力更好”。这是典型的“工程取舍 …→No.958Transformer中的编码器(Encoder)和解码器(Decoder)所使用的多头注意力(MHA)是否完全相同?如果它们不一样,具体的区别体现在哪些方面面试官想考察你对Transformer架构的精确理解,而非泛泛背诵“注意力机制”。核心是区分编码器与解码器中MHA的功能…→No.959Transformer模型除了被广泛应用于机器翻译这类自然语言处理任务之外,在时间序列相关的问题上可以如何进行应用?请举例说明具体的应用方式和场景面试官想看你能否跳出 NLP 舒适区,将 Transformer 的核心机制(自注意力、位置编码)迁移到时间序列领域,并…→No.960Attention有哪几种?位置编码有哪几种面试官想考察你对 Transformer 两大核心组件——Attention 和位置编码——的系统掌握深度,而非简单罗列…→No.961为什么attention的公式中是除以根号d_k,不是d_k或者其他面试官想看你是否真正理解 Transformer 中缩放因子的数学动机,而非死记硬背公式。这属于工程取舍 + 数学原理型…→No.963Bert的结构是什么?一般可以做什么任务这道题看似基础,实则考察对 Transformer Encoder 架构的深度理解,而非单纯背诵。面试官想看:① 能否清…→No.964Bert和GPT有什么区别面试官想考察你对 Transformer 架构的底层理解,而非简单背诵。核心是:你是否清楚 Encoder-only 与…→No.965Bert的layernorm是BN还是LN?是pre-norm还是post-norm面试官想确认你不仅知道BERT用LayerNorm,还理解为什么不用BatchNorm(序列变长问题),以及pre-no…→No.967为什么今天的大多数 LLM 都是 Decoder-only面试官想考察你对 Transformer 架构设计取舍的深度理解,而非简单背诵“Decoder-only 更流行”。这是…→No.968如何降低 Transformer 的计算复杂度?常见的稀疏注意力变体有哪些面试官想看你是否真正理解Transformer的O(n²)计算瓶颈,而非仅背公式。考察类型是工程取舍+系统设计,刁钻点在…→No.969What makes transformers heavy on computation and memory, and how can we address this面试官想看你是否真正理解Transformer的“重”在哪里,而不是背复杂度公式。核心考察三点:一是对自注意力O(n²d…→No.970How do you make sure that attention layer focuses on the right part of the input面试官想考察你对 Transformer 注意力机制的深度理解,而非简单背诵公式。这是典型的工程取舍 + 系统设计类问题…→No.971讲讲对Attention的理解面试官想看的不是“Attention就是加权求和”这种教科书定义,而是你能否从计算本质、工程取舍、系统演进三个维度拆解。…→No.972self-attention 在计算的过程中,如何对padding位做mask面试官想考察你对 Transformer 底层实现的工程级理解,而非仅仅背诵“加一个极大负数”的口诀。这是典型的系统设计…→No.973transformer中multi-head attention中每个head为什么要进行降维面试官想考察你对 Transformer 核心机制的理解深度,而非单纯背诵“多头注意力”的定义。这是典型的工程取舍类问题…→No.974transformer在哪里做了权重共享,为什么可以做权重共享面试官想考察你对Transformer架构的工程细节理解,而非泛泛背诵。核心是:你是否清楚权重共享的具体位置、设计动机,…→No.975transformer的点积模型做缩放的原因是什么面试官想考察你是否真正理解 Transformer 注意力机制中 `1/√d_k` 缩放因子的数学动机,而非死记硬背公式…→No.976BERT的Encoder与Decoder掩码有什么区别面试官想考察你对Transformer架构底层掩码机制的理解深度,而非简单背诵概念。这是典型的“工程取舍+系统设计”类问…→No.977BERT非线性的来源在哪里面试官想考察你对Transformer架构的底层理解,而非简单背诵BERT结构。这是典型的“概念+工程取舍”题,刁钻点在…→No.978在BERT应用中,如何解决长文本问题面试官想考察你是否真正理解Transformer的底层限制(位置编码固定长度、自注意力O(n²)复杂度),而非只会调包。…→No.979Transformer为何使用多头注意力机制?**(为什么不使用一个头)面试官想考察你对Transformer核心设计的工程取舍理解,而非简单背诵“多头能关注不同子空间”。刁钻点在于:为什么不…→No.980Transformer为什么Q和K使用不同的权重矩阵生成,为何不能使用同一个值进行自身的点乘?** (注意和第一个问题的区别)这道题是典型的“工程取舍 + 数学直觉”混合考察。面试官想看你是否真正理解 Self-Attention 中 Q、K、V…→No.981Transformer计算attention的时候为何选择点乘而不是加法?两者计算复杂度和效果上有什么区别面试官想考察你对Transformer核心机制的理解深度,而非简单背诵“用了点乘”。这是典型的工程取舍+理论理解题,刁钻…→No.982在计算attention score的时候如何对padding做mask操作面试官想看你是否真正理解Transformer底层实现,而非只调过库。考察类型是工程实现+原理debug。刁钻点在于:很…→No.984为什么transformer块使用LayerNorm而不是BatchNorm?LayerNorm 在Transformer的位置是哪里面试官想考察你对归一化技术本质的理解,以及 Transformer 架构设计的工程取舍。这不是背概念题,而是工程取舍 +…→No.985简单描述一下Transformer中的前馈神经网络?使用了什么激活函数?相关优缺点这道题看似基础,实则考察对 Transformer 架构“暗面”的深度理解。面试官真正想看的是:你是否只停留在“FFN …→No.986Encoder端和Decoder端是如何进行交互的?**(在这里可以问一下关于seq2seq的attention知识)面试官想考察你对Transformer核心机制——Cross-Attention的深度理解,而非简单背诵“Q、K、V”公…→No.987Transformer的并行化提现在哪个地方?Decoder端可以做并行化吗面试官想考察你对 Transformer 架构并行化本质的深度理解,而非简单背诵。这是典型的“概念+工程取舍”题,刁钻点…→No.988引申一个关于bert问题,bert的mask为何不学习transformer在attention处进行屏蔽score的技巧面试官想考察你能否清晰区分 BERT 的 MLM(掩码语言模型) 与 Transformer 的 attention m…→No.989然后,还有个问题是,虽然PE一直是transformer类模型中的重要的基础组件,很多位置编码也在尝试做一些外推性的工作,但整体来看早期的LLM其实没有特别关注或者说纠结长度外推性,直到后面各种NLG模型的崛起,尤其是ChatGPT的出现,大家才惊觉原来上下文可以做的这么长了面试官想考察你对位置编码(PE)技术演进的深度理解,尤其是从“早期LLM不关注外推”到“长上下文成为标配”这一转折背后的…→No.990Transformer代替seq2seq面试官想看你是否真正理解Transformer对seq2seq的革命性改进,而非停留在“用了注意力机制”的表面。考察类型…→