BASICS · ALL

LLM 基础概念 · 全部题目

共 196 篇,本页第 97-144 篇。← 回到学习路径视图

No.1490模型压缩 + 量化后理解能力下降的精度补偿面试官想考察你对模型压缩(量化、剪枝、蒸馏)的工程落地经验,而非仅仅背诵概念。刁钻点在于:量化后“理解能力下降”不是简单…→No.1491Agent 的「对齐「(Alignment)具体指什么?和 LLM 对齐有什么区别面试官想确认你是否真正理解 Agent 对齐的深层含义,而不仅仅是背诵"让模型安全"的定义。这题表面是概念题,实则考察你…→No.1492Agent 可能面临哪些安全风险?请进行威胁建模。面试官想考察你是否具备系统性的安全威胁建模能力,而非零散列举几个风险。这道题的刁钻点在于:很多人只答"提示注入"或"数据…→No.1493如何防止 Agent 的「提示注入「攻击?请设计完整的防御方案。面试官想看你能否设计一个系统性的防御方案,而非零散列举几个 trick。这题的难点在于:提示注入类似于 Web 安全中的…→No.1494Agent 的沙箱(Sandbox)机制应该如何设计面试官想考察你的系统设计能力——能否从隔离层级、资源限制、审计追踪三个维度设计一个完整的 Agent 沙箱方案。刁钻点在…→No.1495什么是「人类在环「(Human-in-the-Loop)安全机制?如何设计分级审批策略面试官想看你能否设计一个既安全又不影响用户体验的 Human-in-the-Loop(HITL)机制。刁钻点在于:HIT…→No.1496Agent 的对齐如何评估?有哪些特殊挑战面试官想看你能否设计一个系统性的 Agent 对齐评估方案,而非简单说"跑个 benchmark"。刁钻点在于:Agen…→No.1497多 Agent 系统中的安全有什么额外挑战面试官想看你能否从"系统设计"视角分析多 Agent 安全问题,而非单点漏洞。刁钻点在于:多 Agent 系统的安全挑战…→No.1498扩散模型 vs GAN vs Flow Matching:生成范式怎么选GAN 一步采样快、扩散稳且多样、Flow Matching 少步高质量。这篇给三大生成范式的原理差异对比表与场景选型。…→No.20第 2 章 · LLM 基础面试导学本章是LLM面试的地基,涵盖Transformer架构、Attention机制、MoE与推理优化。本文梳理了考点地图与站…→No.21预训练 vs SFT vs RLHF:三阶段各在干什么预训练进知识、SFT 教格式、RL 调质量。这篇给三阶段的边界对比表与「跳级和错位」两类常见误区。…→No.901Bert的embedding部分和原transformer的有什么不同面试官想看你是否真正理解Transformer架构的“可插拔”设计,而非死记硬背。这道题表面是背概念(Embedding…→No.902GPT和Bert的mask有什么区别面试官想考察你对 Transformer 架构底层机制的理解深度,而非简单背诵。核心是区分两种 mask 的设计哲学:B…→No.903Transformer的FFN作用是什么?其中先升维再降维是为什么面试官想考察你对 Transformer 架构中 FFN(前馈神经网络)的设计动机和工程取舍的理解深度,而非仅仅背诵公式…→No.904transformer比rnn/lstm这些有什么好处?除了并行计算还有呢面试官想考察你对Transformer架构的深度理解,而非仅停留在“并行计算”这个表面优势。刁钻点在于:很多人只背了并行…→No.905KV怎么来的,除了selfattention还有什么attention面试官想确认你是否真正理解 Attention 机制的设计动机,而非死记硬背公式。考察类型:概念理解 + 工程取舍。刁钻…→No.906self attention的公式这道题看似是“背公式”的基础题,但面试官真正想考察的是:你能否从公式推导出工程设计的核心取舍。刁钻点在于:候选人常只写出…→No.907transformer 中self attention的根号dk面试官想看的不是“你背过公式”,而是你是否理解Transformer中每个设计背后的数学动机与工程权衡。这道题属于概念+…→No.908Transformer 为什么会成为大模型基础架构面试官想看的不是“Transformer 比 RNN 好”这种泛泛之谈,而是你能否从计算并行性、建模能力、工程可扩展性三…→No.909Transformer 相比传统序列模型的核心优势是什么面试官想看你是否真正理解Transformer的设计哲学,而非仅背诵“并行、长程依赖”等表面词。这是典型的系统设计对比题…→No.910Self-Attention 是什么面试官想考察的不仅是“背公式”,而是你对 Self-Attention 本质的理解深度和工程直觉。这是一道 基础概念 +…→No.911Transformer中 Attention 的本质是什么?你能从数学角度简要解释一下吗这道题看似基础,但面试官真正想看的不是你会背公式,而是你是否理解 Attention 为什么是 Transformer …→No.912Can you provide a detailed explanation of the concept of self-attention面试官想看你是否真正吃透了Transformer的引擎,而非只会背“QKV”三个字母。这是典型的概念+工程取舍题,刁钻点…→No.913What are some of the advantages of using a transformer instead of LSTM面试官想考察你对序列建模核心差异的底层理解,而非简单背诵“Transformer并行、LSTM顺序”。刁钻点在于:你是否…→No.914Attention的计算步骤是什么面试官考察的是对Transformer核心组件Scaled Dot-Product Attention的数学步骤和工程细…→No.915self-attention 和 target-attention的区别面试官想考察你对 Transformer 架构中两种核心注意力机制的根本性理解,而非简单背诵。这是典型的“背概念”题,但…→No.916目前主流的attention方法有哪些面试官想看你是否真正理解注意力机制从“对齐函数”到“高效并行”的演进脉络,而非死记硬背公式。考察类型是概念分类+工程取舍…→No.917BERT用的是transformer里面的encoder还是decoder面试官想确认你是否真正理解Transformer架构的“对称性”与“不对称性”——即为什么BERT选择Encoder而非…→No.918Transformer中⼀直强调的self-attention是什么面试官想确认你不仅背过公式,还能讲清 self-attention 为什么是 Transformer 的“灵魂”,以及它…→No.919Multi-Head Attention 的作用是什么面试官想考察你对 Transformer 核心机制的理解深度,而非简单背诵“多头就是多个注意力头”。真正意图是:你是否清…→No.920Self-Attention vs Cross-Attention 的区别面试官想考察你对 Transformer 核心机制的理解深度,而不仅仅是背定义。这题看似基础,但刁钻点在于:能否从计算图…→No.921Transformer为什么用 LayerNorm 而不是 BatchNorm面试官想考察你对归一化技术底层原理的掌握,以及能否从 Transformer 架构特性(变长序列、自回归生成)出发,做出…→No.922为什么要用multi-head attention面试官想考察你对Transformer核心设计动机的深度理解,而非简单背诵“多头注意力并行计算”。真正刁钻点在于:为什么…→No.923八股:Encoder与decoder的中Attention区别面试官想考察你对Transformer核心机制的理解深度,而非简单背诵。这是典型的“背概念”题,但刁钻点在于:你是否能清…→No.924八股:Attention如何计算?为什么除以根号下Dk?mask attention是如何实现的面试官想确认你是否真正理解 Transformer 核心机制,而非只会背公式。考察类型是“背概念 + 工程取舍”。刁钻点…→No.925八股:Transformer encoder?为什么需要FFN面试官真正想看的不是你能不能背出“Attention + FFN + 残差连接”的流程图,而是你是否理解Transfor…→No.927Transformer前馈神经网络用的是什么激活函数这道题看似是背概念,实则考察你对Transformer底层组件的工程理解深度。面试官真正想看的是:你是否只停留在“知道用…→No.928Transformer为什么使用多头注意力机制面试官想考察你是否真正理解Transformer架构的设计动机,而非仅背诵“多头注意力更好”的结论。这是典型的工程取舍类…→No.929Transformer为何让Q(查询)和K(键)使用独立的权重矩阵进行计算,为什么需要Q、K、V(查询、键、值)三个矩阵这道题考察对 Transformer 注意力机制设计哲学的深度理解,而非简单背公式。面试官想看你能否从“为什么这样设计”…→No.930为什么在attention中要进行scaled(为什么除以√d_k)面试官想考察你是否真正理解 Transformer 中 `scaled dot-product attention` 的…→No.931为什么Transformer用LayerNorm而不用BatchNorm面试官想考察你对归一化原理的底层理解,而非死记硬背。这是典型的“背概念+工程取舍”混合题:表面问 LayerNorm v…→No.933请详细解释一下 Transformer 模型中的自注意力机制是如何工作的?它为什么比 RNN 更适合处理长序列面试官想验证你对 Transformer 核心机制的理解深度,而非停留在“QKV 点积”的背诵层面。考察类型是概念 + …→No.934什么是位置编码?在 Transformer 中,为什么它是必需的?请列举至少两种实现方式面试官想确认你是否真正理解 Transformer 架构的底层设计动机,而非死记硬背。核心考察点:自注意力机制是置换不变…→No.935What is the computational complexity of self-attention in the Transformer model面试官想考察你对Transformer核心机制的量化解构能力,而非简单背诵“O(n²)”。刁钻点在于:能否区分时间复杂度…→No.936How do Transformer model address the vanishing gradient problem面试官想考察你对 Transformer 训练稳定性的底层理解,而非简单背诵“用了残差和 LayerNorm”。刁钻点在…→No.937What is the role of self-attention in the Transformer model, and why is it called “self-attention”面试官想确认你是否真正理解Transformer的核心机制,而非仅仅背诵“QKV”三个字母。这道题看似基础,但刁钻点在于…→No.938What is the purpose of the encoder in a transformer model面试官想确认你是否真正理解 Transformer 编码器的核心设计哲学,而非仅背诵“多头注意力+FFN”的结构。这是典…→No.939What is the purpose of the decoder in a transformer model面试官想考察你对 Transformer 解码器结构与生成机制的底层理解,而非简单背诵。这是典型的“背概念+工程取舍”混…→