BASICS · ALL
LLM 基础概念 · 全部题目
共 196 篇,本页第 49-96 篇。← 回到学习路径视图
No.1273八股:Qwen 或 DeepSeek 技术报告中提到的关键创新点有哪些?(如 RoPE 外推、MoE)面试官想看你是否真正啃过 Qwen 和 DeepSeek 的技术报告,而非只背八股。考察类型是工程取舍 + 系统设计,刁…→No.1274项目深挖:你用过 Qwen?说说它的特点和优势(MoE?位置编码?训练数据?)面试官想验证你是否真正动手用过Qwen,而非只背了新闻稿。考察类型是工程取舍+系统设计:MoE架构的稀疏激活与训练稳定性…→No.1275八股:讲一下MoE的路由机制是如何做的面试官想考察你对MoE(Mixture of Experts)路由机制的原理深度和工程实现细节,而非仅背诵“门控网络+T…→No.1276八股:MoE模型专家的负载不均衡问题如何解决面试官想看你是否真正理解MoE(Mixture of Experts)在分布式训练中的核心问题——负载不均衡不仅是计算效…→No.1277开源框架了解过哪些?Qwen,Deepseek的论文是否有研读过,说一下其中的创新点主要体现在哪面试官想看你是否真正深入前沿开源LLM的论文,而非停留在“用过API”或“读过博客”的层面。考察类型是工程取舍+系统设计…→No.1290改写后:LLaMA 3模型的参数规模是多少?包括8B、70B、405B版本这道题看似是“背数字”的基础题,但面试官真正考察的是:你是否理解参数规模背后的工程取舍与业务适配逻辑。它属于“概念+工程…→No.1299为什么 BERT 在第一句前会加一个 [CLS] 标志面试官想考察你对BERT架构设计动机的底层理解,而非简单背诵。这题看似基础,但刁钻点在于:你是否能区分“设计意图”与“工…→No.1305为什么说ELMO是伪双向,BERT是真双向面试官想考察你对语言模型“双向性”本质的理解,而非简单背诵定义。这是典型的“概念辨析+架构对比”题,刁钻点在于:很多人误…→No.1308Vision Transformer (ViT) 和 CNN 在图像特征提取上的优劣对比面试官想看你是否真正理解两种架构的底层设计哲学,而非只背结论。考察类型是工程取舍 + 系统设计。刁钻点在于:多数人只答“…→No.1310了解哪些agent开发框架,例如langchain和LlamaIndex,他们核心应用场景有何不同面试官想考察你对主流 Agent 框架的工程选型能力,而非单纯背概念。核心看三点:① 是否理解 LangChain 和 …→No.1322Cross-Attention(交叉注意力)是什么面试官想确认你是否真正理解注意力机制的本质,而非死记硬背公式。这道题看似基础,但“刁钻点”在于:Cross-Attent…→No.1353为什么用Qwen而不用其他模型面试官想看的不是“Qwen参数多好”,而是你在模型选型时的技术对比与工程权衡能力。这道题属于系统设计+工程取舍类型,刁钻…→No.1358Bert与传统的文本表示模型(如word2vec或GloVe)有什么不同面试官想考察你对 NLP 表示学习演进的理解深度,而非简单背诵概念。这是典型的“背概念+工程取舍”混合题:刁钻点在于,很…→No.1360Bert的mask方法有什么缺陷吗面试官想考察你对预训练范式底层缺陷的洞察力,而非简单背诵BERT结构。这是典型的“背概念+工程取舍”混合题,刁钻点在于:…→No.1361Bert的NSP是怎么预测的面试官想看你是否真正理解BERT预训练中的NSP(Next Sentence Prediction)任务,而非仅背诵“二…→No.1363二分类任务用gpt做的话,应该怎么做?开放问题面试官想看你是否理解“用大模型做分类”不是简单调API,而是涉及策略选型、成本-精度权衡、以及工程落地细节的开放问题。考…→No.1364GPT-2充当reward model时,是怎么得到分数的面试官想考察你对RLHF中reward model实现细节的掌握,而非泛泛而谈“用GPT打分”。刁钻点在于:GPT-2是…→No.1369chatglm2和baichuan有什么区别面试官想看你是否真正理解主流中文LLM的架构差异,而非仅背参数表。考察类型是工程取舍+系统设计,刁钻点在于:ChatGL…→No.1371LangChain 和 LlamaIndex 的区别是什么面试官想考察你对 LLM 应用框架的设计哲学理解,而非简单 API 对比。这是典型的“工程取舍”题,刁钻点在于:很多人只…→No.1374MetaGPT的消息池机制如何工作面试官想考察你对多智能体系统通信架构的深层理解,而非简单背诵MetaGPT源码。这是一道系统设计+工程取舍题:消息池本质…→No.1375AutoGPT如何管理长期记忆面试官想看你是否真正理解“长期记忆”在自主Agent中的工程化落地,而非仅仅背概念。考察类型是系统设计+工程取舍。刁钻点…→No.1378If I have a vocabulary of 100K words/tokens, how can I optimize transformer architecture面试官想考察你对Transformer架构在工业级大词汇表(100K tokens)下的工程优化能力,而非单纯背诵论文。…→No.1381什么情况用Bert模型,什么情况用LLaMA、ChatGLM类大模型,咋选面试官想看你是否真正理解模型架构与任务本质的匹配关系,而非死记硬背“BERT做理解,LLM做生成”。刁钻点在于:当任务边…→No.1389BERT用字粒度和词粒度的优缺点有哪些面试官想看你是否真正理解 tokenization 对模型性能的底层影响,而非只背 BERT 用 WordPiece。考…→No.1391为什么BERT选择mask掉15%这个比例的词,可以是其他的比例吗面试官想考察你对预训练模型设计细节的深度理解,而非简单背诵15%这个数字。这是典型的“工程取舍+实验依据”类问题,刁钻点…→No.1408为什么用fastText而不是GPT-4面试官想考察你的模型选型能力,而非单纯背诵模型参数。这道题是典型的“工程取舍”类问题,刁钻点在于:候选人容易陷入“大模型…→No.1410Qwen3 的 Hybrid Thinking 模式为什么重要面试官想看你是否理解推理模式设计在 LLM 产品化中的核心 trade-off:不是所有问题都需要深度思考,也不是所有问…→No.1414**Q7:合成数据(GPT-4 蒸馏)的深层隐患面试官想看的不是你会不会“用GPT-4生成数据训练小模型”,而是你是否理解合成数据在工业级部署中的致命缺陷。考察类型是工…→No.1416**Q32:vLLM PagedAttention 原理这道题考察的是LLM推理加速的核心工程实现,属于系统设计+工程取舍类型。面试官真正想看的是:你是否理解KV Cache在…→No.1418**Q:Qwen3 四阶段为什么不能少 fusion面试官想看的不是你是否背过Qwen3的论文,而是你是否理解多阶段训练中“能力冲突”与“知识遗忘”的工程本质。考察类型是系…→No.1423LangChain vs LlamaIndex vs AutoGen,如何选择面试官想考察的不是“你会用哪个框架”,而是你能否根据业务场景做技术选型,并理解每个框架的底层设计哲学和工程取舍。这是典型…→No.1430架构对比:当前主流LLM(如 Llama、Qwen、ChatGLM)在架构设计上有何异同这道题是典型的“架构对比+工程取舍”型问题,面试官想看你是否真正理解主流LLM的设计哲学,而非死记硬背参数。刁钻点在于:…→No.1434八股:vLLM中使用的技术是否熟悉(如Paged Attention、KV Cache)面试官想确认你不仅背过“Paged Attention”这个名词,而是真正理解它解决了什么工程问题、如何与KV Cach…→No.1447Qwen2有哪些提升面试官想考察你对最新开源大模型技术演进的理解,特别是从Qwen1到Qwen2的架构、数据、训练和工程落地的系统性改进。这…→No.1450Mem0 和 MemGPT 有什么区别面试官想考察你对 AI Agent 记忆增强方案的架构理解深度,而非简单背诵概念。这是典型的“系统设计对比”题,刁钻点在…→No.1457How can techniques like mixture-of-experts (MoE) optimize inference efficiency面试官想考察你对 MoE 架构的工程落地理解,而非仅仅背诵“稀疏激活”概念。刁钻点在于:MoE 在训练时通过增加参数量提…→No.1472响应速度与推理精度的 tradeoff面试官想考察你是否真正理解 LLM 推理的工程本质——不是背论文,而是能在延迟和准确率之间做量化决策。这是典型的系统设计…→No.1473Bert的MLM可以手写一下吗面试官想看的不是“背出MLM定义”,而是手写核心逻辑的工程能力。考察类型是系统设计+代码实现,刁钻点在于:① 是否清楚m…→No.1474MemGPT的核心设计思想和架构是什么面试官想看你是否理解MemGPT如何突破LLM的上下文窗口限制,以及它和传统RAG的本质区别。这属于系统设计+工程取舍型…→No.1475How to accelerate response time of model without attention approximation like group query attention这道题考察的是系统设计 + 工程取舍,而非单纯背论文。面试官想看你是否理解:当“注意力近似”(如 GQA、MQA、Fla…→No.1477核心实验:给定固定参数预算,MoE和Engram如何分配这道题是典型的系统设计 + 工程取舍型问题,面试官想看你是否真正理解MoE和Engram(记忆增强架构)在参数效率上的本…→No.1478Ring Attention 和普通张量并行有什么区别面试官想考察你对分布式训练中两种核心并行策略的底层理解,而非简单背诵定义。刁钻点在于:Ring Attention 本质…→No.1480延伸:Flash Attention 如何优化面试官想考察你对 Transformer 推理/训练瓶颈的底层理解,而非仅仅背诵 Flash Attention 的论文…→No.1481八股:开源框架了解过哪些?Qwen,Deepseek的论文是否有研读过,说一下其中的创新点主要体现在哪面试官想确认你是否只是“调包侠”,还是真正深入过前沿开源LLM的论文细节。考察类型是工程取舍+论文研读,刁钻点在于:很多…→No.1483你认为 Transformer 架构会长久地统治这个领域吗?还是你看到了像状态空间模型(SSM, 如 Mamba)等新架构的潜力面试官想看你是否具备架构级视野,而非仅会用Transformer调参。考察类型是系统设计+前沿预判:能否客观分析Tran…→No.1485Linear Attention(线性注意力)是什么面试官想考察你对 Transformer 核心瓶颈(自注意力 O(n²) 复杂度)的深层理解,以及你是否能跳出“注意力就…→No.1486不同Attention之间的区别是什么这道题考察的是对 Transformer 核心机制的系统性对比能力,属于工程取舍 + 系统设计类型。面试官真正想看的是:…→No.1488Can you explain the GPTQ algorithm and its relevance to LLM quantization面试官想考察你对后训练量化(PTQ) 的深度理解,特别是针对大语言模型(LLM)的算法创新。这不是背概念题,而是工程取舍…→