ENTERPRISE · ALL
项目实战与企业级 · 全部题目
共 787 篇,本页第 97-144 篇。← 回到学习路径视图
No.1106prefix LM 和 causal LM 区别是什么面试官想考察你对 Transformer 注意力机制变体的工程级理解,而非单纯背定义。核心是区分“双向上下文”与“单向自…→No.1107为什么会出现 LLMs 复读机问题面试官想看你能否跳出“解码温度太低”这种表面解释,从数据、架构、解码、训练四个层面系统性拆解复读机问题。这题属于系统诊断…→No.1108如何缓解 LLMs 复读机问题面试官想考察你是否能跳出“调参数”的浅层认知,系统性地从解码策略、训练优化、模型架构三个层面解决LLM的重复生成问题。这…→No.1109LLMs输入句子长度理论上可以无限长吗面试官想考察你对Transformer架构底层限制的理解深度,区分“理论可能性”与“工程现实”。这题不是简单背概念,而是…→No.1110Prompt 写得好是不是就能解决大部分问题面试官想测试你对 Prompt Engineering 边界的认知深度,而非单纯背诵技巧。这是典型的“工程取舍”考察:你…→No.1111各个专业领域是否需要各自的大模型来服务这道题考察的是系统设计决策能力,而非单纯背概念。面试官想看你能否辩证分析“领域专用模型 vs. 通用模型”的取舍,而不是…→No.1112如何让大模型处理更长的文本面试官想考察你对长文本处理“全栈”理解,而非只背一个方法。这题是系统设计+工程取舍型,刁钻点在于:候选人常只提“改模型架…→No.1113那是否基于句法分析树的LSTM(tree-lstm)就一定比单纯的双向LSTM(bi-lstm)效果好吗面试官想看你是否理解“模型选择”的本质,而非死记硬背结论。这道题是典型的工程取舍考察,刁钻点在于:Tree-LSTM 看…→No.1114那么,为什么Decoder-only架构会成为LLM的主流选择呢面试官想看你是否真正理解LLM架构演进的底层逻辑,而非死记硬背“Decoder-only好”。考察类型是工程取舍+系统设…→No.1115Word2Vec中为什么使用负采样(negtive sample)面试官想考察你是否真正理解Word2Vec训练中的工程取舍,而非仅仅背诵“负采样解决softmax计算量大”这一结论。这…→No.1116为什么要做多头注意力机制呢**面试官想考察你对Transformer核心机制的设计动机理解,而非简单背诵公式。这是“工程取舍”型问题,刁钻点在于:单头…→No.1117为什么在进行多头注意力的时候需要对每个head进行降维?**(可以参考上面一个问题)面试官想考察你对Transformer核心机制的设计动机理解,而非简单背诵公式。这题属于“工程取舍+系统设计”类型,刁钻…→No.1118Decoder阶段的多头自注意力和encoder的多头自注意力有什么区别?**(为什么需要decoder自注意力需要进行 sequence mask)面试官想考察你对 Transformer 核心机制的理解深度,尤其是自回归生成与双向编码的设计动机差异。这题表面是背概念…→No.1119为什么需要专家容量呢?因为所有张量的形状在编译时是静态确定的,无法提前知道多少 token 会分配给每个专家,因此需要一个固定的容量因子面试官想考察你对 MoE 架构底层工程实现的理解,而非仅仅背诵概念。核心是:为什么静态张量形状决定了必须引入专家容量?这…→No.1120为什么目前市面上的LLM鲜有使用呢(据目前所知,好像只有BLOOM/MPT/采用了ALiBi)?可能的原因这道题考察的是工程取舍与趋势判断,而非单纯背概念。面试官想看你是否理解:为什么一个理论上“外推性好、实现简单”的方案(A…→No.1121为什么“知道概念”不等于“理解系统”面试官想考察的不是你背了多少论文,而是你是否具备系统思维——能否把孤立的知识点(如 Attention、RAG、微调)串…→No.1122介绍一下 使用 GLU 线性门控单元的 FFN 块 计算公式这道题考察的是对 Transformer 架构中 FFN(前馈网络)的深度理解,特别是 GLU(门控线性单元)如何改进标…→No.1123介绍一下 使用 GeLU 的 GLU 块 计算公式面试官想考察你对现代 Transformer FFN 变体的底层数学理解,而非简单背诵“SwiGLU 比 ReLU 好”…→No.1124介绍一下 使用 Swish 的 GLU 块 计算公式面试官想考察你对现代 Transformer 架构中激活函数与门控机制结合的深层理解,而非单纯背公式。这是一道“概念 +…→No.1125计算的时候如果不使⽤三元组(Q, K, V), ⽽ 仅仅使⽤(Q, V)或者(K, V)或者(V)⾏不⾏这道题考察对Transformer注意力机制中Q、K、V角色本质的深度理解,属于工程取舍+概念辨析类型。面试官真正想看的…→No.1126Scaled Dot Product:为什么是缩放点积,而不是点积模型面试官想考察你对 Transformer 核心机制——缩放点积注意力(Scaled Dot-Product Attent…→No.1127MLM 任务中,随机选择 15% 的标记,其中 80% 替换为 [MASK],10% 保持不变,10% 随机替换为其他单词,原因是什么这道题考察的是对 BERT 预训练核心机制——Masked Language Model (MLM) 设计动机的深度理解…→No.112811其mask相对于CBOW有什么异同点面试官想考察你能否穿透“都是预测词”的表象,精准区分浅层静态词向量(CBOW)与深层动态预训练(MLM)在架构、训练目标…→No.1129首先,在介绍RoPE时,先抛出一个问题:RoPE解决了一个什么问题面试官想看你是否真正理解位置编码的演进逻辑,而非死记公式。考察类型是“工程取舍+系统设计”,刁钻点在于:RoPE看似数学…→No.1130RM(奖励模型)的数据格式面试官想考察你对奖励模型(Reward Model)训练数据的具体理解,而非泛泛而谈RLHF流程。核心是区分pairwi…→No.1131微调需要多少条数据面试官想考察你对微调数据量需求的工程直觉,而非背一个固定数字。核心是看你能否拆解“数据量”与“任务复杂度、模型规模、数据…→No.1132处理查询文档里的异构数据,如图片时,具体的处理流程是什么?解析成纯文字后如何进一步加工?这样只返回文字给用户,图片信息不会丢失吗面试官想考察你设计多模态RAG系统的工程能力,而非单纯背诵概念。刁钻点在于:你能否识别“纯文本化”的致命缺陷——视觉信息…→No.1133那么该方法为什么被称为朴素流水线并行呢,它又有什么缺陷呢面试官想检验你对分布式训练中流水线并行基础原理的掌握深度,而非仅仅背诵概念。考察类型为工程取舍+系统设计。刁钻点在于:你…→No.1134那虚拟流水线(virtual pipeline)是怎么做到的呢面试官想确认你是否真正理解流水线并行(Pipeline Parallelism)的核心瓶颈——气泡(bubble),以及…→No.1135换句话说,ZeRO-DP相较于标准DP来说,通信量增大了吗面试官想看你是否真正理解分布式训练中“显存换通信”的工程取舍,而非死记硬背ZeRO论文。刁钻点在于:很多人以为ZeRO一…→No.1136什么是 张量并行 (intra-layer)面试官想考察你对大规模模型分布式训练中“模型并行”的深入理解,特别是张量并行(Tensor Parallelism, T…→No.1137数据并行 vs 张量并行 vs 流水线并行面试官想考察你对大规模分布式训练中三种核心并行策略的工程取舍能力,而非单纯背概念。刁钻点在于:能否清晰解释每种策略的通信…→No.1138如果显卡的显存不够装下一个完整的模型呢面试官想考察你对显存瓶颈的系统性拆解能力,而非背诵单一方案。这是典型的工程取舍 + 系统设计题,刁钻点在于:候选人常只答…→No.1139PP推理时,是一个串行的过程,1个GPU计算,其他空闲,有没有其他方式面试官想考察你对大模型推理中流水线并行(PP)气泡问题的深度理解,以及能否跳出“串行是必然”的思维定式。这属于工程取舍 …→No.11403种并行方式可以叠加吗面试官想考察你对大规模分布式训练中并行策略的底层理解,而非简单背诵概念。核心是判断你是否能说清数据并行(DP)、张量并行…→No.1141有了ZeRO系列,为什么还需要3D并行面试官想考察你是否真正理解大模型训练中“显存优化”与“计算/通信优化”的本质区别。ZeRO系列(如ZeRO-1/2/3)…→No.1142平民适不适合玩3D并行面试官想看你是否真正理解分布式训练的工程成本,而非只会背“3D并行=DP+TP+PP”的概念。这道题的刁钻点在于“平民”…→No.1143你们是通过人工打标建立图片和文本的对应关系吗?文档量很大的情况下,打标工作能完成吗面试官想考察你面对大规模多模态数据标注时,是否具备工程化降本的思维,而非停留在“堆人力”的原始方案。核心是看你能不能跳出…→No.1144平民适不适合直接上多机多卡的ZeRO3(万兆网)面试官想看你是否真正理解ZeRO系列的内存-通信权衡,而非死记硬背“ZeRO3最省显存”。刁钻点在于:万兆网(~1.25…→No.1145分布式并行及显存优化技术并行技术有哪一些,都有什么特点面试官想考察你对分布式训练全景的系统设计能力,而非单纯背诵技术名词。刁钻点在于:能否根据模型规模(7B/13B/175B…→No.1146如果想要在某个模型基础上做全参数微调,究竟需要多少显存面试官想考察你是否真正理解大模型微调的内存开销构成,而非死记硬背数字。这是典型的“工程估算+系统设计”题,刁钻点在于:很…→No.1148领域模型微调 领域评测集 构建面试官想考察你从零构建领域评测集的系统能力,而非简单背诵指标。这属于系统设计+工程取舍类型,刁钻点在于:多数人只知用公开…→No.1149领域模型词表扩增是不是有必要的面试官想看你是否真正理解 tokenizer 在领域适配中的工程取舍,而非简单背概念。考察类型是工程取舍 + 系统设计。…→No.1150多轮对话任务如何微调模型面试官真正想考察的是你对因果语言模型(Causal LM)在多轮对话场景下数据构造和损失掩码的工程理解,而非简单背诵SF…→No.1151微调后的模型出现能力劣化,灾难性遗忘是怎么回事面试官想考察你对大模型微调核心问题的理解深度,而非简单背诵“灾难性遗忘”定义。这是典型的工程取舍+debug型问题,刁钻…→No.1152为什么大模型推理时显存涨的那么多还一直占着面试官想考察你对LLM推理显存管理的底层理解,而非简单背概念。这是“工程取舍+系统设计”型问题,刁钻点在于:候选人常混淆…→No.1153大模型在GPU和CPU上推理速度如何面试官想考察你对大模型推理部署的硬件选型与性能瓶颈理解,而非简单背诵速度数字。这是工程取舍+系统设计型问题,刁钻点在于:…→No.1154用于评测的另一个大模型,如何构造问题、分析文字并进行对比?这个大模型的正确率以及模型自我一致性怎么确定面试官想考察你对LLM评测的工程化理解,而非背诵MMLU分数。核心看三点:① 能否设计出避免“评测污染”的问题构造流程(…→