FINETUNE · ALL

训练与微调 · 全部题目

共 310 篇,本页第 241-288 篇。← 回到学习路径视图

No.925PEFT 有什么优点面试官想考察的不仅是“PEFT 省显存”这种表面理解,而是你能否从工程落地角度,系统性地拆解 PEFT 在显存、速度、遗…→No.926**Q:SFT 训练多少个 epoch 合适面试官想看你是否真正动手调过 SFT,而不是只背了“1-3 epoch”的结论。核心考察三点:过拟合与泛化的工程权衡、数…→No.927**Q:LoRA 的 r 怎么选面试官想考察你对 LoRA 超参数调优的工程直觉,而非死记硬背“r=8 或 16”。刁钻点在于:r 的选择本质是模型容量…→No.928大模型训练中常用的优化器有哪些?AdamW 和 Adam 的区别是什么面试官想验证你对优化器原理的“真懂”而非“背概念”。表面是列举优化器,核心是考察:你是否理解 AdamW 为何成为大模型…→No.929你对SFT的理解是什么?与预训练相比有什么差异面试官想验证你是否真正理解SFT在LLM训练管线中的定位,而非仅背诵“微调”定义。考察类型是概念对比+工程取舍。刁钻点在…→No.931bf16 和 float16 的区别?各占多少位?训练中如何选择面试官想确认你是否真正理解混合精度训练中的数值格式取舍,而非死记硬背位宽。核心考察点:数值精度 vs 动态范围的工程权衡…→No.932八股:LoRA 微调原理?训练时调过哪些超参数?有什么经验面试官想考察你是否真正理解LoRA的数学本质与工程取舍,而非背诵“低秩分解”定义。这是典型的“背概念+工程取舍”混合题:…→No.933八股:SFT 的 loss 如何只计算回答部分?(如何 ignore padding token?)面试官想验证你是否真正动手训练过 SFT,而非只背过“用-100 mask”这个结论。考察类型是工程实现细节,刁钻点在于…→No.934八股:bf16 和 float16 的区别?各占多少位?训练中如何选择面试官想确认你是否真正理解低精度训练的数值表示原理,而不仅仅是背规格表。这是典型的“背概念 + 工程取舍”混合题,刁钻点…→No.936八股:你对SFT的理解是什么?与预训练相比有什么差异面试官想看你是否真正理解SFT的本质,而非仅背概念。考察类型是“概念对比+工程取舍”,刁钻点在于:很多人只会说“SFT让…→No.937八股:LayerNorm和BatchNorm在训练时梯度计算有何本质区别面试官想看你是否真正理解归一化层的底层数学机制,而非仅背结论。考察类型是工程取舍 + 概念辨析。刁钻点在于:多数人只记得…→No.938为什么需要增量预训练面试官想考察你是否真正理解“增量预训练”在 LLM 生命周期中的定位,而非仅仅背诵概念。这是典型的概念辨析 + 工程取舍…→No.939什么是warmup ratio?训练过程中怎么设置这道题看似基础,实则考察对深度学习训练稳定性的底层理解。面试官想确认你是否只是背过“warmup ratio=0.03”…→No.940为什么需要混合精度训练面试官想看你是否真正理解大模型训练中的“内存-速度-精度”三角博弈。这题看似基础,但刁钻点在于:很多人只会背“FP16快…→No.941| Q101 | What is LoRA, and how does it work面试官想确认你是否真正理解参数高效微调(PEFT)的工程本质,而非仅背概念。这道题看似基础,但“刁钻点”在于:能否说清L…→No.942What is RLHF, and why is it used for fine-tuning Large Language Models面试官想确认你是否真正理解RLHF的动机和工程本质,而非仅仅背诵“人类反馈+强化学习”的套话。考察类型是概念+工程取舍,…→No.943Can you describe the typical three stages of the RLHF process面试官想确认你是否真正理解RLHF的工程本质,而非仅背诵“SFT→RM→PPO”的流程。考察类型是系统设计+工程取舍,刁…→No.944(DPO)这一方法具有哪些显著的优势?它与近端策略优化(PPO)之间存在着怎样的区别和联系面试官想考察你对RLHF核心算法的理解深度,而非简单背诵。表面是问DPO优势与PPO区别,实则检验你是否真正掌握两者数学…→No.945在监督微调(SFT)过程中,为了保证数据质量,有哪些有效的措施和方法?又可以通过哪些途径来进一步提升数据质量面试官想看你是否真正处理过SFT数据管线,而非只会背“数据清洗、人工标注”的泛泛之谈。核心考察点:数据质量控制的工程落地…→No.946一般来说是batch来固定训练的数据,那以token来计算的,训练用token替代batch计算的时候怎么写面试官想看你是否真正理解大模型训练中“计算效率”和“内存利用率”的底层博弈。这不是背概念题,而是工程取舍 + 系统设计题…→No.948训练时还有其它模型内存优化方法吗面试官想考察你对大模型训练内存优化的广度(是否知道多种方法)和深度(是否理解每种方法的工程取舍)。这是典型的“工程取舍 …→No.949SFT的时候,有哪几种参数微调方法面试官想考察你对SFT(监督微调)参数更新策略的体系化认知,而非简单罗列方法名。核心是区分“全参数微调”与“参数高效微调…→No.951LoRA呢?了解这个吗面试官想考察你对参数高效微调(PEFT)的深度理解,特别是QLoRA如何通过量化与LoRA的协同设计突破显存瓶颈。这不是…→No.952Reward model 如何训练?Reward model 你觉得训练到什么程度可以面试官想看你是否真正理解RLHF中Reward Model(RM)的工程本质,而非只会背“Bradley-Terry损失…→No.953Reward model和训练的LLM模型用同一个基座模型可能有什么作用面试官想考察你对 RLHF 整条链路中架构设计的理解深度,而非简单背诵“奖励模型是打分器”。核心看三点:一是你是否意识到…→No.954DPO的原理面试官想考察的不仅是“背出DPO公式”,而是你是否真正理解DPO如何将RLHF的强化学习问题转化为一个简单的分类损失,以…→No.955DPO的优化公式面试官真正想看你是否精确理解 DPO 的数学推导与工程实现,而非仅背公式。考察类型是推导+工程取舍:刁钻点在于,DPO …→No.956模型预训练超过了最大长度怎么做面试官想考察你对 Transformer 架构“最大长度”这个硬约束的底层理解,以及在实际训练中如何绕过或打破它。这不是…→No.957截断拼接?模型输入很长怎么办?推理的时候和训练的时候面试官想考察你对 LLM 长输入处理的工程落地能力,而非单纯背诵概念。核心是区分训练和推理两个阶段的根本差异:训练时关注…→No.958Lora怎么做的?为什么只调q,v矩阵或者q矩阵?别人实验这样做不代表在你这个场景下这样做就是对的面试官想看的不是 LoRA 的“背公式”能力,而是对参数高效微调(PEFT)底层原理的工程判断力。这道题有三个刁钻点:第…→No.959chatGLM的训练 loss 知道怎么计算吗面试官想考察你对ChatGLM这类Prefix-LM架构训练细节的掌握程度,而非泛泛的“交叉熵损失”。刁钻点在于:Cha…→No.961External Parametric Memory包含哪些技术?Adapter、LoRA等方法如何实现外部参数记忆面试官想考察你对“参数高效微调”(PEFT)的底层理解,而非单纯背概念。刁钻点在于:“外部参数记忆”不是 LoRA 或 …→No.962参数内化(Parametric Internalization)的训练策略和效果如何面试官想考察你对“将外部知识通过训练写入模型参数”这一核心范式的理解深度,而非简单背诵概念。这是典型的工程取舍 + 系统…→No.963为什么预训练是 LLM 能力形成的基础面试官想看你是否真正理解预训练在 LLM 生命周期中的核心地位,而非只会背“预训练学知识”这种空话。考察类型是工程取舍 …→No.964预训练目标为什么通常是 next token prediction面试官想考察你对自回归语言模型训练目标的设计动机和工程取舍的理解深度,而非简单背诵“GPT 用 next token p…→No.965为什么指令跟随能力需要单独训练面试官想考察你是否真正理解预训练与指令微调的本质差异,而非停留在“预训练学语言,指令微调学任务”的浅层认知。刁钻点在于:…→No.966什么是 In-Context Learning面试官想考察你是否真正理解 In-Context Learning(ICL)的本质,而不仅仅是背诵定义。这是典型的“概念…→No.967为什么指令微调能让模型更像“助手”面试官想看的不是“指令微调就是SFT”这种表面答案,而是你能否从数据分布、损失函数、行为模式三个层面解释“助手风格”的涌…→No.968In-Context Learning 和微调分别适合解决什么问题面试官想考察你对 LLM 两种核心适配方式——In-Context Learning(ICL)和微调(Fine-tuni…→No.969微调时的训练数据是怎么构建的?如何保证样本多样性和质量面试官想看的不是“数据从哪来”这种表面答案,而是你能否在工程约束下,系统性地构建一个高质量、高多样性的微调数据集。考察类…→No.970RLHF 是哪一种面试官想看你是否真正理解RLHF的算法分类,而非仅背诵流程。考察类型是工程取舍+系统设计,刁钻点在于:RLHF通常被默认…→No.971简要介绍一下 SFT 的核心流程,以及数据集的构建策略, SFT 之后常见的 Post - Training 还有哪些?它们之间的目的有何区别面试官想看你是否真正理解LLM训练全流程的“为什么”,而非只背SFT步骤。考察类型是系统设计+工程取舍:SFT是监督学习…→No.972训练 LoRA 模型时,你是如何选择冻结层的?依据是什么面试官想看你是否真正理解LoRA的参数效率本质,而非死记硬背“只调Q、V矩阵”的教条。考察类型是工程取舍+系统设计。刁钻…→No.973大模型是怎么训练出来的面试官想看你是否真正理解大模型训练的全流程,而非只背过“预训练→SFT→RLHF”三个词。考察类型是系统设计+工程取舍,…→No.974微调 Llama2 你是怎么选择训练样本的?清洗逻辑是什么?你有没有观察到哪些训练样本质量问题对模型行为有很大影响?举例说明面试官想考察你对微调数据工程的实战深度,而非背诵“数据越多越好”的套话。这是工程取舍+debug型问题,刁钻点在于:你是…→No.975DPO相比 SFT,有哪些优劣?它在 Agent 任务上效果提升明显吗?你怎么构造偏好对?构造逻辑是自动的还是人工面试官想考察你对LLM对齐技术的深度理解,区分“背论文”和“真落地”。核心是三点:一是DPO与SFT在数学原理和工程实践…→No.976训练过程中数据来自用户行为日志,你是如何从这些数据中抽取训练对话的?有没有做过归一化或事件抽象面试官想看你是否具备从原始、嘈杂的用户日志中提炼高质量训练数据的工程能力,而非只会用现成数据集。这属于工程取舍 + 系统…→No.977What are the different categories of the PEFT method面试官想看的不是“你背过PEFT分类”,而是能否从工程取舍和系统设计角度,把PEFT方法按“修改模型结构”和“修改输入/…→