FINETUNE · ALL
训练与微调 · 全部题目
共 310 篇,本页第 193-240 篇。← 回到学习路径视图
No.1335VisualGLM的训练这道题考察的是多模态大模型(MLLM)的训练全流程,属于系统设计+工程取舍类型。面试官想看你是否理解“视觉-语言融合”不…→No.1336What are some alternatives or recent advancements beyond the standard RLHF process described?**面试官想看你是否停留在“RLHF = PPO + 奖励模型”的教科书认知,还是能跟上2023-2024年偏好优化领域的快…→No.1340❓ **Q18:DAPO 对 GRPO 做了哪些改进?(字节最高频)**这道题考察的是对最新强化学习训练算法的深度理解,属于系统设计 + 工程取舍类型。字节跳动内部大量使用 DAPO 训练推理…→No.1341❓ **Q19:GSPO 为什么比 GRPO 更适合 2025-2026?**这道题考察的是对 LLM 偏好优化(Preference Optimization)前沿演进的深度洞察,属于趋势判断 +…→No.1343❓ **Q26:PRM 训练数据如何构造?**面试官想考察你对过程奖励模型(PRM)数据构建的工程落地能力,而非单纯背概念。核心看三点:① 是否理解PRM与ORM(结…→No.1346❓ **Q46:Llama 4 后训练新思路?**面试官想看你是否跟进了 Llama 4 的技术报告,并理解其“后训练”不再是单一 SFT,而是多模态对齐、长上下文扩展、…→No.1347❓ **Q47:Qwen3 训练范式独特之处?**面试官想考察你对前沿大模型训练范式的系统性理解,而非死记硬背。刁钻点在于:Qwen3 不是简单的“预训练+RLHF”流水…→No.1348❓ **Q49:GRPO PyTorch 中 KL 惩罚怎么设计?**面试官想考察的不是KL散度的数学定义,而是你能否在GRPO这种无critic的强化学习框架下,用PyTorch实现一个工…→No.1349❓ **Q:RLHF 训练中出现 reward collapse 怎么诊断和处理?**面试官想考察你对 RLHF 训练中 reward collapse(奖励崩溃)的实战诊断与修复能力,而非仅背诵概念。这是…→No.1350❓ **Q:Test-Time Compute 和训练时 Compute 如何权衡?**面试官想看你是否具备系统级计算资源分配思维,而非简单背诵“训练贵、推理快”的常识。这是典型的系统设计 + 工程取舍题,刁…→No.1351❓ **Q:Tool-use RL 和普通 GRPO 最本质的区别是什么?**面试官想考察你是否真正理解强化学习在 LLM 中的落地边界,而非只背 GRPO 公式。本质区别在于:动作空间是否包含外部…→No.1352❓ **Q:为什么 R1 训练不能先 GRPO 再 DPO?**面试官想看你是否真正理解多阶段RL训练的顺序依赖,而非死记R1论文流程。考察类型是工程取舍+系统设计,刁钻点在于:GRP…→No.1353❓ **Q:为什么 RL 阶段的污染比训练数据污染更严重?**面试官想看你是否真正理解 RL 训练(尤其是 RLHF/GRPO)与监督学习在“数据污染”上的本质差异。这不是背概念题,…→No.1354为什么用 MultipleNegativesRankingLoss 而不是 Triplet Loss面试官想考察你对对比学习损失函数的工程理解深度,而非单纯背概念。这道题属于工程取舍类型,刁钻点在于:候选人常只答“MNR…→No.1355为什么看起来Adapter、Prefix Tuning、LoRA(在结构上和公式上)都不太一样,尤其是Prefix Tuning,但是这三种方法有近似的效果面试官想考察你是否真正理解PEFT(参数高效微调)的本质,而非死记硬背公式。这道题的“刁钻点”在于:表面结构差异巨大(A…→No.1356你知道Deepseek的GRPO吗,它和PPO的主要区别是什么?优劣是什么面试官想考察你对 RLHF 前沿变体的理解深度,特别是能否跳出 PPO 的“标准答案”框架,辩证分析新方法的工程取舍。这…→No.1357在训练一个百或千亿参数级别的 LLM 时,你会面临哪些主要的工程和算法挑战?(例如:显存、通信、训练不稳定性等)面试官想考察你对大规模分布式训练从“纸上谈兵”到“真刀真枪”的系统理解。这不是背概念题,而是工程取舍 + 系统设计题。刁…→No.1359大模型中文化时,扩充词表后全参训练面试官想看你是否真正动手做过大模型中文适配,而非只背过论文。考察类型是工程取舍 + 系统设计。刁钻点在于:扩充词表看似简…→No.1360大模型的 honest 原则是如何实现的?模型如何判断回答的知识是训练过的已知的知识,怎么训练这种能力面试官想考察你对LLM“诚实性”的深层理解,而非简单背诵RLHF流程。核心是:模型如何区分“知道”与“不知道”,以及如何…→No.1361如何提升RLHF的效率?你认为关键在哪里面试官想看你是否真正理解RLHF的工程瓶颈,而非仅背诵PPO公式。考察类型是系统设计+工程取舍,刁钻点在于:大多数人只会…→No.1362如何解决 PPO 的训练过程同时存在4个模型(2训练,2推理),对计算资源的要求较高 问题面试官想考察你在资源受限环境下,对PPO训练中“4模型并行”(策略模型、价值模型训练,参考模型、奖励模型推理)的显存与计…→No.1363DeepSpeed vs Megatron-LM vs FSDP:分布式训练框架怎么选FSDP 零依赖、DeepSpeed 配置驱动全家桶、Megatron 万卡级极致。这篇给分布式训练三方案的规模分界与组…→No.2PPO vs GRPO vs DPO:对齐算法怎么选PPO 四件套样本效率高、GRPO 组内相对省 Critic、DPO 离线偏好最简。这篇给三种对齐算法在显存、稳定性、数…→No.3第 3 章 · LLM 训练面试导学LoRA 三层递进与 GRPO 全家桶是当前训练章两大必考块。这篇导学给出从 SFT 数据、对齐算法到 Agent RL…→No.901预训练(Pre-training)的数据来源有哪些?如何构建高质量预训练语料面试官想看你能否从"数据来源 → 质量控制 → 配比设计"整条链路理解预训练数据工程。刁钻点在于:很多人只列举数据来源(…→No.902什么是数据去重?为什么对 LLM 预训练如此重要面试官想看你能否解释去重的技术原理和工程价值。刁钻点在于:很多人只答"去重就是删重复",但说不出精确去重 vs 近似去重…→No.903训练数据中的「数据配比「(Data Mixture)如何影响模型能力面试官想看你能否从"数据配比 → 模型能力"的因果关系中做工程推理。刁钻点在于:很多人只答"代码多了推理好",但说不出为…→No.904什么是「数据课程「(Data Curriculum)学习面试官想看你能否解释课程学习在 LLM 预训练中的应用。刁钻点在于:很多人混淆了"数据课程"和"数据配比"——配比是"喂…→No.905如何处理预训练数据中的「有毒内容「和偏见面试官想看你能否从技术和社会两个维度处理内容安全问题。刁钻点在于:很多人只答"过滤掉有毒内容",但说不出过度过滤的副作用…→No.906什么是「Scaling Laws「?它如何指导预训练面试官想看你能否解释 Scaling Laws 的数学形式和工程指导意义。这是 LLM 预训练的"理论基石",几乎所有训…→No.907预训练中的「checkpoint 选择「有什么讲究面试官想看你能否解释"不是训练越久越好"这一反直觉的现象。刁钻点在于:很多人默认"训练步数越多 loss 越低模型越好"…→No.908什么是「持续预训练「(Continual Pre-training)?和从头训练有什么不同面试官想看你能否解释持续预训练的工程价值和关键技术挑战。这是企业落地 LLM 的常见场景——很少有企业从头训练模型,大多…→No.909Lora怎么做的,讲一下面试官想确认你是否真正理解LoRA的数学原理和工程实现,而非只背了“低秩适配”四个字。这是典型的“背概念+工程取舍”混合…→No.910大模型训练的损失是什么面试官想确认你是否真正理解LLM训练的核心机制,而非死记硬背“交叉熵”三个字。考察类型是概念+工程取舍。刁钻点在于:多数…→No.911LoRA一般加在哪里面试官想考察你对LoRA(Low-Rank Adaptation)原理的深度理解,而非简单背诵“加在Q和V上”。这是典型…→No.912什么是预训练(Pretraining)面试官想确认你是否真正理解 LLM 训练范式的核心——预训练不是“跑个脚本”,而是通过自监督学习从无标注数据中压缩世界知…→No.913预训练和传统监督学习有什么区别面试官想看的不是“预训练用无标签数据,监督学习用有标签”这种教科书定义,而是你能否从学习范式、数据效率、泛化边界三个维度…→No.914预训练数据通常来自哪里面试官想考察你对 LLM 预训练数据工程的系统性理解,而非简单背诵数据来源列表。这是典型的“背概念+工程取舍”混合题,刁…→No.915什么是 SFT(Supervised Fine-Tuning)面试官想确认你是否真正理解SFT在LLM训练流水线中的定位,而非仅背诵“用标注数据微调”的定义。这是典型的概念+工程取舍…→No.916什么是 Instruction Tuning面试官想确认你是否真正理解 Instruction Tuning 的本质,而不仅仅是背定义。这属于概念辨析 + 工程取舍…→No.917LoRA 微调的原理是什么?秩 r 的选择会对模型表现产生什么影响面试官想考察你对参数高效微调(PEFT)核心技术的底层理解,而非简单背诵“低秩分解”定义。刁钻点在于:区分“知道 LoR…→No.918预训练数据 Token 重复 是否影响 模型性能面试官想考察你对预训练数据质量与模型性能关系的底层理解,而非简单背结论。这是典型的工程取舍+系统设计类问题,刁钻点在于:…→No.919SFT需要训练Token数面试官想考察你对SFT(监督微调)数据规模与效果之间关系的工程直觉,而非死记硬背数字。核心是看你能不能区分“数据量”和“…→No.920预训练数据集重复的影响是什么面试官想考察你对预训练数据质量与模型泛化之间关系的系统性理解,而非简单背诵“重复不好”。刁钻点在于:重复并非绝对有害,少…→No.921使用BERT预训练模型为什么最多只能输入512个词面试官想考察你对 BERT 架构底层设计细节的掌握程度,而非简单背诵“512 是最大长度”。核心考察三点:位置编码的硬编…→No.922SFT(有监督微调)的数据集格式面试官想考察你对 LLM 微调流程中“数据工程”环节的掌握程度,而非简单背诵格式。核心是:你是否理解 SFT 数据格式背…→No.923有哪些大模型的训练集面试官想看你是否真正理解大模型训练数据的“血统”,而非死记硬背数据集名字。考察类型是系统设计+工程取舍。刁钻点在于:你能…→No.924为什么需要 PEFT面试官想看你是否真正理解大模型落地的工程瓶颈,而非只会背“PEFT 省显存”。考察类型是工程取舍 + 系统设计。刁钻点在…→