推理与部署
KV Cache、vLLM、量化、批处理、并行策略与显存估算。面试官用这些题判断你是只调过 API,还是真部署过模型。
全部题目
共 4 篇
vLLM vs SGLang vs TensorRT-LLM:推理框架怎么选
三大推理框架各自的强项是什么?选型看什么?
GQA vs MQA vs MLA:KV Cache 压缩三路线怎么选
三种注意力变体在显存、速度与效果上的权衡?
MoE vs Dense:稀疏和稠密模型怎么选
混合专家和稠密模型的训练推理差异与选型?
量化 vs 蒸馏:模型压缩两条路怎么选
压显存和教小模型,什么时候用哪个?
其他分类
12 个
LLM 基础概念
2/14Transformer、Token、上下文窗口、采样参数、MoE 这些地基题。看起来简单,答得干净利落反而最能体现基本功。
RAG 检索增强
10/14从文档到答案的整条链路:Embedding、分块、多路召回、重排、缓存与权限。答这类题要先说清链路分层,再讲每一层你踩过的坑。
Agent 架构
6/11ReAct 循环、规划与反思、记忆系统、整体设计。面试官最想看的是你能不能说出「为什么这么拆」,而不是背框架名字。
工具调用
6/13Function Call、MCP、A2A、Skills,以及工具过百之后的注册、发现、路由与 Schema 设计。落点永远在「准确率抓在哪个环节」。
多智能体
1/4角色切分、消息协议、状态同步、冲突仲裁。拆多 Agent 不是人多力量大,是上下文稀缺和角色混乱逼出来的工程选择。
记忆系统
1/3工作记忆、情景记忆、语义记忆、程序性记忆怎么分,什么信息值得写入,冲突怎么覆盖合并,遗忘怎么设计。
评测与可观测
2/6非确定系统的回归测试、Golden Set、LLM 裁判校准、trace 埋点与可观测性。核心是别让被测者改自己的分数。
项目实战与企业级
7/8从 demo 到生产的差距:私有知识、权限边界、可审计、业务集成、成本可控。项目题八成问的是这五件事。
训练与微调
2/13SFT、LoRA、RLHF、DPO、GRPO、蒸馏与数据工程。答这类题的关键是讲清楚每一步在优化什么、数据从哪来。
多模态
1/6VLM 怎么看图、视觉 Token 的开销、文档解析与视频理解。专项岗的重点,应用岗的加分项。
提示工程
1/6CoT、Few-shot、结构化输出、系统提示词与注入防护。不是玄学,是可以拆解、可以回归测试的工程方法。
安全与合规
1/5内容安全、提示词泄露、数据合规与自动执行防护。企业落地必问,很多人答不出体系。