INFERENCE · ALL
推理与部署 · 全部题目
共 6 篇,本页第 1-6 篇。← 回到学习路径视图
No.1vLLM vs SGLang vs TensorRT-LLM:推理框架怎么选vLLM 生态与通用性、SGLang 前缀复用与结构化输出、TensorRT-LLM 编译优化的性能天花板。这篇从 KV…→No.2GQA vs MQA vs MLA:KV Cache 压缩三路线怎么选MQA 极限省显存、GQA 质量显存折中、MLA 低秩压缩上限最高。这篇给 KV Cache 压缩三路线的对比表与叠加量…→No.3MoE vs Dense:稀疏和稠密模型怎么选MoE 总参数大激活小、Dense 可预期简单。这篇给两种模型结构的训练推理差异对比表与按场景选型。…→No.4量化 vs 蒸馏:模型压缩两条路怎么选量化同架构压数值、蒸馏换架构压参数。这篇给两条压缩路线的对比表与组合用法。…→No.5第 2 章(下) · 推理与部署面试导学KV Cache 的显存账、vLLM 的两条提速主线、量化与投机解码的适用边界、PD 分离与 Roofline 判断,这…→No.6llama.cpp vs vLLM:端侧与服务端推理怎么选llama.cpp 端侧单机、vLLM 服务端高吞吐。这篇给两个推理框架的场景对比表与混合部署形态。…→