先这样答
我的选型顺序是默认 vLLM,结构化输出和复杂解码需求试 SGLang,追求极限性能时再考虑 TensorRT-LLM。三者都是主流开源推理引擎。Qwen 系列本身不是决定因素,主要看业务的生成方式和性能目标。
vLLM 的生态最广,PagedAttention 也比较成熟。面对通用推理场景,我会先用 vLLM。它适合作为默认方案,后续再根据实际需求调整。面试中我会先确认场景,而不是直接比较某个单项指标。
如果任务需要 JSON 模式、多分支生成等结构化输出能力,我会优先试 SGLang。它在前端约束和复杂工作流生成上有特色。TensorRT-LLM 的性能上限高,但工程门槛更高,和硬件的绑定也更深。因此我会把它放到极限性能需求之后评估。
面试官会怎么追问
-
「为什么通用场景先选 vLLM?」 vLLM 的生态最广,PagedAttention 也比较成熟。通用场景不需要先承担更高的工程复杂度,所以我会把它作为默认起点。
-
「什么情况下你会切到 SGLang?」 当任务包含 JSON 模式、多分支生成等结构化输出需求时,我会优先评估 SGLang。它在前端约束和复杂工作流生成上有特色,更贴合这类解码过程。
-
「TensorRT-LLM 性能更高,是不是应该直接使用?」 我不会只看性能上限。TensorRT-LLM 的工程门槛更高,硬件绑定也更深,只有极限性能目标明确时,我才会进一步评估它。
回答的坑
- 不要把三者说成简单的高低排名,应该先讲场景,再讲默认方案和切换条件。
- 不要因为 TensorRT-LLM 的性能上限高就直接选它,还要说明工程门槛和硬件绑定。
同系列的题
—— 本题完 ——