工具调用[模型路由性能优化大模型工程]速答 · 约 5 分钟更新 2026-09-28

大模型和小模型怎么分级路由?什么请求该给谁?

一句话结论

核心思路是在成本和质量间找平衡,工程上分路由和级联两种形态,通过规则、分类器或偏好数据训练的判断器,把简单高频请求给小模型,复杂低频请求给大模型。

先这样答

生产环境中大模型和小模型的分工主要通过路由和级联两种形态实现。路由是在推理前通过判断器一次性决定交由哪个模型处理;级联则是先让便宜的小模型生成答案,经过评估认为不合格后再升级交给大模型处理。两者的核心目标都是在保持回答质量的同时控制推理开销。

决定请求给谁,主要看任务难度和置信度。简单、意图明确、高频的请求交给小模型,而需要深度推理、复杂指令遵循或长上下文的请求交给大模型。工程落地时判断依据通常经历一个渐进过程,最基础的是规则路由,依靠关键词、文本长度或意图词表做分发。进阶做法是引入分类器,或者利用小模型自身输出的对数概率等置信度信号做判断,目前更成熟的方案是使用人类偏好数据训练专门的路由器。

学术界和工业界已经验证了这种机制的可行性。FrugalGPT 提出的级联策略,通过便宜模型先答加打分函数评估的方式,在特定实验设置下匹配大模型效果并最高节省百分之九十八的成本,同成本下最高提高百分之九的准确率。RouteLLM 则是利用偏好数据训练专门的路由器在强弱模型间做选择,能做到成本降低超过两倍而不损质量,且具备在不同强弱模型组合间的迁移能力。在实际业务里,我们通常采用混合路由,用规则做兜底分发,用分类器做核心判断。

面试官会怎么追问

  • 「路由和级联在业务里具体什么时候用?」 简单任务量大、对延迟要求严格的场景用路由,因为路由是一次性决策,没有额外生成开销。对回答质量敏感、允许一定延迟的场景用级联,级联多了一跳评估的延迟,但用小模型试错能提供质量底线保障。
  • 「怎么判断小模型能不能答好当前请求?」 可以提取请求的长度和领域词等特征交给分类器判断,或者让弱模型先输出并评估其生成的对数概率。更进一步的做法是利用偏好数据训练一个预测器,直接预测强模型在该请求上是否会胜过弱模型。
  • 「如果路由分发错了怎么办?」 策略上要保持保守倾向,拿不准的请求优先交给大模型,或者用级联机制做兜底。工程上需要建立监控分桶指标,结合线上 A/B 测试和坏例归因,把错分给弱模型的复杂请求样本回流,用于重新微调路由器。

回答的坑

  • 认为只要用模型路由就能无脑降低延迟和成本,正确的认识是必须评估路由器自身的计算延迟以及多模型版本带来的运维开销。
  • 把论文里的省钱比例当成通用结论直接背诵,回答时应当强调类似最高节省百分之九十八成本的数据是基于特定实验设置的上限。
—— 本题完 ——