先这样答
Agent 的混合路由按请求复杂度切分。限流按后端工具的 QPS 预算设计。
混合路由的核心是分层处理请求。系统用规则或小模型处理高频且简单的请求。大模型专门负责处理复杂请求。路由判断依赖三个具体信号。系统会识别当前的问题类型。系统会计算对话的历史轮次。系统还会评估意图置信度。这三个信号共同决定请求的去向。
混合路由存在误判代价。小模型或规则可能发生切分错误。这种误判会破坏用户体验。系统必须预留升级通道。小模型处理失败时会发出信号。系统接收信号后把请求重新交给大模型处理。
限流设计的基准是后端工具的 QPS 预算。Agent 调用的外部工具通常有严格的并发限制。系统通过队列削峰来平滑请求峰值。系统按请求优先级排队。高优任务会优先执行。请求量超过工具的 QPS 预算会触发超限降级机制。降级状态下 Agent 停止调用高消耗工具。系统改为只读取静态数据。系统也可以直接返回缓存的历史结果。
面试官会怎么追问
-
「意图置信度具体怎么影响路由判断?」 意图置信度是小模型输出的概率值。置信度高于设定阈值时小模型直接生成回复。置信度低于阈值说明小模型无法准确理解意图。系统此时触发升级通道转交大模型处理。
-
「超限降级时返回缓存结果,用户怎么知道数据不是最新的?」 降级策略优先保证系统响应。系统在返回缓存结果时会强行插入提示文案。文案明确告知用户当前结果来自历史缓存。
-
「你提到按优先级排队,系统怎么判断哪个请求优先级更高?」 系统结合问题类型和历史轮次评估优先级。历史轮次较多的请求优先级更高。系统优先保证正在进行的多轮对话不中断。单轮的简单问题会被放入低优队列。
回答的坑
- 忘记提及混合路由切分错误时的兜底方案。
- 孤立地谈论限流设计而脱离后端工具 QPS 预算这个限制条件。
同系列的题