先这样答
LLM 网关是位于上层应用和底层大模型供应商之间的统一入口层。在企业架构中,它承担了所有模型调用的流量接管工作。回答这个问题可以从核心职责和业务价值两个维度展开。它的核心职责主要包括协议适配、智能路由、鉴权配额、可观测性、安全合规以及容错处理。
在具体机制上,协议适配是网关的基础,它抹平了不同模型供应商的接口差异,让应用端使用统一的标准化接口发起请求。路由机制会根据具体任务类型、模型可用性以及调用成本,动态将请求分发给最合适的底层模型。鉴权与配额功能负责在企业内部按团队或项目进行限流,并统计 token 消耗以实现计费管理。可观测性机制记录调用轨迹,将消耗的计算资源准确归因到具体业务线。安全模块在请求发出前和响应返回后,执行内容过滤、敏感数据脱敏和合规审计记录。容错模块则通过限流、自动重试和模型故障时的降级切换,维持业务运转。
企业引入这一层的核心价值在于解耦与集中治理。业务逻辑不再和特定的模型供应商强绑定,后续更换模型或接入新模型时,不需要修改上层业务逻辑。同时,企业的接口调用成本和资源用量得到了统一管控,合规审计也有了明确的执行落点。在实际工程落地中,建设统一的网关层是企业规范使用大模型的基础。
面试官会怎么追问
- 「传统 API 网关不能直接用来做 LLM 网关吗?区别在哪?」 传统 API 网关主要处理标准 HTTP 请求,而 LLM 网关需要具备大模型语义感知能力。大模型的调用通常涉及长连接和流式输出,网关需要针对流式数据进行解析。此外,LLM 网关的计费和限流维度是基于 token 数量的,这要求网关能够解析请求和响应中的 token 消耗,传统网关通常只按请求次数计费。
- 「你刚才提到路由,网关在做模型路由时,一般会根据什么策略来切换?」 路由策略通常分为基于成本、可用性和任务类型的分发。当主模型接口响应超时或报错时,网关会自动切换到备用的同级别模型以保证可用性。对于简单的常规文本处理任务,网关可以通过路由将请求分发给成本更低的小模型,而将复杂的推理任务交给能力更强的大模型。
- 「如果现在让你负责搭建公司的 LLM 网关,你会选择自建还是用开源方案?」 这取决于企业现有的技术栈和定制化需求。如果业务处于起步阶段且需求标准,直接部署成熟的开源网关可以快速实现协议转换和基础鉴权。如果企业内部已经有复杂的微服务架构、特定的计费系统以及严格的数据安全脱敏规范,通常需要在开源方案基础上进行二次开发,或者完全自建以满足深度集成的要求。
回答的坑
- 把 LLM 网关简单等同于反向代理,忽略了流式响应解析和基于 token 的计费限流这些大模型特有的核心机制。
- 夸大网关对模型能力的干预作用,网关只负责流量调度、工程治理和安全审计,不改变底层模型本身的生成质量或逻辑推理能力。
—— 本题完 ——