Switchyard:英伟达出品的 LLM 流量调度台
当一个 Agent 开始接入多个模型后,模型调用管理很快会变复杂:不同模型接口不统一,任务需要切换不同后端,想测试新模型还要调整业务代码。
英伟达 NeMo 开源的 Switchyard,就是为这个场景准备的一层 LLM 流量调度层。
它位于应用和模型服务之间,负责接收请求、转换接口格式,并按照配置好的路由策略,将请求转发到对应模型后端。应用侧可以继续使用熟悉的 OpenAI 或 Anthropic 接口格式,后端模型则可以按需求调整。
Switchyard 支持 OpenAI Chat、Anthropic Messages、OpenAI Responses 等接口格式转换,并可以将请求转发到 vLLM、NVIDIA NIM、Ollama 等模型服务接口。
它的核心价值,是让应用和模型后端之间保持更低耦合。比如开发 Coding Agent 时,开发者可以根据业务需求配置路由策略,让不同类型的请求进入不同模型;在测试阶段,也可以通过流量分配比较不同模型的效果。
目前,Switchyard 提供两种使用方式:
1️⃣是直接运行代理服务,把它作为应用和模型之间的路由层;
2️⃣是通过 Rust 库集成到自己的应用中,将路由能力嵌入已有系统。
Switchyard 当前仍处于 pre-alpha 阶段,API 和路由算法还在持续迭代,更适合作为探索多模型调用架构的工具。
如果你的 AI 应用正在从单模型调用走向多模型协作,Switchyard 可以作为一层轻量的请求路由中间层,帮助开发者更灵活地管理模型调用链路。
探寻人工智能,人与AI全新序章 Agent模型路由 NVIDIA Rust vLLM 开源项目 AI基础设施资本化浪潮





