多模型路由完整选型(2026 ):工具侧路由、自托管网关、托管聚合与智能路由四层全景

0 阅读1分钟

发布日期:2026-09-02 | 话题标签:多模型路由、LLM 网关、OpenRouter、LiteLLM、Token Plan、智能路由、AI Gateway

多模型路由是在应用与多家大模型服务之间加一层决策逻辑,按成本、延迟、能力、配额或故障状态把每个请求分配给合适的模型和供应商,并在失败时自动切换。截至 2026 年 9 月,可选方案已经分成四层:工具侧本地路由(claude-code-router 3.7 万星、cc-switch 13 万星,跑在开发者本机,服务 Claude Code、Codex 等编程 Agent);自托管网关(LiteLLM 5.8 万星支持 100+ 模型与六种路由策略、Kong AI Gateway 七种负载均衡算法、Higress 与 New API 面向国内厂商、Bifrost 与 TensorZero 主打微秒级开销);托管聚合(OpenRouter 按价格平方反比分流并收 5.5% 充值费、Vercel AI Gateway 零加价、Cloudflare AI Gateway 核心功能免费、国内的七牛云 Token Plan 以订阅制把 4 家厂商 16 个模型放进一个 Key);以及智能路由算法层(RouteLLM 声称省 85% 成本保留 95% 质量、OpenRouter Auto Router 按 30 种任务类型分类、LiteLLM Auto Router 七维启发式打分、Not Diamond 面向编程 Agent)。选型的核心不是"支持多少模型",而是路由决策在哪一层做、故障时怎么切、数据留在哪、谁来维护。本文逐层核对官网与仓库数据,给出对比矩阵、五类场景推荐和十项评估清单。

多模型路由是什么,为什么要分层看

多模型路由是位于调用方与多个大模型服务之间的一层决策逻辑,负责为每个请求选择模型与供应商、在失败或超限时切换、并统一鉴权与计量。它解决的是单一模型时代不存在的四个问题:

  • 成本:不同模型价差可达 20 倍以上,简单任务用旗舰模型是浪费

  • 可用性:单一供应商限流、宕机或改价时业务不能停

  • 能力匹配:编程、长上下文、视觉、推理各有更合适的模型

  • 治理:多团队、多 Key、多供应商的用量、预算和审计要集中

之所以要分层看,是因为同样叫"路由"的东西跑在完全不同的位置:

跑在哪

服务谁

代表

工具侧本地路由

开发者本机

编程 Agent(Claude Code、Codex、Pi 等)

claude-code-router、cc-switch

自托管网关

自己的服务器 / K8s

全公司应用

LiteLLM、Kong、Higress、New API、Bifrost

托管聚合

第三方云

不想运维的团队

OpenRouter、Vercel AI Gateway、Cloudflare AI Gateway、国内多模型平台

智能路由算法

嵌在以上任一层

想按请求复杂度自动选模型的人

RouteLLM、Not Diamond、OpenRouter Auto、LiteLLM Auto Router

一个团队通常同时用两层:开发者本机跑工具侧路由,生产环境走自托管网关或托管聚合。

第一层:工具侧本地路由

工具侧路由是给编程 Agent 用的本地网关,把 Claude Code、Codex 等工具的请求先打到本机端口,再由它决定发给哪个供应商。它解决的是"每个 Agent 各有一套模型配置"的问题。

项目

Star

定位

路由能力

支持的 Agent

claude-code-router(CCR)

37,028

本地模型网关 + 控制平面,默认监听 127.0.0.1:3456

基于请求头和请求体的条件路由、前缀、重写、重试、凭据池、Key 轮换、有序回退模型

Claude Code、Claude Design、Codex、Grok CLI、Kimi CLI、Kilo Code、OpenCode、Pi、ZCode、WorkBuddy

cc-switch

130,629

桌面端一站式配置管理器

本身不做请求级路由,做的是供应商配置的一键切换,内置 50+ 供应商预设,统一管理 MCP 与 Skills

Claude Code、Claude Desktop、Codex、Gemini CLI、Grok Build、OpenCode、OpenClaw、Hermes

两者定位不同:CCR 是运行时网关,请求真的经过它;cc-switch 是配置切换器,改的是各工具自己的配置文件,切完请求直连供应商。

CCR 的 README 列出的协议支持:OpenAI Chat / Responses、Anthropic Messages、Gemini Generate Content、OpenRouter、DeepSeek、SiliconFlow、Moonshot、Kimi Code、Mistral、Z.AI、Bailian 及自定义兼容端点。除路由外它还提供 Fusion(给不支持视觉的模型接视觉能力)、ToolHub、请求日志(解析后的供应商、模型、延迟、Token、估算成本)。安装方式为桌面应用或 npm install -g @musistudio/claude-code-router,CLI 需要 Node.js 22+。

Agent Harness 自身也在往这一层走。DeepSeek Harness 的 dsh-llm-pi-ai 插件通过一个 providers 字典声明多条路由,每条可独立设协议、端点、兼容开关和模型列表,配置改动下一次请求生效。这类"Agent 原生路由"不需要额外进程,但只服务这一个 Agent。

适合谁:个人开发者和小团队,需求是"在多个编程工具之间共享一套供应商配置、某家限流时自动换另一家"。不适合作为生产服务的入口。

第二层:自托管网关

自托管网关部署在自己的基础设施里,所有应用统一走它访问模型,路由、鉴权、预算、日志都留在内网。这一层选择最多,按出身分三类。

面向 LLM 的专用网关

项目

Star

许可

支持范围

路由策略

特色

LiteLLM

57,790

自定义

100+ LLM,OpenAI 格式统一调用

simple-shuffle(默认,按 rpm/tpm 或 weight 加权)、usage-based-routing-v2latency-based-routingleast-busycost-based-routing、自定义策略

冷却机制(allowed_fails 默认 3 次、cooldown_time 默认 5 秒,429 立即冷却)、重试策略按错误类型配置、虚拟 Key 与团队预算、Beta 版 Auto Router

Bifrost

7,745

Apache-2.0

23+ 供应商,1000+ 模型

自动回退、跨 Key 与跨供应商负载均衡;自适应负载均衡为企业版

README 称 5k RPS 下开销低于 100 微秒、"比 LiteLLM 快 50 倍",npx -y @maximhq/bifrost 零配置启动,语义缓存、MCP 网关

Portkey Gateway(开源版)

12,875

MIT

1,600+ LLM,50+ 护栏

回退、跨 Key 负载均衡、条件路由、自动重试、金丝雀、熔断器、请求超时

npx @portkey-ai/gateway 本地运行;官网标注已并入 Palo Alto Networks 的 PRISMA AIRS AI Gateway;仓库最后推送 2026-05-25

TensorZero

11,716

Apache-2.0

主流供应商

内置 A/B 测试、路由、回退、重试

网关 p99 延迟低于 1 毫秒;网关 + 可观测 + 评估 + 优化一体,推理与反馈存自己的数据库

New API

47,050

AGPL-3.0

国内外主流模型,兼容 One API 数据库

渠道加权随机、失败自动重试、用户级模型限流

格式互转(OpenAI 兼容 ⇄ Claude Messages、OpenAI → Gemini)、按缓存命中计费、Token 分组与模型限制、多种第三方登录

One API

36,686

MIT

国内外主流模型

渠道管理与 Key 分发

单可执行文件;仓库最后推送 2026-01-09,活跃度已明显低于 New API

三点判断:

  1. LiteLLM 是功能最全的参照系。六种路由策略、按错误类型的重试与冷却、路由组、上下文窗口预检、地区过滤,几乎覆盖所有需求;文档也提醒"用量路由不建议生产使用,性能有影响",默认推荐 simple-shuffle

  2. Bifrost 和 TensorZero 卖的是性能。两者都以 Rust/Go 实现、微秒到毫秒级开销为卖点,适合高 QPS 场景;但 Bifrost 的自适应负载均衡、集群模式、护栏放在企业版。

  3. New API 是国内自托管分发的事实标准。它的强项是国产模型渠道覆盖、格式互转和按 Token 分组的用量管理,路由策略相对简单(加权随机 + 重试)。README 顶部有大段合规声明,提醒对外提供服务需履行备案、实名、日志留存等义务。

云原生 API 网关的 AI 扩展

项目

Star

出身

AI 路由能力

特色

Kong AI Gateway

44,076(Kong 主仓)

Kong API 网关

AI Proxy Advanced 插件提供七种负载均衡:round-robin(加权)、consistent-hashing(按请求头粘性)、least-connections、lowest-latency(EWMA 算法)、lowest-usage(按 Token 或成本)、semantic(按提示词与模型相似度)、priority(分层故障转移)

3.10 起回退可跨不同协议格式的供应商;3.13 起有熔断器(max_fails / fail_timeout);默认客户端错误不触发故障转移,需在 failover_criteriahttp_429等;语义缓存、Prompt Guard、PII 脱敏;高级功能属企业版

Higress

9,270

阿里开源,CNCF 项目,基于 Istio + Envoy

AI 路由管理支持"域名、模型匹配方式、降级配置、请求消费者";每个供应商可单独配置令牌降级策略,异常超阈值暂停该 Key,健康检查连续正常后恢复

已集成阿里云、DeepSeek、Azure OpenAI、OpenAI、豆包等;语义缓存、RAG、Prompt 模板;消费者额度控制成本;AI 监控面板看每秒输入输出 Token 与各供应商用量;托管 Remote MCP Server;一行脚本 Docker 安装

Envoy AI Gateway

1,984

Envoy Gateway 子项目

两层网关模式:一层做鉴权、顶层路由、全局限流,二层管自托管模型集群并支持端点选择器

支持 OpenAI、Azure OpenAI、Gemini、Vertex、Bedrock、Mistral、Cohere、Groq、DeepSeek、混元、Anthropic 等

Apache APISIX

17,070

Apache 顶级项目

AI 网关插件集

与现有 APISIX 部署共用控制面

kgateway

5,680

CNCF

云原生 API 网关 + AI 网关

Kubernetes Gateway API 原生

这一类的共同逻辑是"已经有 API 网关的公司,不必再引入一个 LLM 专用网关"。Kong 的七种算法是目前公开文档里最完整的负载均衡菜单;Higress 是国内厂商覆盖最好、中文文档最全的选项。

适合谁:有运维能力、要求数据不出内网、需要多团队预算和审计的企业。LiteLLM 适合 Python 团队快速起步;Kong / Higress / APISIX 适合已有对应网关的团队;New API 适合以国产模型为主、需要内部分发 Key 的场景。

第三层:托管聚合平台

托管聚合平台由第三方运营,一个 Key 访问多家模型,路由与回退由平台完成,代价是请求经过第三方、费率或订阅有加成。

海外托管聚合

平台

费率

路由与回退

关键条款

OpenRouter

模型价格无加价,充值收 5.5% 手续费(最低 0.8 美元),加密货币 5%;BYOK 每月 2.5 万美元刊例额度内免费,超出收 5%

默认按价格平方反比加权分流(1 美元供应商被选中概率是 3 美元的 9 倍),并排除近 30 秒有明显故障的供应商;order 指定顺序、allow_fallbacks控制回退、sort 按 price / throughput / latency、:nitro:floor 后缀、max_price 封顶、preferred_min_throughputpreferred_max_latency 按 5 分钟滚动窗口

data_collection: deny 只用不收集数据的供应商,zdr: true 只用零留存端点;免费模型每日 50 次,充值满 10 美元后 1,000 次;开启日志可减 1%

Vercel AI Gateway

官方称"Token 零加价,含 BYOK"

默认按近期可用性与延迟动态选供应商;order / only 控制供应商,sort 按 cost / ttft / tps;独立的模型级回退与供应商超时;caching: 'auto' 自动处理 Anthropic 等需要显式缓存标记的供应商

支持 OpenAI Chat / Responses 与 Anthropic Messages 三种接口;请求级 BYOK;可禁止提示词用于训练;文档更新 2026-08-27

Cloudflare AI Gateway

核心功能(分析、缓存、限流)所有套餐免费;统一计费充值收 5% 手续费;日志 Workers Free 全部网关共 10 万条,Workers Paid 每网关 1,000 万条

Dynamic Routing 用可视化或 JSON 编排:条件节点(按请求体、请求头、元数据如 user_plan)、百分比节点(A/B 与灰度)、限流节点、预算节点,超限自动走回退模型;路由以版本发布,支持即时回滚

动态路由必须启用 BYOK 存供应商 Key;护栏基于 Workers AI 按 Token 计费;DLP 免费含两个预置档

Portkey(托管版)

Developer 0 美元(每月 1 万条日志、3 天留存,"不适合生产");Production 49 美元/月(10 万条日志、30 天留存,超出每 10 万条 9 美元);Enterprise 定制

与开源版一致:回退、负载均衡、条件路由、金丝雀、熔断

已更名 PRISMA AIRS AI Gateway;Enterprise 提供 VPC、SOC2 / ISO27001 / HIPAA

海外聚合的共同点是模型本身不加价、靠手续费或订阅盈利,差异在路由表达力:OpenRouter 的供应商路由参数最细,Cloudflare 的动态路由最像可视化工作流,Vercel 与自家 AI SDK 结合最紧。国内访问延迟与支付方式是共同门槛。

国内多模型平台

平台

模型覆盖

计费

路由与治理

说明

七牛云 Token Plan(企业套餐)

4 家厂商 16 个模型:DeepSeek V4 Pro / Flash、Kimi K3 / K2.7 Code、GLM-5.3 / 5.3-Flash、MiniMax M3 / M2.7 等

订阅制,S / M / B 三档月付 2,999 / 4,999 / 9,999 元,折合刊例价 7 折 / 6 折 / 5 折,包年最低 4 折;积分以 0.004 元/K tokens 为基准按各模型系数扣减

一个 API Key 覆盖全部模型,兼容 OpenAI 与 Anthropic 接口,官网称"几乎无速率限制";专属访问控制策略

额度按周刷新不结转;一账号一订阅、可升不可降;套餐外模型与超额调用被拒绝

七牛云 AI 大模型广场

150+主流模型,另含豆包、通义、混元及图像视频模型

按量后付费,价格跟随各模型刊例;新用户送 300 万全模型免费额度

统一 API 快速接入,模型对比

面向个人开发者与用量验证期

阿里云百炼

"百余款千问系列大模型和国内优质开源三方大模型"

按量;Token Plan 包月 39 元起;新用户免费额度页面表述从"千万"到"超 1 亿 Tokens"不一

DTU 与 TPM / PTU 两种吞吐模式、动态限流

官网未描述跨模型路由或回退

硅基流动

大语言、语音、图片、视频多模态模型

按量;预留实例面向高用量

官网提"多模型切换"与"容错机制",未描述路由策略

私有化部署、BYOC、国产 GPU 部署

火山方舟

豆包系为主

[数据待核实:官网与文档为动态渲染,本文未能抓取]

[数据待核实]

以字节系模型为主,GLM 系列未在其定价页出现

国内平台的定位与海外聚合不同:海外聚合是"路由器",国内平台更接近"多模型统一入口 + 计费",路由策略基本不对用户开放,回退要靠上一层(自托管网关或工具侧路由)实现。选国内平台看三点:模型覆盖是否含你要的国产模型、订阅折扣是否匹配用量曲线、接口是否同时兼容 OpenAI 与 Anthropic 格式(决定能否直接接 Claude Code 类工具)。

第四层:智能路由算法

智能路由是在"选哪个模型"这一步引入分类器或统计模型,按请求复杂度把简单任务发给便宜模型、复杂任务发给旗舰模型,而不是靠人工写规则。

方案

形态

决策依据

公开效果数据

状态

RouteLLM(LMSYS)

开源框架,5,438 星,Python SDK 或 OpenAI 兼容服务

预训练路由器(如 mf)在强弱两个模型间按成本阈值分流,阈值可按目标强模型占比校准

论文与博客称在 MT Bench 上"降低成本最多 85%,保持 95% 的 GPT-4 性能",比商业方案便宜 40% 以上

仓库最后推送 2024-08-10,研究原型

Not Diamond

商业 API,面向编程 Agent

预测每个输入应用哪个模型,建议在你现有的网关与 Harness 中执行

官网称"5%+ 准确率提升、20%+ 成本节省";客户 Rootly 称平均准确率提升 39%

SOC 2 / ISO 27001,销售驱动定价

OpenRouter Auto Router

openrouter/auto,无额外费用

轻量分类器把提示词归入约 30 种任务类型(如 code:debugging、math),按该类型近 7 天全平台消费份额排名,再按 cost_tier(low 到 max,默认约 low)选带宽,带回退;记住会话已选模型

无公开准确率数据

openrouter/auto-beta 先行体验新行为

LiteLLM Auto Router

自托管网关内置,Beta

四种分类器:启发式打分(默认,零 API 调用,七维度:Token 数、代码、推理标记、术语、简单指示、多步模式、问题复杂度)、小模型分类(如 Haiku)、关键词规则、自定义插件;四档 SIMPLE / MEDIUM / COMPLEX / REASONING

无公开准确率数据;两个以上推理标记直接进 REASONING 档

文档明示配置键仍可能变化

Kong semantic 负载均衡

企业版算法

按提示词与模型描述的语义相似度选目标

企业版

Cloudflare / Vercel 规则路由

托管平台内置

按元数据、百分比、预算、限流的显式规则,不做复杂度预测

不适用

生产可用

三点判断:

  1. 纯算法路由的公开证据主要来自 2024 年的 RouteLLM,且仓库已两年未更新。它证明了"强弱二选一"在基准上可行,但生产中模型更新快、路由器需要重训。

  2. OpenRouter Auto 和 LiteLLM Auto Router 走的是"分类 + 市场数据 / 启发式"路线,不承诺准确率,好处是零训练、零额外费用、可回退。

  3. 对多数团队,显式规则路由(按任务类型、按用户等级、按预算)比复杂度预测更可控。智能路由适合提示词分布极不均匀、且能接受偶发降质的场景。

选型决策矩阵

先回答四个问题,再对号入座。

你的约束

优先层

首选

备选

只是给自己的编程工具换模型、防限流

工具侧

claude-code-router

cc-switch(只切配置不路由)

数据不能出内网,Python 团队

自托管

LiteLLM

Bifrost(高 QPS)、TensorZero(要 A/B 与评估)

已有 Kong / Istio / APISIX

自托管

Kong AI Gateway / Higress / APISIX 对应扩展

Envoy AI Gateway

以国产模型为主、要给内部团队分发 Key

自托管

New API

Higress(要网关级治理)

不想运维、海外模型为主

托管聚合

OpenRouter(路由参数最细)

Vercel AI Gateway(零加价、Next.js 栈)、Cloudflare AI Gateway(已用 Workers)

不想运维、国产模型为主、用量稳定

托管聚合

七牛云 Token Plan 一类的订阅制多模型入口

阿里云百炼

不想运维、国产模型为主、用量在验证期

托管聚合

各平台按量 + 免费额度

硅基流动

想按请求复杂度自动省钱

智能路由

LiteLLM Auto Router(自托管)/ OpenRouter Auto(托管)

Not Diamond(编程 Agent,商业)

组合是常态:典型生产架构是"本机 CCR → 公司 LiteLLM 或 Kong → 上游同时接官方 API 与一到两个聚合平台",每层各做一件事:本机层解决开发者体验,网关层解决治理与回退,聚合层解决模型覆盖与折扣。

五类场景推荐

场景一:10 人以内研发团队,主要用编程 Agent 每人本机跑 claude-code-router,供应商配 1 个官方 Key + 1 个国内多模型平台 Key,路由规则设"官方 429 或超时则回退到平台"。不需要网关层。

场景二:SaaS 公司,月调用数亿到数十亿 Token,多团队 自托管 LiteLLM 或 Kong AI Gateway,虚拟 Key 按团队分预算;上游接 2 到 3 家官方 API 加 1 个聚合平台做回退;路由策略用 simple-shuffle 加权 + 按错误类型冷却。国产模型用量大的团队,把订阅制平台作为一条上游路由,用网关层的成本路由把稳定流量导过去吃折扣。

场景三:面向海外用户的应用,Next.js / Vercel 栈 直接用 Vercel AI Gateway,零加价、请求级 BYOK、sort: 'cost''ttft',模型回退与供应商超时开箱即用。

场景四:国内企业,合规要求数据不出境、要审计 Higress 或 New API 自托管,上游只接国内官方 API 与国内多模型平台;Higress 的令牌降级策略和消费者额度处理故障与成本;New API 处理格式互转与内部分发。

场景五:提示词分布极不均匀,想自动省钱 LiteLLM Auto Router 启发式模式先跑两周,看 cause= 日志里各档命中比例;再决定是否上 LLM 分类器或商业方案。不要一上来用纯算法路由替代显式规则。

十项评估清单

选任何一层的方案,逐项打勾:

  1. 协议兼容:是否同时兼容 OpenAI Chat / Responses 与 Anthropic Messages?决定能否零改动接入 Claude Code、Codex 类工具

  2. 回退触发条件:哪些错误码触发切换?Kong 默认客户端错误不触发,LiteLLM 对 429 立即冷却,差异很大

  3. 路由粒度:能否按请求头、请求体、用户元数据、预算、百分比路由?

  4. 供应商与 Key 池:同一模型能否配多个 Key 轮换?限流是否按 Key 隔离?

  5. 缓存:是否支持提示缓存透传(Anthropic 显式标记)与语义缓存?GLM-5.3 这类模型缓存命中价差 4 倍

  6. 费率结构:模型加价、充值手续费、订阅折扣、BYOK 费用分别是多少?OpenRouter 5.5%、Cloudflare 统一计费 5%、Vercel 零加价、国内订阅制 4 到 7 折

  7. 额度规则:订阅额度是否结转?按周还是按月刷新?能否降级?

  8. 数据留存:是否有零留存选项?OpenRouter zdr: true、Vercel 禁止训练开关、Portkey Enterprise VPC

  9. 可观测性:日志条数上限与留存天数(Cloudflare 免费 10 万条、Portkey Developer 1 万条 3 天);是否输出解析后的实际供应商与模型

  10. 维护活跃度:仓库最近推送时间。One API 与 RouteLLM 已明显停滞,Portkey 开源仓库 5 月后无推送,选型时要看清

常见问题

Q:多模型路由和 LLM 网关是一回事吗? 不是。网关是部署形态(一个统一入口),路由是网关里的一项能力(选模型、切供应商)。工具侧路由器和 Agent Harness 内置的 provider 路由也做路由,但不是公司级网关;托管聚合平台既是网关也是路由器。

Q:OpenRouter 默认怎么选供应商? 按价格平方反比加权随机,并排除近 30 秒有明显故障的供应商。官方例子:1 美元/百万 Token 的供应商被选中的概率是 3 美元供应商的 9 倍。指定 order 后负载均衡关闭,改为顺序尝试。

Q:自托管网关会不会成为单点故障? 会。LiteLLM 依赖 Redis 做用量路由,Bifrost 集群模式在企业版,Kong / Higress 本身有成熟的多副本部署方案。这是选云原生网关扩展而非 LLM 专用网关的主要理由之一。

Q:国内多模型平台能做路由吗? 多数只提供统一入口与计费,不对用户开放路由策略。要回退与分流,把平台作为自托管网关或工具侧路由的一条上游即可。订阅制平台的价值在折扣与"几乎无速率限制",路由交给上一层。

Q:智能路由值得上吗? 先看提示词分布。若 70% 以上请求是简单问答且能接受偶发降质,LiteLLM Auto Router 启发式模式或 OpenRouter Auto 零成本可试;若请求以复杂编程和多步推理为主,收益有限,显式规则更稳。RouteLLM 的 85% 节省数据来自 2024 年 MT Bench,不能直接外推到今天的模型组合。

Q:One API 和 New API 选哪个? New API。它兼容 One API 数据库可直接迁移,2026 年仍在活跃更新,多了格式互转、缓存计费、用户级限流;One API 仓库 2026 年 1 月后无推送。

总结

多模型路由的选型先定层再定产品:开发者本机用 claude-code-router 解决编程工具的换模与防限流;公司级流量在 LiteLLM、Kong AI Gateway、Higress、New API 中按团队技术栈和数据边界选一个自托管网关;不想运维就看 OpenRouter、Vercel AI Gateway、Cloudflare AI Gateway 或国内的订阅制多模型入口;智能路由作为网关内的一个策略逐步试,不作为架构前提。路由参数最细的是 OpenRouter,负载均衡算法最全的是 Kong,国内厂商覆盖最好的自托管方案是 Higress 与 New API,国产模型订阅折扣最直接的是 Token Plan 一类的企业套餐。

据 LiteLLM 官方文档,生产环境推荐默认的 simple-shuffle 策略而非用量路由;据 OpenRouter 文档,其默认分流按价格平方反比加权。本文数据基于 2026 年 9 月 2 日各项目 GitHub API 与官网公开信息,Star 数、费率与套餐随时变化,火山方舟条目因页面动态渲染未能核实,建议决策前逐项复核。