openJiuwen X-Router:自演进模型路由技术,让 Agent 成本降 50%

15 阅读1分钟

背景

AI Agent 应用正面临现实困境:大多数系统用单一模型处理所有任务,无论简单翻译还是复杂代码调试,调用的都是同一个千亿参数强模型。这导致简单任务造成成本浪费,复杂任务交给轻量模型则效果不稳定。

随着模型生态快速分化,开发者面临越来越多选择:有的推理能力强但昂贵且慢,有的轻量快速但只能处理简单任务。如何为每个任务选择最合适的模型,成为 Agent 规模化落地的关键门槛。Agent 的多轮、多工具持续工作特性会使 Token 消耗成倍放大。

华为 2012 实验室、华为云等团队联合构建的开源 AI Agent 平台 openJiuwen,推出智能路由技术,在 Agent 与模型之间增加一层智能决策能力,根据任务复杂度动态选择最优模型。

核心原理

openJiuwen 智能路由体系分为三层,分别解决"认识能力"、"做出决策"和"持续优化"三个问题。

第一层是精准画像。系统基于历史数据为每个模型构建能力画像,包含代码能力、数学能力等维度评分,细化到不同任务类型、难度、时延功耗特性和成本量级。模型版本变动时,画像会在 1 分钟内动态更新。

第二层是决策机制。系统不仅分析当前问题,还考察整个对话轨迹和系统状态,综合判断 KV 缓存亲和度、实时负载、目标可用性。通过启发式优化算法在质量、成本、时延、上下文和工具支持等约束下选出综合最优模型。

第三层是自演进能力。系统采用状态解耦设计:算法是纯函数,给定相同请求和状态快照必然给出相同决策;所有跨请求的记忆外置到独立的状态层;每次调用结束后,宿主将执行结果回报给系统,反馈写入状态层成为下一轮决策输入。状态丢失时系统降质为"冷路由"而不会失败。系统通过 Contextual Bandit 和轻量强化学习从真实反馈中持续提取经验,支持画像更新、算法替换等独立迭代。

已落地的 x-router 算法采用五档复杂度分级(SIMPLE 到 REASONING),配合本地部署的 Qwen3-0.6B 分类器直接在进程内运行。简单任务优先使用轻量模型,复杂任务按需升级——查询概念定义走轻量模型,编写脚本走通用或高能力模型,多文档研究走研究型模型,数学证明才交给推理模型。

实测效果与局限

在 PinchBench 全量 147 个任务评测中,x-router 静态路由模式得分 66.3%、成本 8.25 美元,相比全量调用 Kimi-K2-Thinking(得分 71.36%、成本 11.11 美元)得分下降 5.1%,成本降低 25.7%。开启 Bandit 自演进后,成本降至 6.16 美元(较静态路由再降约 25.3%),得分提升至 70.70%。与全云基线相比,自演进模式得分仅低 0.66 个百分点,模型调用成本降低约 44.6%。

在 Terminal-Bench/LLMRouterBench 评测中,基于 Opus4.8/Qwen3.5-122B/Qwen3.5-35B 三档模型池,cost focused 模式下成本降低 51.4%,成功率达 Opus 的 95.2%;quality focused 模式下成本降低 15.7%,成功率达 Opus 的 98.6%。

当前技术存在明确局限。决策质量依赖模型画像准确性,新模型需要时间积累数据才能形成可靠画像。自演进机制在样本不足或优势不明显时会保留原判定,使用初期可能无法立即达到最优效果。系统设计为"决策与执行分离",路由层只负责推荐模型,具体调用由宿主完成,要求集成方具备一定工程能力。

对开发者的意义

openJiuwen 智能路由提供统一、可嵌入的路由框架,支持端侧、云侧、企业私有化、端云混合等多种部署形态。端侧形态在单进程、内存态、零外部依赖条件下运行,决策开销可忽略;云侧形态状态层外置,决策依据来自全局模型表现与负载视图;企业私有化形态策略与数据留在本地;端云混合形态端侧判断简单任务自行处理,复杂任务交给云端。

系统内核用 Rust 编写,Python 侧通过 PyO3 扩展调用。安装后通过 TOML 文件配置算法类型、状态管理和模型池,调用时发起请求、获取决策、宿主执行模型调用、回报结果即可完成闭环。Rust 宿主可直接静态链接 openjiuwen-runtime。

团队后续计划推出路由策略强化学习训练等更多自演进能力,让短期经验沉淀为更稳定的长期策略。openJiuwen 智能路由已开源,相关代码和文档可在 AtomGit、GitHub 上获取。对于需要在成本与质量之间做精细权衡的 Agent 应用,这套技术提供了可落地的实现路径。