Ornith-1.0 自改进编程智能体:技术原理与基准分析

3 阅读4分钟

2026年6月,DeepReinforce AI 发布 Ornith-1.0,一款采用自改进训练框架的开源编程智能体。与传统编程模型不同,Ornith-1.0 使用强化学习同时学习"如何组织解题过程"。在 Terminal-Bench 2.1、SWE-bench Verified、SWE-bench Pro 等权威基准测试中,同等规模开源模型里达到领先水平。项目采用 MIT 许可证,商业应用完全免费授权。

1 技术原理:自改进训练框架

传统编程模型采用监督学习范式,给定问题描述和参考解决方案进行训练。这种方式让模型学会"怎么解题",但对"如何组织解题过程"的建模能力有限。

Ornith-1.0 的核心创新在于自改进训练框架,使用强化学习同时学习两件事:

  • rollouts(执行轨迹):解决方案的完整执行路径
  • scaffold(脚手架代码):驱动执行轨迹的辅助框架

脚手架代码是为解决问题而编写的辅助性代码,本身不直接产生最终答案,但为解决方案的执行提供框架和上下文。例如,处理代码重构任务时,脚手架代码可能包括测试用例设置、环境配置、断言逻辑等。

通过联合优化 scaffold 和解决方案,模型能够发现更好的搜索轨迹。Ornith-1.0 学习的是在更高层次上组织问题解决过程:何时进行搜索、如何分解问题、如何验证答案。

这种能力的提升来源于脚手架和解决方案的联合优化:脚手架的质量直接影响解决方案的执行效果,而解决方案的效果又反馈给脚手架的改进,形成正向循环。

模型规格

Ornith-1.0 提供四种规格:

规格架构特点
9B-Dense密集架构适合消费级硬件部署
31B-Dense密集架构平衡性能与资源消耗
35B-MoE混合专家架构稀疏激活,推理效率高
397B-MoE混合专家架构早期开发阶段

2 基准测试表现

Terminal-Bench 2.1

评估智能体在终端环境下解决问题的能力。

模型得分
Ornith-1.0-35B64.2
Qwen3.6-35B52.5
Qwen3.5-35B41.4
Gemma4-31B42.1

Ornith-1.0-35B 大幅领先同规模模型,表明其在终端操作和命令行问题解决方面有显著优势。

SWE-bench Verified

评估模型解决真实软件工程问题的能力。

模型得分
Ornith-1.0-35B75.6
Qwen3.6-35B73.4
Qwen3.5-35B70.0

SWE-bench Pro

更具挑战性的软件工程基准。

模型得分
Ornith-1.0-35B50.4
Qwen3.6-35B49.5
Qwen3.5-35B44.6

在 35B 规模的开源模型中,Ornith-1.0-35B 在所有主要基准上均取得领先。397B MoE 模型的详细数据预计在后续版本发布。

3 适用场景

代码审查与 Bug 修复

Ornith-1.0 在 SWE-bench 系列测试中展现了处理真实软件工程问题的能力。它能够理解代码上下文、定位问题根源并生成修复方案。对于需要处理大量代码库 issue 的团队,这种能力可以显著提升问题处理效率。

终端自动化

Terminal-Bench 的测试结果表明 Ornith-1.0 擅长在命令行环境下工作。它可以用于自动化运维任务、脚本生成、终端问题诊断等场景。

编程辅助

模型对问题解决过程的理解意味着它能够提供更高层次的编程辅助。例如,不仅给出代码片段,还能解释为什么这样写,并提供多种可选方案。

4 许可证与社区

Ornith-1.0 采用 MIT 许可证,允许免费使用、复制、修改、合并、发布、分发、再授权和销售软件,没有任何地区限制。这对商业应用完全友好。

项目当前处于非常活跃的早期开发阶段。GitHub 数据显示,首次提交在 2026 年6月21日,最近一次提交在 2026年6月27日。

5 总结与建议

Ornith-1.0 的自改进训练框架通过联合优化脚手架代码和解决方案,使模型能够在更高层次上组织问题解决过程。

采用建议:

  1. 评估阶段:在非生产环境中进行充分测试,验证模型在具体业务场景中的实际表现
  2. 版本跟踪:由于项目处于早期开发阶段,需要建立版本跟踪机制,及时获取更新并评估其影响
  3. 集成方式:考虑是将模型作为独立工具使用,还是集成到现有开发环境中