2026年6月,DeepReinforce AI 发布 Ornith-1.0,一款采用自改进训练框架的开源编程智能体。与传统编程模型不同,Ornith-1.0 使用强化学习同时学习"如何组织解题过程"。在 Terminal-Bench 2.1、SWE-bench Verified、SWE-bench Pro 等权威基准测试中,同等规模开源模型里达到领先水平。项目采用 MIT 许可证,商业应用完全免费授权。
1 技术原理:自改进训练框架
传统编程模型采用监督学习范式,给定问题描述和参考解决方案进行训练。这种方式让模型学会"怎么解题",但对"如何组织解题过程"的建模能力有限。
Ornith-1.0 的核心创新在于自改进训练框架,使用强化学习同时学习两件事:
- rollouts(执行轨迹):解决方案的完整执行路径
- scaffold(脚手架代码):驱动执行轨迹的辅助框架
脚手架代码是为解决问题而编写的辅助性代码,本身不直接产生最终答案,但为解决方案的执行提供框架和上下文。例如,处理代码重构任务时,脚手架代码可能包括测试用例设置、环境配置、断言逻辑等。
通过联合优化 scaffold 和解决方案,模型能够发现更好的搜索轨迹。Ornith-1.0 学习的是在更高层次上组织问题解决过程:何时进行搜索、如何分解问题、如何验证答案。
这种能力的提升来源于脚手架和解决方案的联合优化:脚手架的质量直接影响解决方案的执行效果,而解决方案的效果又反馈给脚手架的改进,形成正向循环。
模型规格
Ornith-1.0 提供四种规格:
| 规格 | 架构 | 特点 |
|---|---|---|
| 9B-Dense | 密集架构 | 适合消费级硬件部署 |
| 31B-Dense | 密集架构 | 平衡性能与资源消耗 |
| 35B-MoE | 混合专家架构 | 稀疏激活,推理效率高 |
| 397B-MoE | 混合专家架构 | 早期开发阶段 |
2 基准测试表现
Terminal-Bench 2.1
评估智能体在终端环境下解决问题的能力。
| 模型 | 得分 |
|---|---|
| Ornith-1.0-35B | 64.2 |
| Qwen3.6-35B | 52.5 |
| Qwen3.5-35B | 41.4 |
| Gemma4-31B | 42.1 |
Ornith-1.0-35B 大幅领先同规模模型,表明其在终端操作和命令行问题解决方面有显著优势。
SWE-bench Verified
评估模型解决真实软件工程问题的能力。
| 模型 | 得分 |
|---|---|
| Ornith-1.0-35B | 75.6 |
| Qwen3.6-35B | 73.4 |
| Qwen3.5-35B | 70.0 |
SWE-bench Pro
更具挑战性的软件工程基准。
| 模型 | 得分 |
|---|---|
| Ornith-1.0-35B | 50.4 |
| Qwen3.6-35B | 49.5 |
| Qwen3.5-35B | 44.6 |
在 35B 规模的开源模型中,Ornith-1.0-35B 在所有主要基准上均取得领先。397B MoE 模型的详细数据预计在后续版本发布。
3 适用场景
代码审查与 Bug 修复
Ornith-1.0 在 SWE-bench 系列测试中展现了处理真实软件工程问题的能力。它能够理解代码上下文、定位问题根源并生成修复方案。对于需要处理大量代码库 issue 的团队,这种能力可以显著提升问题处理效率。
终端自动化
Terminal-Bench 的测试结果表明 Ornith-1.0 擅长在命令行环境下工作。它可以用于自动化运维任务、脚本生成、终端问题诊断等场景。
编程辅助
模型对问题解决过程的理解意味着它能够提供更高层次的编程辅助。例如,不仅给出代码片段,还能解释为什么这样写,并提供多种可选方案。
4 许可证与社区
Ornith-1.0 采用 MIT 许可证,允许免费使用、复制、修改、合并、发布、分发、再授权和销售软件,没有任何地区限制。这对商业应用完全友好。
项目当前处于非常活跃的早期开发阶段。GitHub 数据显示,首次提交在 2026 年6月21日,最近一次提交在 2026年6月27日。
5 总结与建议
Ornith-1.0 的自改进训练框架通过联合优化脚手架代码和解决方案,使模型能够在更高层次上组织问题解决过程。
采用建议:
- 评估阶段:在非生产环境中进行充分测试,验证模型在具体业务场景中的实际表现
- 版本跟踪:由于项目处于早期开发阶段,需要建立版本跟踪机制,及时获取更新并评估其影响
- 集成方式:考虑是将模型作为独立工具使用,还是集成到现有开发环境中