DeepReinforce 发布 Ornith-1.0:开源智能编码模型在 SWE-bench 上超越 Claude
DeepReinforce 于6月25日以 MIT 许可发布了 Ornith-1.0,这是一个专为智能代理 AI 任务设计的开源编码模型系列。提供四种规格(9B、31B、35B MoE、397B MoE),这些模型擅长无需人工干预的自主多步骤编码工作流。旗舰版 397B 在 SWE-bench Verified 上获得 82.4 分,击败了 Claude Opus 4.7(80.8)和 DeepSeek-V4-Pro(80.6)。在 Terminal Bench 2.1 上,它获得了 77.5 分,而 Claude 为 70.3 分。9B 变体得分为 69.4,优于 Google 的 Gemma 4-31B(52.0),几乎与 Qwen 3.5-35B(70.0)持平。Ornith 使用了一种新的训练方法,模型通过强化学习自主学习任务分解策略,与支架共同进化。然而,模型卡警告称其在非编码任务上可能表现不佳,不适合通用用途。DeepReinforce 还实施了针对奖励黑客的防御措施,包括不可变环境和确定性监控器。
关键事实
- Ornith-1.0 以 MIT 许可开源,提供 9B、31B、35B MoE 和 397B MoE 四种规格。
- 397B 旗舰版在 SWE-bench Verified 上得分 82.4,超越 Claude Opus 4.7 和 DeepSeek-V4-Pro。
- 9B 变体在 SWE-bench 上得分为 69.4,优于 Gemma 4-31B(52.0),接近 Qwen 3.5-35B(70.0)。
- 模型通过强化学习自主学习任务策略,不依赖人工设计的支架。
- 不适合通用任务,仅针对开发者管道中的智能编码任务优化。
KeyAudit 数据视角
📊 KeyAudit data: Sui historical leak records: 1682147