AI Pulse
🔥 热点深度解读

这个开源大模型性能赶上 Claude Opus 了?

有人每年花大几千订阅商业AI服务写代码、搭工作流,现在开源社区拿出了性能接近顶级闭源模型的平替。

刚刚发布的Ornith-1.5,是一个面向智能体构建的开源大语言模型家族,包含9B Dense、35B MoE、397B MoE三个不同尺寸的模型。它采用自改进策略训练,在推理、智能体、代码任务上的跑分,已经和Claude Opus 4.8性能相当。

这款模型在多个公开基准测试中拿到了不错的成绩:Terminal-Bench 2.1得分86.1,SWE-Bench验证集得分86、专业集得分65.1、多语言集得分79.6,DeepSWE得分56,HLE得分44.6,ClawEval得分81.4,Tool Decathlon得分71.2,还在所有测试项中超过了GLM-5.2和DeepSeek-V4-Flash-0731。

旧版的代码智能体一直存在一个常见问题:会重复犯相同的错误,也没办法在运行出错后重新规划路径。而Ornith系列从1.0版本开始,就采用自改进训练策略解决这个问题,训练基于Qwen和Gemma 4开展。

@TeksEdge 认为:这可能是近期见过的最与众不同的开源模型发布。
@MiaAI_lab 认为:35B MoE是最有意思的版本,目前还没有同尺寸的Qwen模型,很快会测试这个版本。

现在想要做能自动跑完全流程的代码智能体,不用再依赖闭源商业模型的API了。只要你有对应的运行环境,就能直接调用这个开源模型,搭建属于自己的自动化开发流程,不用按调用次数付API费用,也不用担心数据隐私泄漏。

行业统计显示,2026年能无监督运行多步骤开发工作流的智能体,是商业进展最多的AI方向。现在开源赛道先跑出了性能接近顶流闭源的模型,下一步会不会有更多小团队用它做出原来做不出的产品?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新