Ornith-1.5系列模型开源发布 397B MoE、35B MoE、9B三箭齐发 最强性能对标Opus-4.8

fengchris 2026-08-19 22:55 1

官方博客:Ornith-1.5: From Self-Scaffolding to Self-Improvement | Ornith Blog





Ornith-1.5-397B





































































































































































































Benchmark Ornith-1.5
(397B)
DeepSeek-V4-Flash-0731
(284B)
GLM-5.2
(753B)
Claude Opus 4.8 Kimi K3
(2.8T)
Ornith-1.0
(397B)
Coding
Terminal Bench 2.1 (Terminus-2) 86.1 82.7 81 85 88.3 77.5
Terminal Bench 2.1 (Claude Code) 85.2 81.8 82.7 78.9 78.2
SWE-bench Verified 86 81.6 83 85.8 86.2 82.4
SWE-bench Pro 65.1 64.4 62.1 68 62.2
SWE-bench Multilingual 79.6 77.9 78.4 75.7 78.9
DeepSWE 56 54.4 46.2 59 67.5 8
Frontier-Bench v0.1 13.5 6.1 5.1 21.1 23 2.7
NL2Repo 59.5 54.2 48.9 69.7 48.2
SWE Atlas – QnA 55.6 51.6 50 59.7 59.7 41.2
Reasoning
HLE (no tools) 44.6 35 40.5 49.8 43.5 30.2
HLE (with tools) 56.1 50.8 54.7 57.9 56 47.5
GPQA Diamond 92.8 91.4 91.2 93.6 93.5 88.1
Agentic
MCP-Atlas 80 74.6 77.8 82.2 82.3 76.4
Toolathlon-Verified 71.2 70.3 48.2 76.2 73.2 43.2
WideSearch 80.8 77.3 79 72.9 75.2
BrowseComp 86.6 84.8 85.6 84.3 91.2 79.7
ClawEval 81.4 77.6 78.8 80.2 77.1

Ornith-1.5-35B





































































































































































































Benchmark Ornith-1.5-35B-A3B Ornith-1.0-35B-A3B Qwen3.6-35B-A3B Gemma-4-31B
(dense)
Muse-Glimmer-30B
(dense)
Qwen3.5-397B
(397B)
Coding
Terminal Bench 2.1 (Terminus-2) 67.8 64.2 52.5 42.1 51.7 53.5
Terminal Bench 2.1 (Claude Code) 68.5 62.8 49.2 48.6
SWE-bench Verified 79 75.6 73.4 52 76 76.4
SWE-bench Pro 59.6 50.4 49.5 35.7 51.2 51.6
SWE-bench Multilingual 71.4 69.3 67.2 51.7 69.3
DeepSWE 22 0 0 1
Frontier-Bench v0.1 5.1 1.4 1.4 1.4
NL2Repo 46.2 34.6 29.4 15.5 36.8
SWE Atlas – QnA 39.8 37.1 15.5 20.4
Reasoning
HLE (no tools) 25.6 20.8 21.4 19.5 22 28.7
HLE (with tools) 33.4 30.1 28.9 26.5 48.3
GPQA Diamond 89.2 86.2 86 84.3 83.5 88.4
Agentic
MCP-Atlas 70.2 64.4 62.8 55 75.5 72.3
Toolathlon-Verified 48.7 42.4 41.7 40.8 38.3
WideSearch 67.8 63.4 60.1 54.2 74
BrowseComp 67.6 63.5 62 78.6
ClawEval 72.5 69.8 68.7 48.5 70.7

Ornith-1.5-9B
































































































































































Benchmark Ornith-1.5-9B Ornith-1.0-9B Qwen3.5-9B Qwen3.6-35B-A3B Gemma-4-31B
(dense)
Coding
Terminal Bench 2.1 (Terminus-2) 46.2 43.1 21.3 52.5 42.1
Terminal Bench 2.1 (Claude Code) 47 40.6 18.9 49.2
SWE-bench Verified 70.6 69.4 53.2 73.4 52
SWE-bench Pro 47.5 42.9 31.3 49.5 35.7
SWE-bench Multilingual 54.4 52 39.7 67.2 51.7
NL2Repo 32.4 27.2 16.2 29.4 15.5
SWE Atlas – QnA 20.6 17.9 9.2 15.5
Reasoning
HLE (no tools) 20.2 16.8 14.7 21.4 19.5
HLE (with tools) 30.5 26.4 24.5 28.9 26.5
GPQA Diamond 86.4 82.5 81.7 86 84.3
Agentic
MCP-Atlas 54.2 49.4 46.8 62.8 55
Toolathlon-Verified 41.2 33.4 29.6 41.7 52.8
WideSearch 59.5 55.8 53.6 60.1 54.2
BrowseComp 56.4 44.8 41.5 62
ClawEval 66.5 63.1 53.2 68.7 48.5

权重:Ornith-1.5 - a ornith-ai Collection

最新回复 (9)
  • 厢叶枫 08-19 22:56
    1

    我去,这么厉害,我得压力我们领导配置一个厉害的设备了。 ^-^

  • bigfz 08-19 23:00
    2

    现在都流行跑分没输过,实测就是一坨

  • 杨密 08-19 23:00
    3

    这不都是 Qwen 3.5 的参数量嘛。

    不过我没看官方介绍,应该是拿它们继续炼的吧

    我倒希望它们练练 DeepSeek v4 flash 0731

  • fengchris 楼主 08-19 23:04
    4

    确实是在Gemma 4和Qwen 3.5上后训练的 说明后训练的上限很高

  • 大喵喵 08-19 23:06
    5

    等会儿看实测数据,不知道 amd 370w 能不能跑

  • mikey 08-19 23:13
    6

    感谢分享。gguf 都有了 ornith-ai/Ornith-1.5-35B-A3B-GGUF at main q4 好像可以在 kaggle 2xT4 上跑起来


    llama-cpp-qwen3.8-27b-share | Kaggle 改模型名应该就能直接跑起来

  • 轻吻也飘然 08-19 23:19
    7

    之前部署过1.0的397版本是傻快傻快的,但是注意力很差,一些要求执行过程中就丢掉了,而且很容易自己陷入死循环,不知道这次1.5咋样

  • MineMine 08-19 23:25
    8

    哇哦,397B 全面超过 Flash‑0731

  • 无名氏 08-20 14:09
    9

    这个分数这么高 必须找个小模型跑起来试试

* 帖子来源Linux.do
返回