基准测试DeepSWE的新分数出炉,含Fable-5、Kimi K2.7 Code的跑分

路人A 2026-06-20 00:49 1

2026年6月19日的更新,新的v1.1跑分

Fable-5(70%)大于GPT5.5(67%),差距不大

Kimi K2.7 Code超越Sonnet4.6


原文:

DeepSWE



最新回复 (6)
  • 路人A 楼主 06-20 00:52
    1

    Opus4.6在v1跑分不如Sonnet4.6,且成绩才28%,

    因此四舍五入Kimi K2.7 Code(31%)大于Opus4.6(28%)


    不过跑分仅图一乐

  • 范思哲 06-20 00:54
    2

    居然没有我大 glm5.2 不合理啊

  • 路人A 楼主 06-20 00:58
    3

    GLM官方自己跑了,GLM5.2分数是46.2,可以参考一下吧


  • 海獭为什么叫海獭 06-20 01:19
    4

    最高的居然是xhigh的fable,而非max的,看来是过拟合了 ^-^

  • 咪叭 06-20 09:49
    5

    pass@1是这样的,其实我更看重多几轮pass的结果

  • unsafetrait 06-20 10:13
    6

    现在去其实都和OPUS比了,少有和SONNET比了,第一是参数规模不一样,第二,SONNET的确属于上一代模型了


    CLAUDE矩阵现在是:


    现有FABLE5 = 原有OPUS

    现有OPUS = 原有SONNET


    未来还有没有SONNET都很难说了

* 帖子来源Linux.do
返回