openclaw作者说这是衡量AI模型编程水平最好最权威的榜单,佬们看看符合你们的认知吗?

dong 2026-06-25 20:31 1

deepswe,据说是最权威的榜单。






我感觉挺准的,

例如gpt性能最强(除去被米国封掉的claude fable5),

再例如glm5.2也并没有大家吹的那么厉害 glm5.2是除了gpt和claude之外编程能力最强的模型,国人之光。

另外deepseek v4有那么差吗?倒数第二。gemini有那么差吗?倒数第一,我平时用它俩轻度写点代码还可以啊(没钱用gpt和claude​^-^^-^^-^)






最新回复 (19)
  • hlool 06-25 20:33
    1

    肥波5比gpt高百分之20+的体感,感觉也不太准

  • Hifumi Mizuhara 06-25 20:33
    2

    Opus 4.6 < 3.5 Flash?


    虽然早就知道这个榜了


    但是难以恭维这个点,毕竟都曾经重度使用过

  • dong 楼主 06-25 20:34
    3

    从图表上看,fable5比gpt只高3%,何况它现在用不了

  • 还是不懂 06-25 20:35
    4

    这一套测试集是需求比较明确的long horizon(感觉偏debugging这种, 或者是加一个功能,但是提供明确的边界

    是gpt系列的强项

    gpt这种感觉不适合探索性的vibe,容易搞成一坨

  • neteroster 06-25 20:36
    5

    然而现在 codex 订阅和 API 用的(测试一般用API)GPT 是很可能不一样的,codex 订阅reasoning 516截断就老实了… OpenAI 似乎在 codex 上大范围测试风控降智机制,作为曾经的gpt/oai吹我现在是彻底吹不动了,目前opus+glm+composer组合用的比之前爽多了


    另外说回来,任何榜单都会有bias,应当仔细看看他的任务是不是符合你的用例

  • dong 楼主 06-25 20:36
    6

    你重度使用是用来编程吗?另外最下面那个榜单opus4.6比3.5flash高一名

  • puppywang 06-25 20:37
    7

    这哥们现在是openai的员工,你觉得他的屁股能正么?

  • dong 楼主 06-25 20:37
    8

    gpt解决其他模型解决不了的疑难问题还是厉害的

  • Hifumi Mizuhara 06-25 20:38
    9

    是的


    但是我看到opus4.6低于3.5 Flash啊,你给的图


    3.5 Flash被低估了确实是有一点,但是不能和opus 4.6相比

  • Rene 06-25 20:38
    10

    openclaw作者不都入职 CloseAI 了吗,真能客观到哪儿去 ^-^

  • dong 楼主 06-25 20:38
    11

    就不能是他因为gpt强所以才入职的吗 ^-^

  • 卡里姆•汗 06-25 20:39
    12

    glm确实没有这么厉害,但是不错前端加gpt5.5(high)六七成后端足够下位替代了,我现在一般是全程glm5.2,出问题了修不了才gpt5.5(high),做后期难题的修理工作

  • dong 楼主 06-25 20:40
    13

    composer是啥?

    你写个代码要用三个模型?好麻烦。

    另外现在谁都降智,我常用的gemini pro就降成傻子了

  • Hifumi Mizuhara 06-25 20:40
    14

    composer是cursor基于kimi2.5整出来的


    Gemini pro有没有不降智的时候^-^

  • dong 楼主 06-25 20:41
    15

    既然出问题修不了用gpt,那为啥不全程用gpt,把问题消灭在萌芽中?

  • lanvent 06-25 20:42
    16

    排名很符合体感,实测glm 5.2在复杂任务确实不咋样

  • dong 楼主 06-25 20:45
    17

    那些吹glm5.2的是不是都收费了^-^

  • neteroster 06-25 20:45
    18

    composer2.5是cursor的模型


    opus 只是在少数复杂任务情况用,主用 glm-5.2,composer太快了所以有的时候还是忍不住用,有的时候快就是好。glm 我用 opencode go + fireworks 之前的赠金账户,并不降智(第三方提供商很少有精力搞这些乱七八糟的)


    我觉得gpt的优点是问题解决能力强,也就是“完成目标”这一点好,但单论设计和代码taste我真的觉得不如上述任意一个,写一堆兜底代码,很多任务中使用很保守的参数导致很诡异的问题etc… 也许哪一天我遇到上面模型都解决不了的问题还会找回gpt

  • 卡里姆•汗 06-25 20:46
    19

    答案是诗人前端,gpt各方便都好,就是私人前端,不然我也不会专门买kimi来补,但是发现还是glm好

* 帖子来源Linux.do
返回