Qwen 3.7 Max 测试结果

坐忘 2026-06-03 18:22 1

今天发现Qoder送了300 credits,正好用来测Qwen 3.7 Max。


慕容复老师(Qwen)的逆袭


新增 Qwen 3.7 Max。凭借外挂 Spec,慕容复老师已经能和 GPT 5.5 掰手腕了。



使用Qoder的Spec驱动模式,Qwen 3.7 Max 解决了表面问题。第二层深度问题提供三个方案,最好的方案和 GPT 5.4 相同,这点不及 Opus 4.7GPT 5.5Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,没有本地规避,不及 GTP 5.5。是第二个发现第三层bug的老师。



我也顺手把 3.7 Plus 测了,同样使用了 Spec,同 claude 4.6 Sonnet


MiMo V2.5 Pro 验证 Spec 加持


为了排除 Max 是不是因为 Spec 加持才取得如此好的成绩,我把 MiMo V2.5 Pro 放到 Qoder,同样用 Spec,效果竟然同 mimo-v2-prov2.5 刚上线的时候就不稳定,现在直接降智成v2.0了。





这足以说明Spec只是锦上添花,Qwen 3.7 Max本身就有实力。





顺手测试 DeepSeek v4


我又顺手测试 DeepSeek v4,同样使用了 Spec。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同 GPT 5.5,也是第三个发现三层bug的老师。







补充说明


至于 MiniMax 老师为什么排名那么高,我只是如实反映当时的测试结果,6.1上午测的。需要补充的是,到6.2上午测已降智,今天上号 opencode免费已经取消了,就没再测。





👉 点击展开/折叠 按时间顺序的原始测试数据

祖传bug测了几个模型的能力:


C++ 代码的bug,有三层修复深度:1. 表面问题 2. 深层问题 3. 引用库里的问题



  1. minimax 2.7: 未发现问题。提示到具体代码行,仍然不承认有问题。

  2. mimo-v2-pro: 怀疑到具体行数,这个位置是对的,但最终判定不是bug。

  3. glm 5: 发现并解决问题,但只从表面上解决了。

  4. claude 4.6 opus: 发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。

  5. GPT 5.4 xhigh: 发现了用户都没想到的深层问题,自动修改,一次改对。

  6. kimi-2.5:未发现问题。然后提示代码行号,态度转变发现并解决表面问题。同时发现深层问题,但改错了。(速度很慢,比GTP还慢)

  7. Gemini 3.1 pro preview(Copilot): 同glm 5。(速度快,比其他快10倍)

  8. claude 4.6 Sonnet: 发现并解决表面问题。发现深层问题,但改错了。和kimi-2.5错的一样。

  9. glm 5.1: 同claude 4.6 Sonnet。

  10. doubao-seed-2.0-code: 同kimi-2.5

  11. qwen3.6-plus preview free: 同glm 5

  12. stepfun/step-3.5-flash:free: 同glm 5.1。

  13. Gemini 3.1 pro (Antigravity): 发现了用户都没想到的深层问题,自动修改,一次改对。深层次问题用最少的代码修复,比GPT 5.4灵性。

  14. kimi-k2.6: 同claude 4.6 opus。

  15. GPT 5.5 xhigh: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。

  16. deepseek v4 pro (stepFun路由,思考强度未知):同claude 4.6 opus,能提示潜在问题,也分析的透彻。太慢了11分钟,26个请求,所有测试里最慢的。

  17. claude 4.7 opus max: 同claude 4.6 opus,对于潜在问题没有自动处理,提出3个选项,第一个选项是Gemini 3.1 pro (Antigravity)那个改动最少,最灵性的。耗时2分钟,15个请求。

  18. mimo-v2.5-pro: 同claude 4.6 opus。耗时2分钟。共测试4次,有2次没检查出问题,不稳定。

  19. 新增Gemini 3.5 Flash (High) (Antigravity 2.1): 未发现问题。提示到具体代码行,只从表面上解决了。速度非常快,42秒。

  20. MiniMax M3 Free: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。表现大于GPT 5.4 xhigh。

    • 使用的是opencode免费版,耗时7m51s。看思考过程,该想到的都想到了,不该读的文件也读了,行为和deepseek v4有点像。如果使用token plan和MiniMax code,也许速度会快点。



  21. Qwen 3.7 Max: Qoder IDE,开启Spec驱动。Max解决了表面问题。第二层深度问题提供三个方案,最好的方案和GPT 5.4相同,这点不及Opus 4.7,GPT 5.5合Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,却没有本地规避,不及GTP 5.5。是第二个发现第三层bug的老师。

  22. Qwen 3.7 Plus: Qoder IDE,开启Spec驱动。同claude 4.6 Sonnet。

  23. DeepSeek V4 Pro: Qoder IDE,开启Spec驱动。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同GPT 5.5,也是第三个发现三层bug的老师。但第二层改错了。


最新回复 (19)
  • 葫芦里面有葫芦 06-03 18:25
    1

    glm5.1 配合 qoder 的 spec 也测一下吧,感觉跟 这个对比才能体现出 是大概什么水平。

  • 坐忘 楼主 06-03 18:26
    2

    测完这3个,credits快用完了,glm5.1测了个开头

  • hallfay 06-03 18:30
    3

    之前测试minimax m3,超过gpt 5.4 xhigh的是你吧,还有这个你说的也是什么表面问题什么深层问题,你发个测试集行不行,你现在的这个所谓的测试和造谣有什么区别

  • MineMine 06-03 18:41
    4

    有开放 benchmark 吗?看看你的提示词和工作流设计。

  • 坐忘 楼主 06-03 18:53
    5

    生产代码,不方便公开。最开始测试是给选coding plan做参考,越测越多,就分享一下。

  • cherryfrei 06-03 18:58
    6

    opus 4.6 和 glm是不是都打低了?

  • 坐忘 楼主 06-03 19:05
    7

    这两个换harness复测过两次,结果完全一致。我也一直很质疑是不是没发挥好,因为他俩太典型了。

  • kimi 06-03 19:13
    8

    Gemini 3.1 放在 Opus 4.6 上面已经不用看了。


    但是我这几天使用免费Qoder的感觉是能打的,至少不比GLM5.1 差了

    可以当成生产工具的作用

  • beyonca 06-03 19:59
    9

    Qoder



    怎么没有完整的glm5.1 测试呢

  • 栏杆拍遍 06-03 20:43
    10

    想起来了,你就是昨天那个说话说不明白像ai发言的吹m3的那个佬友

  • LoopOuroboros 06-03 20:59
    11

    野榜至少还有题集,这个测试只有一句祖传BUG ^-^(公司代码,BUG都描述不明白)

  • 润之 06-03 21:05
    12

    对于deepseek v4 flash和pro的排名符合我的体感,pro尚可一战,flash傻快,连D家引以为傲的文本细腻拟人特性也没有。那些无脑吹flash的人真的有干过深度的活吗

  • cherryfrei 06-03 21:07
    13

    我觉着没必要说吹不吹,每个人代码场景不一样、环境配置也不同,ai跑出来的感受差异很大

  • 润之 06-03 21:07
    14

    还有mimo,我这里也深度在hermes用过几天,做调研工作,或者搓小工具,体感上和minimax m2.7极为类似,结果这个最近也被吹上天了 ^-^

  • 栏杆拍遍 06-03 21:10
    15

    如果正常评测也就 算了,昨天那个帖子,只有一个排名和打分,具体是啥也不说明白,然后楼主说的话前言不搭后语,像是小龙虾从英文直译过来的,都不符合中国人阅读的顺序 ,所以才都调侃他,但凡正经评测的我都不会去说的

  • 坐忘 楼主 06-03 21:38
    16

    如果喜欢用pro,我推荐一个。command code,一刀套餐,可用40刀pro额度。特色是解决tool calling成功率问题,再次降低成本

  • 坐忘 楼主 06-03 21:40
    17

    我没买,套餐够了,用不过来。

  • clzero 06-08 18:00
    18

    看完我第一时间进入评论区找数据支撑,果然还是有人发现了问题 ^-^

  • Caphhh 06-19 02:45
    19

    纯野榜 还曾把 minimax 测成国模第一 ^-^

* 帖子来源Linux.do
返回