今天发现Qoder送了300 credits,正好用来测Qwen 3.7 Max。
慕容复老师(Qwen)的逆袭
新增 Qwen 3.7 Max。凭借外挂 Spec,慕容复老师已经能和 GPT 5.5 掰手腕了。
使用Qoder的Spec驱动模式,Qwen 3.7 Max 解决了表面问题。第二层深度问题提供三个方案,最好的方案和 GPT 5.4 相同,这点不及 Opus 4.7,GPT 5.5 和 Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,没有本地规避,不及 GTP 5.5。是第二个发现第三层bug的老师。
我也顺手把 3.7 Plus 测了,同样使用了 Spec,同 claude 4.6 Sonnet。
MiMo V2.5 Pro 验证 Spec 加持
为了排除 Max 是不是因为 Spec 加持才取得如此好的成绩,我把 MiMo V2.5 Pro 放到 Qoder,同样用 Spec,效果竟然同 mimo-v2-pro。v2.5 刚上线的时候就不稳定,现在直接降智成v2.0了。
这足以说明Spec只是锦上添花,Qwen 3.7 Max本身就有实力。
顺手测试 DeepSeek v4
我又顺手测试 DeepSeek v4,同样使用了 Spec。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同 GPT 5.5,也是第三个发现三层bug的老师。

补充说明
至于 MiniMax 老师为什么排名那么高,我只是如实反映当时的测试结果,6.1上午测的。需要补充的是,到6.2上午测已降智,今天上号 opencode,免费已经取消了,就没再测。
👉 点击展开/折叠 按时间顺序的原始测试数据
祖传bug测了几个模型的能力:
C++ 代码的bug,有三层修复深度:1. 表面问题 2. 深层问题 3. 引用库里的问题
- minimax 2.7: 未发现问题。提示到具体代码行,仍然不承认有问题。
- mimo-v2-pro: 怀疑到具体行数,这个位置是对的,但最终判定不是bug。
- glm 5: 发现并解决问题,但只从表面上解决了。
- claude 4.6 opus: 发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。
- GPT 5.4 xhigh: 发现了用户都没想到的深层问题,自动修改,一次改对。
- kimi-2.5:未发现问题。然后提示代码行号,态度转变发现并解决表面问题。同时发现深层问题,但改错了。(速度很慢,比GTP还慢)
- Gemini 3.1 pro preview(Copilot): 同glm 5。(速度快,比其他快10倍)
- claude 4.6 Sonnet: 发现并解决表面问题。发现深层问题,但改错了。和kimi-2.5错的一样。
- glm 5.1: 同claude 4.6 Sonnet。
- doubao-seed-2.0-code: 同kimi-2.5
- qwen3.6-plus preview free: 同glm 5
- stepfun/step-3.5-flash:free: 同glm 5.1。
- Gemini 3.1 pro (Antigravity): 发现了用户都没想到的深层问题,自动修改,一次改对。深层次问题用最少的代码修复,比GPT 5.4灵性。
- kimi-k2.6: 同claude 4.6 opus。
- GPT 5.5 xhigh: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。
- deepseek v4 pro (stepFun路由,思考强度未知):同claude 4.6 opus,能提示潜在问题,也分析的透彻。太慢了11分钟,26个请求,所有测试里最慢的。
- claude 4.7 opus max: 同claude 4.6 opus,对于潜在问题没有自动处理,提出3个选项,第一个选项是Gemini 3.1 pro (Antigravity)那个改动最少,最灵性的。耗时2分钟,15个请求。
- mimo-v2.5-pro: 同claude 4.6 opus。耗时2分钟。共测试4次,有2次没检查出问题,不稳定。
- 新增Gemini 3.5 Flash (High) (Antigravity 2.1): 未发现问题。提示到具体代码行,只从表面上解决了。速度非常快,42秒。
- MiniMax M3 Free: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。表现大于GPT 5.4 xhigh。
- 使用的是opencode免费版,耗时7m51s。看思考过程,该想到的都想到了,不该读的文件也读了,行为和deepseek v4有点像。如果使用token plan和MiniMax code,也许速度会快点。
- Qwen 3.7 Max: Qoder IDE,开启Spec驱动。Max解决了表面问题。第二层深度问题提供三个方案,最好的方案和GPT 5.4相同,这点不及Opus 4.7,GPT 5.5合Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,却没有本地规避,不及GTP 5.5。是第二个发现第三层bug的老师。
- Qwen 3.7 Plus: Qoder IDE,开启Spec驱动。同claude 4.6 Sonnet。
- DeepSeek V4 Pro: Qoder IDE,开启Spec驱动。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同GPT 5.5,也是第三个发现三层bug的老师。但第二层改错了。