模型测评:GLM-5.2 大战 Claude Opus 4.8

坐忘 2026-06-14 19:36 1

^-^ 祖传 Bug 模型大比拼:GLM-5.2 Thinking vs Claude Opus 4.8 Max 最新实测


^-^ 最新模型测试战报


^-^ GLM-5.2 Thinking (ZCode 3.0):


96分。1. 解决表面问题。2. 解决深层问题。3. 发现引用的库的bug,没有改动库,没改本地代码规避库的bug。第四个发现三层bug的老师。

中间改错了一次,错误和glm-5.1相同,但自己马上意识到改错,自动回滚了。

耗时17分18秒。非常慢,不知道是不是下午的问题,中间还跳出一次人机认证。所有模型中最慢的,打破deepseek 11分钟的记录。

评分和Qwen 3.7 Max一样,96分,但太慢了,排它后面吧,给Qwen升到97分。


^-^ Claude Opus 4.8 Max (Cursor Max Mode):


100分。同GPT 5.5 xhigh(1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。),但gpt-5.5只用了2分多钟。第5个发现三层bug的老师。Cursor竟然没有计时功能,估计4分钟以上吧。








^-^ 说下感受:


第一次用这两个工具。



  • ZCode 3.0: 不仔细看,以为是Codex呢,太像了。非常省Token,整个任务下来,上下文窗口使用30k,人家Cursor起手就是30k。

  • Cursor: Pro套餐,高级模型处理中等任务的话,一个月也就能用67次。Composer 2.5还拉跨,这种情况怎么和Claude/Codex竞争?

    然后他们说Composer 3.0是用2.5自主开发的,真替他们捏把汗。上下文消耗119k,也不知道是cursor的问题,还是claude max想太多。


国产模型进步非常快,GLM-5.2和Qwen 3.7 Max可以说是一线前沿模型了。体感上的区别是,gpt和claude处理这种问题,仅需要一个平A,而国产模型见面直接开大了,想的非常多。




^-^ 原始测试记录:



📦 点击展开 / 折叠查看 29 款模型完整评测历史


祖传bug测了几个模型的能力:



  1. minimax 2.7: 未发现问题。提示到具体代码行,仍然不承认有问题。

  2. mimo-v2-pro: 怀疑到具体行数,这个位置是对的,但最终判定不是bug。

  3. glm 5: 发现并解决问题,但只从表面上解决了。

  4. claude 4.6 opus: 发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。

  5. GPT 5.4 xhigh: 发现了用户都没想到的深层问题,自动修改,一次改对。

  6. **kimi-2.5:**未发现问题。然后提示代码行号,态度转变发现并解决表面问题。同时发现深层问题,但改错了。(速度很慢,比GTP还慢)

  7. Gemini 3.1 pro preview(Copilot): 同glm 5。(速度快,比其他快10倍)

  8. claude 4.6 Sonnet: 发现并解决表面问题。发现深层问题,但改错了。和kimi-2.5错的一样。

  9. glm 5.1: 同claude 4.6 Sonnet。

  10. doubao-seed-2.0-code: 同kimi-2.5

  11. qwen3.6-plus preview free: 同glm 5

  12. stepfun/step-3.5-flash^-^ 同glm 5.1。

  13. Gemini 3.1 pro (Antigravity): 发现了用户都没想到的深层问题,自动修改,一次改对。深层次问题用最少的代码修复,比GPT 5.4灵性。

  14. kimi-k2.6: 同claude 4.6 opus。

  15. GPT 5.5 xhigh: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。

  16. **deepseek v4 pro (stepFun路由,思考强度未知):**同claude 4.6 opus,能提示潜在问题,也分析的透彻。太慢了11分钟,26个请求,所有测试里最慢的。

  17. claude 4.7 opus max: 同claude 4.6 opus,对于潜在问题没有自动处理,提出3个选项,第一个选项是Gemini 3.1 pro (Antigravity)那个改动最少,最灵性的。耗时2分钟,15个请求。

  18. mimo-v2.5-pro: 同claude 4.6 opus。耗时2分钟。共测试4次,有2次没检查出问题,不稳定。

  19. 新增Gemini 3.5 Flash (High) (Antigravity 2.1): 未发现问题。提示到具体代码行,只从表面上解决了。速度非常快,42秒。

  20. MiniMax M3 Free: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。表现大于GPT 5.4 xhigh。使用的是opencode免费版,耗时7m51s。看思考过程,该想到的都想到了,不该读的文件也读了,行为和deepseek v4有点像。如果使用token plan和MiniMax code,也许速度会快点。

  21. Qwen 3.7 Max: Qoder IDE,开启Spec驱动。Max解决了表面问题。第二层深度问题提供三个方案,最好的方案和GPT 5.4相同,这点不及Opus 4.7,GPT 5.5合Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,却没有本地规避,不及GTP 5.5。是第二个发现第三层bug的老师。

  22. Qwen 3.7 Plus: Qoder IDE,开启Spec驱动。同claude 4.6 Sonnet。

  23. DeepSeek V4 Pro: Qoder IDE,开启Spec驱动。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同GPT 5.5,也是第三个发现三层bug的老师。但第二层改错了。

  24. grok build 0.1: 未发现问题。提示后,只解决了表面问题(不如kimi k2.5)。同Gemini 3.5 Flash (High),但不如它快。

  25. composer 2.5: 同claude 4.6 Sonnet(发现并解决表面问题。发现深层问题,但改错了),错误相同。这一点表现不如kimi k2.6(发现深层问题,没有自动修改,能提示用户需要手动修改。)

  26. MAI-Code-1-Flash: 未发现问题。错误的修改了两处不是bug的代码,不想提醒它再试一次了,和MiniMax 2.7坐一桌吧

  27. kimi-k2.7-code: 同 claude 4.6 opus(发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。)

  28. GLM-5.2 Thinking (ZCode 3.0): 1. 96分。解决表面问题。2. 解决深层问题。3. 发现引用的库的bug,没有改动库,没改本地代码规避库的bug。第四个发现三层bug的老师。中间改错了一次,错误和glm-5.1相同,但自己马上意识到改错,自动回滚了。耗时17分18秒。非常慢,不知道是不是下午的问题,中间还跳出一次人机认证。所有模型中最慢的,打破deepseek 11分钟的记录。评分和Qwen 3.7 Max一样,96分,但太慢了,排它后面吧,给Qwen升到97分。

  29. Claude Opus 4.8 Max (Cursor Max Mode): 100分。同GPT 5.5 xhigh(1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。),但gpt-5.5只用了2分多钟。第5个发现三层bug的老师。Cursor竟然没有计时功能,估计4分钟以上吧。


最新回复 (12)
  • jv-kssma 06-14 19:39
    1

    還得是gpt, 國外在傳6月22上5.6, 很期待, 但希望不要太強, 現在太強會被老川禁

  • 坐忘 楼主 06-14 19:52
    2

    他们传gpt-5.6 > Fable,而且价格还大幅降低。

  • QAQTAT 06-14 19:56
    3

    等glm5.2开源大模型斩杀线又高了

  • kimi 06-14 19:56
    4

    好像传闻川普故意放松GPT5.6, 打压 Fable-5 ,报之前下了川普面子的一仗

  • 叶长风 06-14 20:02
    5

    zocode上下文管理很强,我在cc上开发功能来回5次,200k+了,zcode搞了10多轮才97k,token也很省,而且最神的是我从cc那边干了一半,查了下5小时已经消耗了50%,我在zcode干了2小时后,变成20%了…




  • Sam Altman 06-14 20:04
    6

    家人们 Zcode 可以接自己的 api 吗?还是说只能用 glm 家的

  • 坐忘 楼主 06-14 20:08
    7



    看了下,支持自定义供应商,和两种API格式

  • xiehaiyi2025 06-14 20:12
    8

    隐约感觉国内大模型距离他们只差数据飞轮了。

  • AstralDream 06-14 20:12
    9

    qwen3.7max和glm5.2这么强了么,国模牛逼啊,得找个时间好好体验看看

  • 坐忘 楼主 06-14 20:13
    10

    数据飞轮是什么梗?我感觉国产模型当前的能力和价格,会对御三家造成很大压力。

  • 坐忘 楼主 06-14 20:14
    11

    都可以免费体验:

    qoder有免费qwen 3.7 max

    zcode有免费glm 5.2

  • AstralDream 06-14 20:15
    12

    好的,感谢佬,我来下载个zcode试下看看

* 帖子来源Linux.do
返回