记一次对 GLM 5.2 的真实项目需求的横向评测

SmallMain 2026-06-13 20:15 1


由于测试的模型越积越多了,表格会删除一些同厂商的旧模型,你可以在之前的评测帖子里找到它们的成绩。



项目


这是一个 Unity C# 项目,我进行测试的是一份皮肤系统需求案,我已经做了好预制体,而模型需要编写代码。


本轮与上两轮评测的项目和环境都完全一致:



  • 第一轮


  • 上一轮


模型来源



  • GLM 5.2: 官方 Coding Plan


速度










































































































































































































































































排名 模型 时间(分钟) 备注
1 Composer 2.5 3
2 Grok 4.20 0309 Reasoning 3
3 Step-3.5-Flash 6
4 Mimo V2 Omni 7
5 Doubao-Seed-2.0-Lite 7
6 Doubao-Seed-2.0-Pro 9
7 Doubao-Seed-2.0-Code 9
8 Qwen3-Coder-Next 9
9 Claude Sonnet 4.6(high) 9
10 Qwen3.5-Plus 9
11 GLM-5 Turbo 10
12 Minimax M2.7 10 Highspeed 版本
13 Qwen3.5-Flash 10
14 Grok 4.3 10
15 Gemini 3 Pro 11
16 Hy3 Preview 13
17 GPT-5.5(low) 13
18 Grok Build 0.1 14
19 GPT-5.5(medium) 15
20 Mimo V2 Pro 15
21 DeepSeek V4 Flash 17
22 Qwen3.7-Plus 17
23 Qwen3.7-Max 18
24 GPT-5.5(high) 19
25 Claude-Opus-4.7(Max) 20
26 GLM-5 20
27 DeepSeek V4 Pro 21
28 Gemini 3 Flash 22
29 Claude-Fable-5(xhigh) 23
30 Mimo V2.5 24
31 KAT-Coder-Pro V2 24
32 Minimax M3 25
33 Claude-Opus-4.6(Max) 26
34 GPT-5.5(xhigh) 28
35 Gemini 3.1 Pro(high) 29 受 429 请求频率限制影响
36 Claude-Opus-4.8(Max) 33
37 Kimi K2.6 33
38 Qwen3.5 9B GGUF Q4_K_XL 35 MBP M4 Pro 48GB 本地部署
39 Qwen3.5 35B A3B GGUF Q4_K_XL 36 MBP M4 Pro 48GB 本地部署
40 Mimo V2.5 Pro 37
41 Kimi K2.7 Code 39
42 GLM-5.2 45

令牌数



  • GLM 5.2: 未知


代码行数



  • GLM 5.2: +1331, -7


完成度


GLM 5.2


审查结论: 完成度非常高,出现一个功能错误问题。




详细


  1. 总览属性没有使用服务端 TotalAttrs,且本地状态无法处理过期后的实

    际生效集

    协议 UnityProject/Assets/GameScripts/HotFix/GameProto/

    GameProtocol/P_skin.cs:134 已提供服务端汇总属性,但

    UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/

    SkinAttrUI.cs:76 只按本地 _usingSkinIds + 配置重算。结合当前删除

    过期推送处理,过期皮肤仍可能被计入“正在使用皮肤”属性总和。



最终总结


































































































































































































































































排名 模型/层级 说明
Tier 0 该等级的模型实现与线上基线高度一致。
1 Claude-Fable-5
2 GPT 5.5(xhigh)
Tier 1 该等级的模型的代码正确完整且可编译,仅少量边界问题或轻微不一致。
3 Claude Opus 4.8(Max)
4 GLM 5.2
5 Kimi K2.7 Code
6 GPT 5.5(high)
7 Composer 2.5
8 Kimi K2.6
9 GPT 5.5(low)
10 GPT 5.5(medium)
11 Claude Opus 4.6(Max)
12 Claude Sonnet 4.5
Tier 2 该等级的模型的代码至少可编译或仅极少量的语法错误,但是存在明显功能错误、遗漏或与需求/线上不一致。
13 GLM 5.1
14 Minimax M3
15 Mimo V2.5 Pro
16 GLM 5
17 Kimi K2.5
18 Claude Sonnet 4.6(high)
19 Qwen3.7-Max
20 Qwen3.5-Plus
21 KAT-Coder-Pro V2
22 DeepSeek V4 Pro(max)
Tier 3 该等级的模型的问题很多且无法编译,或者存在不少幻觉。
23 DeepSeek V4 Flash(max)
24 Claude Opus 4.7(Max)
25 Qwen3.7-Plus
26 Grok Build 0.1
27 Grok 4.3
28 Mimo V2.5
29 Hy3 Preview
30 GLM 5 Turbo
31 Gemini 3.1 Pro(high)
32 Mimo V2 Pro
33 Mimo V2 Omni
34 Minimax M2.7
35 Step-3.5-Flash
36 Qwen3-Coder-Next
37 Gemini 3 Pro
38 Gemini 3 Flash
39 Doubao-Seed-2.0-Code
40 Doubao-Seed-2.0-Pro
41 Doubao-Seed-2.0-Lite
42 Qwen3.5-Flash
43 Qwen3.5 35B A3B GGUF Q4_K_XL
44 Qwen3.5 9B GGUF Q4_K_XL
45 Grok 4.20 0309 Reasoning

一开始 GLM 5.2 依然先全盘阅读了代码库,光是阅读就花费了 25 分钟,并启动了两个子代理进行阅读。


然后才开始编写代码,这个过程花了 20 分钟,于是刚刚被 Kimi K2.7 Code 刷新的最长耗时记录,立马

就被 GLM 5.2 打破了,45 分钟的耗时甚至比 K2.7 Code 还要慢 6 分钟,难绷的是 6 分钟已经够 Composer 2.5 做两轮需求了。


但其实细看 GLM 5.2 做题的过程其实并不是大力出奇迹的那种,可能纯粹是我的 Coding Plan 级别太低或者该模型 TPS 比较低。


最终的结果是 GLM 5.2 毋庸置疑地胜过了 Kimi K2.7 Code,成为了国产表现最好的模型,甚至和 Opus 4.8 的完成度也不相上下。


不过 GLM 5.2 当前的速度太慢,也许第三方供应商是更好的选择?

最新回复 (19)
  • outgoing 06-13 20:16
    1

    时间这么长是不是卡住了啊,token消耗也对比下吧

  • NukaColaM 06-13 20:16
    2

    这也太慢了吧。不过可以帮我摸鱼,挺好。

  • mi tu 06-13 20:17
    3

    支持,确实慢,我从可以访问开始开了个修bug的goal现在还没完成

  • 量子Bug 06-13 20:17
    4

    快!真快啊。(指的是测得块,不是模型块^-^)


    GLM5.2这么牛逼的吗?直逼Opus 4.8了,看来开源模型与闭源之间差距小于三个月了。

  • DEA 06-13 20:17
    5

    开源模型之光


    与国外顶级模型的差距越来越小了,直接干翻A​^-^和OpenAI!

  • QXK 06-13 20:19
    6

    感谢佬的测评,到目前为止就看到一位佬发帖测评了,感觉还有点假,这下有实测心里踏实多了 这玩意确实牛逼看来 就是不知道glm的编程计划有没有性价比

  • GLNCE 06-13 20:19
    7

    1.这个任务里claude4.7的表现竟然这么烂?

    2.composer2.5仅用了三分钟,就达到了t1水平?

  • calendar 06-13 20:19
    8

    有没有使用的 token 数?可以大概判断一下原因

  • 点点点…点娘! 06-13 20:20
    9

    算力算是国模最难翻的山了


    希望国内算力卡给力点吧

  • alan1020456 06-13 20:24
    10

    composer2.5仅用了三分钟,就达到了t1水平?



    我也感觉奇怪,composer是在kimi基础上训练的,但却没有出现那种过度思考的问题。

  • SmallMain 楼主 06-13 20:26
    11

    T3 守门员,这个成绩我也不相信,但就是这样。

    确实就 3 分钟,而且是唯一一个经过 GPT-5.5 + Fable 5 双审查的模型,成绩没有错。

  • Ringo 06-13 20:27
    12

    这速度符合我对GLM的刻板印象,换句话说,只要算力上来,GLM真就最香模型了。

  • kakakaka 06-13 20:28
    13

    是不是说明kim的潜力还有待挖掘。

  • OpenAI_Q-Star 06-13 20:34
    14

    composer 2.5有免费的吗?

  • 伽利略 06-13 20:34
    15

    COMPOSER 2.5可以免费用吗

  • ychell 06-13 20:35
    16

    你描述的这个全盘阅读加子代理看来GLM5.2也有学到F5的习惯啊

  • 虎大王 06-13 20:36
    17

    再次证明了composer 2.5 fast有多好用了,速度快,能力强

  • 哇哦˶╹ꇴ╹˶! 06-13 20:36
    18

    真的能到达tier1?有没有复杂项目查Bug和长任务完成复杂需求的场景测试?

  • 吃豆人 06-13 20:37
    19

    没,要么cursor要么grok,grok的老马好像不管反代可以随便带出来用,可以到200t/s 速度非常变态 可能是多亏了老马的闲置集群

* 帖子来源Linux.do
返回