由于测试的模型越积越多了,表格会删除一些同厂商的旧模型,你可以在之前的评测帖子里找到它们的成绩。
项目
这是一个 Unity C# 项目,我进行测试的是一份皮肤系统需求案,我已经做了好预制体,而模型需要编写代码。
本轮与上两轮评测的项目和环境都完全一致:
模型来源
速度
排名 |
模型 |
时间(分钟) |
备注 |
|---|
1 |
Composer 2.5 |
3 |
|
2 |
Grok 4.20 0309 Reasoning |
3 |
|
3 |
Step-3.5-Flash |
6 |
|
4 |
Mimo V2 Omni |
7 |
|
5 |
Doubao-Seed-2.0-Lite |
7 |
|
6 |
Doubao-Seed-2.0-Pro |
9 |
|
7 |
Doubao-Seed-2.0-Code |
9 |
|
8 |
Qwen3-Coder-Next |
9 |
|
9 |
Claude Sonnet 4.6(high) |
9 |
|
10 |
Qwen3.5-Plus |
9 |
|
11 |
GLM-5 Turbo |
10 |
|
12 |
Minimax M2.7 |
10 |
Highspeed 版本 |
13 |
Qwen3.5-Flash |
10 |
|
14 |
Grok 4.3 |
10 |
|
15 |
Gemini 3 Pro |
11 |
|
16 |
Hy3 Preview |
13 |
|
17 |
GPT-5.5(low) |
13 |
|
18 |
Grok Build 0.1 |
14 |
|
19 |
GPT-5.5(medium) |
15 |
|
20 |
Mimo V2 Pro |
15 |
|
21 |
DeepSeek V4 Flash |
17 |
|
22 |
Qwen3.7-Plus |
17 |
|
23 |
Qwen3.7-Max |
18 |
|
24 |
GPT-5.5(high) |
19 |
|
25 |
Claude-Opus-4.7(Max) |
20 |
|
26 |
GLM-5 |
20 |
|
27 |
DeepSeek V4 Pro |
21 |
|
28 |
Gemini 3 Flash |
22 |
|
29 |
Claude-Fable-5(xhigh) |
23 |
|
30 |
Mimo V2.5 |
24 |
|
31 |
KAT-Coder-Pro V2 |
24 |
|
32 |
Minimax M3 |
25 |
|
33 |
Claude-Opus-4.6(Max) |
26 |
|
34 |
GPT-5.5(xhigh) |
28 |
|
35 |
Gemini 3.1 Pro(high) |
29 |
受 429 请求频率限制影响 |
36 |
Claude-Opus-4.8(Max) |
33 |
|
37 |
Kimi K2.6 |
33 |
|
38 |
Qwen3.5 9B GGUF Q4_K_XL |
35 |
MBP M4 Pro 48GB 本地部署 |
39 |
Qwen3.5 35B A3B GGUF Q4_K_XL |
36 |
MBP M4 Pro 48GB 本地部署 |
40 |
Mimo V2.5 Pro |
37 |
|
41 |
Kimi K2.7 Code |
39 |
|
42 |
GLM-5.2 |
45 |
|
令牌数
代码行数
完成度
GLM 5.2
审查结论: 完成度非常高,出现一个功能错误问题。
详细
- 总览属性没有使用服务端 TotalAttrs,且本地状态无法处理过期后的实
际生效集
协议 UnityProject/Assets/GameScripts/HotFix/GameProto/
GameProtocol/P_skin.cs:134 已提供服务端汇总属性,但
UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/
SkinAttrUI.cs:76 只按本地 _usingSkinIds + 配置重算。结合当前删除
过期推送处理,过期皮肤仍可能被计入“正在使用皮肤”属性总和。
最终总结
排名 |
模型/层级 |
说明 |
|---|
|
Tier 0 |
该等级的模型实现与线上基线高度一致。 |
1 |
Claude-Fable-5 |
|
2 |
GPT 5.5(xhigh) |
|
|
Tier 1 |
该等级的模型的代码正确完整且可编译,仅少量边界问题或轻微不一致。 |
3 |
Claude Opus 4.8(Max) |
|
4 |
GLM 5.2 |
|
5 |
Kimi K2.7 Code |
|
6 |
GPT 5.5(high) |
|
7 |
Composer 2.5 |
|
8 |
Kimi K2.6 |
|
9 |
GPT 5.5(low) |
|
10 |
GPT 5.5(medium) |
|
11 |
Claude Opus 4.6(Max) |
|
12 |
Claude Sonnet 4.5 |
|
|
Tier 2 |
该等级的模型的代码至少可编译或仅极少量的语法错误,但是存在明显功能错误、遗漏或与需求/线上不一致。 |
13 |
GLM 5.1 |
|
14 |
Minimax M3 |
|
15 |
Mimo V2.5 Pro |
|
16 |
GLM 5 |
|
17 |
Kimi K2.5 |
|
18 |
Claude Sonnet 4.6(high) |
|
19 |
Qwen3.7-Max |
|
20 |
Qwen3.5-Plus |
|
21 |
KAT-Coder-Pro V2 |
|
22 |
DeepSeek V4 Pro(max) |
|
|
Tier 3 |
该等级的模型的问题很多且无法编译,或者存在不少幻觉。 |
23 |
DeepSeek V4 Flash(max) |
|
24 |
Claude Opus 4.7(Max) |
|
25 |
Qwen3.7-Plus |
|
26 |
Grok Build 0.1 |
|
27 |
Grok 4.3 |
|
28 |
Mimo V2.5 |
|
29 |
Hy3 Preview |
|
30 |
GLM 5 Turbo |
|
31 |
Gemini 3.1 Pro(high) |
|
32 |
Mimo V2 Pro |
|
33 |
Mimo V2 Omni |
|
34 |
Minimax M2.7 |
|
35 |
Step-3.5-Flash |
|
36 |
Qwen3-Coder-Next |
|
37 |
Gemini 3 Pro |
|
38 |
Gemini 3 Flash |
|
39 |
Doubao-Seed-2.0-Code |
|
40 |
Doubao-Seed-2.0-Pro |
|
41 |
Doubao-Seed-2.0-Lite |
|
42 |
Qwen3.5-Flash |
|
43 |
Qwen3.5 35B A3B GGUF Q4_K_XL |
|
44 |
Qwen3.5 9B GGUF Q4_K_XL |
|
45 |
Grok 4.20 0309 Reasoning |
|
一开始 GLM 5.2 依然先全盘阅读了代码库,光是阅读就花费了 25 分钟,并启动了两个子代理进行阅读。
然后才开始编写代码,这个过程花了 20 分钟,于是刚刚被 Kimi K2.7 Code 刷新的最长耗时记录,立马
就被 GLM 5.2 打破了,45 分钟的耗时甚至比 K2.7 Code 还要慢 6 分钟,难绷的是 6 分钟已经够 Composer 2.5 做两轮需求了。
但其实细看 GLM 5.2 做题的过程其实并不是大力出奇迹的那种,可能纯粹是我的 Coding Plan 级别太低或者该模型 TPS 比较低。
最终的结果是 GLM 5.2 毋庸置疑地胜过了 Kimi K2.7 Code,成为了国产表现最好的模型,甚至和 Opus 4.8 的完成度也不相上下。
不过 GLM 5.2 当前的速度太慢,也许第三方供应商是更好的选择?