项目
这是一个 Unity C# 项目,我进行测试的是一份皮肤系统需求案,我已经做了好预制体,而模型需要编写代码。
本轮与上两轮评测的项目和环境都完全一致:
模型来源
- DeepSeek V4 Flash Vision Exp: 官方 API
- GLM 5.3: 方舟 Agent Plan
速度
排名 |
模型 |
时间(分钟) |
备注 |
|---|
1 |
Composer 2.5 |
3 |
|
2 |
Grok 4.20 0309 Reasoning |
3 |
|
3 |
Step-3.5-Flash |
6 |
|
4 |
Mimo V2 Omni |
7 |
|
5 |
Doubao-Seed-2.0-Lite |
7 |
|
6 |
Doubao-Seed-2.0-Pro |
9 |
|
7 |
Doubao-Seed-2.0-Code |
9 |
|
8 |
Qwen3-Coder-Next |
9 |
|
9 |
Claude Sonnet 4.6(high) |
9 |
|
10 |
Qwen3.5-Plus |
9 |
|
11 |
GLM-5 Turbo |
10 |
|
12 |
Minimax M2.7 |
10 |
Highspeed 版本 |
13 |
Qwen3.5-Flash |
10 |
|
14 |
Grok 4.3 |
10 |
|
15 |
Gemini 3 Pro |
11 |
|
16 |
Grok 4.5 |
13 |
|
17 |
Hy3 Preview |
13 |
|
18 |
GPT-5.5(low) |
13 |
|
19 |
Grok Build 0.1 |
14 |
|
20 |
GPT-5.5(medium) |
15 |
|
21 |
Mimo V2 Pro |
15 |
|
22 |
Grok 4.6(xhigh) |
16 |
|
23 |
DeepSeek V4 Flash 0731 |
17 |
|
24 |
DeepSeek V4 Flash |
17 |
|
25 |
Qwen3.7-Plus |
17 |
|
26 |
Qwen3.7-Max |
18 |
|
27 |
GPT-5.5(high) |
19 |
|
28 |
Claude-Opus-4.7(Max) |
20 |
|
29 |
GLM-5 |
20 |
|
30 |
DeepSeek V4 Pro |
21 |
|
31 |
Gemini 3 Flash |
22 |
|
32 |
Claude-Fable-5(xhigh) |
23 |
|
33 |
Mimo V2.5 |
24 |
|
34 |
KAT-Coder-Pro V2 |
24 |
|
35 |
DeepSeek Harness(标准模式) |
24 |
|
36 |
DeepSeek V4 Pro 0813 |
25 |
|
37 |
Minimax M3 |
25 |
|
38 |
Claude-Opus-4.6(Max) |
26 |
|
39 |
DeepSeek V4 Flash Vision Exp |
27 |
|
40 |
GPT-5.5(xhigh) |
28 |
|
41 |
Gemini 3.1 Pro(high) |
29 |
受 429 请求频率限制影响 |
42 |
DeepSeek Harness(PTC 模式) |
30 |
|
43 |
Claude-Opus-4.8(Max) |
33 |
|
44 |
Kimi K2.6 |
33 |
|
45 |
Qwen3.5 9B GGUF Q4_K_XL |
35 |
MBP M4 Pro 48GB 本地部署 |
46 |
Qwen3.5 35B A3B GGUF Q4_K_XL |
36 |
MBP M4 Pro 48GB 本地部署 |
47 |
GPT 5.6 Sol |
36 |
|
48 |
Mimo V2.5 Pro |
37 |
|
49 |
Kimi K2.7 Code |
39 |
|
50 |
GLM-5.2 |
45 |
|
51 |
Qwen 3.8 Max |
52 |
|
52 |
GLM-5.3 |
54 |
|
53 |
Claude Opus 5 |
55 |
|
54 |
Kimi K3 |
93 |
|
55 |
GPT 5.6 Luna |
95 |
|
令牌数
- DeepSeek V4 Flash Vision Exp: 48M(¥3.39)
- GLM 5.3: 未知
完成度
DeepSeek v4 Flash Vision Exp
审查结论: 完成度非常高,存在少量细节问题。
详细
- 未拥有皮肤置灰不完整(中高)
SkinUI.cs:1009-1021 只处理 Image,没有处理 Text、其他 Graphic 子节点。称号和气泡预览中的文字不会置灰,不满足“当前展示节点及所有子节点”。
GLM 5.3
审查结论: 完成度较高,存在少量细节问题。
详细
- [T1] 列表响应中的使用状态被立即覆盖:
UnityProject/Assets/GameScripts/HotFix/GameLogic/DataMgr/Skin/SkinDataMgr.cs:208 先读取 skinInfo.IsUsing,随后在 UnityProject/Assets/GameScripts/HotFix/GameLogic/DataMgr/Skin/SkinDataMgr.cs:210 用本地字典覆盖。只要 HOME_INFO.useSkins 缺失、延迟或重连时过期,列表返回的真实使用状态就无法修正本地数据,默认选中和 action 区都会错误。
- [T1] 预览资源为空时会残留上一张图片:
UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/SkinUI.cs:695 和 UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/SkinUI.cs:725 在没有使用中的神针/头像框时不更新图片,而 UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/SkinUI.cs:836 对空路径直接跳过。切换到称号或气泡页签时可能展示之前选中的旧资源。
最终总结
排名 |
模型/层级 |
说明 |
|---|
|
Tier 0 |
该等级的模型实现与线上基线高度一致。 |
1 |
Claude-Fable-5 |
|
2 |
GPT 5.6 Sol |
|
3 |
Claude Opus 5 |
|
4 |
GPT 5.5(xhigh) |
|
|
Tier 1 |
该等级的模型的代码正确完整且可编译,仅少量边界问题或轻微不一致。 |
5 |
Claude Opus 4.8(Max) |
|
6 |
Kimi K3 |
|
7 |
DeepSeek V4 Pro 0813 |
|
8 |
DeepSeek V4 Flash Vision Exp |
|
9 |
GLM 5.3 |
|
10 |
Grok 4.6 |
|
11 |
Grok 4.5 |
|
12 |
GLM 5.2 |
|
13 |
Kimi K2.7 Code |
|
14 |
GPT 5.5(high) |
|
15 |
Composer 2.5 |
|
16 |
DeepSeek V4 Flash 0731 |
|
17 |
Kimi K2.6 |
|
18 |
GPT 5.6 Luna |
|
19 |
GPT 5.5(low) |
|
20 |
GPT 5.5(medium) |
|
21 |
Claude Opus 4.6(Max) |
|
22 |
Claude Sonnet 4.5 |
|
|
Tier 2 |
该等级的模型的代码至少可编译或仅极少量的语法错误,但是存在明显功能错误、遗漏或与需求/线上不一致。 |
23 |
Qwen 3.8 Max |
|
24 |
GLM 5.1 |
|
25 |
Minimax M3 |
|
26 |
Mimo V2.5 Pro |
|
27 |
GLM 5 |
|
28 |
Kimi K2.5 |
|
29 |
Claude Sonnet 4.6(high) |
|
30 |
Qwen3.7-Max |
|
31 |
Qwen3.5-Plus |
|
32 |
KAT-Coder-Pro V2 |
|
33 |
DeepSeek V4 Pro(max) |
|
|
Tier 3 |
该等级的模型的问题很多且无法编译,或者存在不少幻觉。 |
34 |
DeepSeek V4 Flash(max) |
|
35 |
Claude Opus 4.7(Max) |
|
36 |
Qwen3.7-Plus |
|
37 |
Grok Build 0.1 |
|
38 |
Grok 4.3 |
|
39 |
Mimo V2.5 |
|
40 |
Hy3 Preview |
|
41 |
GLM 5 Turbo |
|
42 |
Gemini 3.1 Pro(high) |
|
43 |
Mimo V2 Pro |
|
44 |
Mimo V2 Omni |
|
45 |
Minimax M2.7 |
|
46 |
Step-3.5-Flash |
|
47 |
Qwen3-Coder-Next |
|
48 |
Gemini 3 Pro |
|
49 |
Gemini 3 Flash |
|
50 |
Doubao-Seed-2.0-Code |
|
51 |
Doubao-Seed-2.0-Pro |
|
52 |
Doubao-Seed-2.0-Lite |
|
53 |
Qwen3.5-Flash |
|
54 |
Qwen3.5 35B A3B GGUF Q4_K_XL |
|
55 |
Qwen3.5 9B GGUF Q4_K_XL |
|
56 |
Grok 4.20 0309 Reasoning |
|
本次 DeepSeek V4 Flash Vision Exp 依然使用官方 Harness(标准模式)进行测试,避免出现争议。
- 相对 0731 版本进步非常明显,完成度非常高,甚至我怀疑路由到了 V4 Pro(?)。
- 相对 0731 版本令牌数消耗翻倍,单次测评成本上涨将近 4 倍(¥2.45)。
- 相对 0731 版本耗时增加了 10 分钟,慢了将近 60%。
并且终于补全了多模态能力,如果依然在价格未上涨的时期,那确实算得上是更夸张的新斩杀线。
而以现在的价格测试下来,实际相同令牌数量的成本在闲时大概上涨了 40%,高峰期虽然未实际测试,但官方给出的价格正好是翻倍的闲时价格,所以估算相对未涨价时大概上涨了 70%。
这个涨价的幅度其实还能接受,特别是在闲时时间段使用的话,并未产生数量级的差距,而且今天 DeepSeek 又宣布了周末采用闲时定价,综合下来 DeepSeek V4 Flash Vision Exp 的性价比还是非常高的。
GLM-5.3 相比 GLM-5.2 耗时增加了 9 分钟,慢了将近 20%,与 Claude Opus 5 使用了相同的时间。
该评测需求在质量上与 GLM-5.2 相比拉不开差距,需要更多的测试来验证 GLM-5.3 的能力。
总结:
GLM-5.3 更新较为常规;DeepSeek 这次更新的 Flash V4 Vision Exp 似乎和 Grok 4.6 可以争一争日常快速模型的地位。