记一次对 DeepSeek V4 Flash Vision Exp、GLM 5.3 的真实项目需求的横向评测

SmallMain 2026-08-23 00:56 1

项目


这是一个 Unity C# 项目,我进行测试的是一份皮肤系统需求案,我已经做了好预制体,而模型需要编写代码。


本轮与上两轮评测的项目和环境都完全一致:



  • 第一轮


  • 上一轮


模型来源



  • DeepSeek V4 Flash Vision Exp: 官方 API

  • GLM 5.3: 方舟 Agent Plan


速度
























































































































































































































































































































































排名 模型 时间(分钟) 备注
1 Composer 2.5 3
2 Grok 4.20 0309 Reasoning 3
3 Step-3.5-Flash 6
4 Mimo V2 Omni 7
5 Doubao-Seed-2.0-Lite 7
6 Doubao-Seed-2.0-Pro 9
7 Doubao-Seed-2.0-Code 9
8 Qwen3-Coder-Next 9
9 Claude Sonnet 4.6(high) 9
10 Qwen3.5-Plus 9
11 GLM-5 Turbo 10
12 Minimax M2.7 10 Highspeed 版本
13 Qwen3.5-Flash 10
14 Grok 4.3 10
15 Gemini 3 Pro 11
16 Grok 4.5 13
17 Hy3 Preview 13
18 GPT-5.5(low) 13
19 Grok Build 0.1 14
20 GPT-5.5(medium) 15
21 Mimo V2 Pro 15
22 Grok 4.6(xhigh) 16
23 DeepSeek V4 Flash 0731 17
24 DeepSeek V4 Flash 17
25 Qwen3.7-Plus 17
26 Qwen3.7-Max 18
27 GPT-5.5(high) 19
28 Claude-Opus-4.7(Max) 20
29 GLM-5 20
30 DeepSeek V4 Pro 21
31 Gemini 3 Flash 22
32 Claude-Fable-5(xhigh) 23
33 Mimo V2.5 24
34 KAT-Coder-Pro V2 24
35 DeepSeek Harness(标准模式) 24
36 DeepSeek V4 Pro 0813 25
37 Minimax M3 25
38 Claude-Opus-4.6(Max) 26
39 DeepSeek V4 Flash Vision Exp 27
40 GPT-5.5(xhigh) 28
41 Gemini 3.1 Pro(high) 29 受 429 请求频率限制影响
42 DeepSeek Harness(PTC 模式) 30
43 Claude-Opus-4.8(Max) 33
44 Kimi K2.6 33
45 Qwen3.5 9B GGUF Q4_K_XL 35 MBP M4 Pro 48GB 本地部署
46 Qwen3.5 35B A3B GGUF Q4_K_XL 36 MBP M4 Pro 48GB 本地部署
47 GPT 5.6 Sol 36
48 Mimo V2.5 Pro 37
49 Kimi K2.7 Code 39
50 GLM-5.2 45
51 Qwen 3.8 Max 52
52 GLM-5.3 54
53 Claude Opus 5 55
54 Kimi K3 93
55 GPT 5.6 Luna 95

令牌数



  • DeepSeek V4 Flash Vision Exp: 48M(¥3.39)

  • GLM 5.3: 未知


完成度


DeepSeek v4 Flash Vision Exp


审查结论: 完成度非常高,存在少量细节问题。




详细


  1. 未拥有皮肤置灰不完整(中高)

    SkinUI.cs:1009-1021 只处理 Image,没有处理 Text、其他 Graphic 子节点。称号和气泡预览中的文字不会置灰,不满足“当前展示节点及所有子节点”。



GLM 5.3


审查结论: 完成度较高,存在少量细节问题。




详细


  • [T1] 列表响应中的使用状态被立即覆盖UnityProject/Assets/GameScripts/HotFix/GameLogic/DataMgr/Skin/SkinDataMgr.cs:208 先读取 skinInfo.IsUsing,随后在 UnityProject/Assets/GameScripts/HotFix/GameLogic/DataMgr/Skin/SkinDataMgr.cs:210 用本地字典覆盖。只要 HOME_INFO.useSkins 缺失、延迟或重连时过期,列表返回的真实使用状态就无法修正本地数据,默认选中和 action 区都会错误。

  • [T1] 预览资源为空时会残留上一张图片UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/SkinUI.cs:695UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/SkinUI.cs:725 在没有使用中的神针/头像框时不更新图片,而 UnityProject/Assets/GameScripts/HotFix/GameLogic/UI/PlayerInfo/SkinUI.cs:836 对空路径直接跳过。切换到称号或气泡页签时可能展示之前选中的旧资源。



最终总结

























































































































































































































































































































排名 模型/层级 说明
Tier 0 该等级的模型实现与线上基线高度一致。
1 Claude-Fable-5
2 GPT 5.6 Sol
3 Claude Opus 5
4 GPT 5.5(xhigh)
Tier 1 该等级的模型的代码正确完整且可编译,仅少量边界问题或轻微不一致。
5 Claude Opus 4.8(Max)
6 Kimi K3
7 DeepSeek V4 Pro 0813
8 DeepSeek V4 Flash Vision Exp
9 GLM 5.3
10 Grok 4.6
11 Grok 4.5
12 GLM 5.2
13 Kimi K2.7 Code
14 GPT 5.5(high)
15 Composer 2.5
16 DeepSeek V4 Flash 0731
17 Kimi K2.6
18 GPT 5.6 Luna
19 GPT 5.5(low)
20 GPT 5.5(medium)
21 Claude Opus 4.6(Max)
22 Claude Sonnet 4.5
Tier 2 该等级的模型的代码至少可编译或仅极少量的语法错误,但是存在明显功能错误、遗漏或与需求/线上不一致。
23 Qwen 3.8 Max
24 GLM 5.1
25 Minimax M3
26 Mimo V2.5 Pro
27 GLM 5
28 Kimi K2.5
29 Claude Sonnet 4.6(high)
30 Qwen3.7-Max
31 Qwen3.5-Plus
32 KAT-Coder-Pro V2
33 DeepSeek V4 Pro(max)
Tier 3 该等级的模型的问题很多且无法编译,或者存在不少幻觉。
34 DeepSeek V4 Flash(max)
35 Claude Opus 4.7(Max)
36 Qwen3.7-Plus
37 Grok Build 0.1
38 Grok 4.3
39 Mimo V2.5
40 Hy3 Preview
41 GLM 5 Turbo
42 Gemini 3.1 Pro(high)
43 Mimo V2 Pro
44 Mimo V2 Omni
45 Minimax M2.7
46 Step-3.5-Flash
47 Qwen3-Coder-Next
48 Gemini 3 Pro
49 Gemini 3 Flash
50 Doubao-Seed-2.0-Code
51 Doubao-Seed-2.0-Pro
52 Doubao-Seed-2.0-Lite
53 Qwen3.5-Flash
54 Qwen3.5 35B A3B GGUF Q4_K_XL
55 Qwen3.5 9B GGUF Q4_K_XL
56 Grok 4.20 0309 Reasoning

本次 DeepSeek V4 Flash Vision Exp 依然使用官方 Harness(标准模式)进行测试,避免出现争议。



  • 相对 0731 版本进步非常明显,完成度非常高,甚至我怀疑路由到了 V4 Pro(?)。

  • 相对 0731 版本令牌数消耗翻倍,单次测评成本上涨将近 4 倍(¥2.45)。

  • 相对 0731 版本耗时增加了 10 分钟,慢了将近 60%。


并且终于补全了多模态能力,如果依然在价格未上涨的时期,那确实算得上是更夸张的新斩杀线。


而以现在的价格测试下来,实际相同令牌数量的成本在闲时大概上涨了 40%,高峰期虽然未实际测试,但官方给出的价格正好是翻倍的闲时价格,所以估算相对未涨价时大概上涨了 70%。


这个涨价的幅度其实还能接受,特别是在闲时时间段使用的话,并未产生数量级的差距,而且今天 DeepSeek 又宣布了周末采用闲时定价,综合下来 DeepSeek V4 Flash Vision Exp 的性价比还是非常高的。


GLM-5.3 相比 GLM-5.2 耗时增加了 9 分钟,慢了将近 20%,与 Claude Opus 5 使用了相同的时间。


该评测需求在质量上与 GLM-5.2 相比拉不开差距,需要更多的测试来验证 GLM-5.3 的能力。


总结:


GLM-5.3 更新较为常规;DeepSeek 这次更新的 Flash V4 Vision Exp 似乎和 Grok 4.6 可以争一争日常快速模型的地位。

最新回复 (8)
  • fenglin 08-23 01:05
    1

    我们也是Unity项目,实际使用中确实感觉不到glm 5.3相对于5.2有什么大的提升。

  • 泠音 08-23 01:08
    2

    佬考虑测试下Qwen3.8 27B嘛,听说不错^-^

  • 白学森 08-23 01:10
    3

    确实是符合体感的,GLM和DS这两差不多智力的情况下,比速度的话DS能把GLM秒了

  • gally16 08-23 18:08
    4

    dsv4还是太强了,glm5.2性价比也很高

  • huachuan12 08-23 18:17
    5

    ds不涨价的话根本顶不住全球的需求。

  • WWT 08-23 18:17
    6

    dsv4flash确实强

    可惜涨价了^-^^-^

  • gomg 08-23 22:11
    7

    来支持佬了

    没想到 GLM 5.3 的实际使用排行还落后于dsv4fve

  • 彼方 08-24 03:38
    8

    建议自己实测,他这个测试只能代表unity项目,而在有些测试里,dsv4pga 是不如 glm5.2 和 grok4.5 的

* 帖子来源Linux.do
返回