Z.ai 先后发布了 GLM-5.3 和 GLM-5.3-Flash 两份评测报告,但两张图的基准版本并不一致(比如 Terminal Bench 一个用 2.1、一个用 3.0),直接对比会产生“84 分 vs 28 分”的错觉。我把两份报告的原始数据提取出来,对齐到同一基准,并补上 Kimi K3、GPT-5.6 Sol、DeepSeek-V4 Pro 作参照,整理成下面这张表。
基准 |
能力域 |
GLM-5.3 |
GLM-5.3-Flash |
Kimi K3 |
GPT-5.6 Sol |
DeepSeek-V4 Pro-0813 |
|---|
Terminal Bench 2.1 |
终端任务 |
88.2 |
84.3 |
88.3 |
88.8 |
87.9 |
Terminal Bench 3.0 |
终端任务(加难版) |
28.3 |
– |
17.4 |
34.6 |
– |
DeepSWE v1.1 |
复杂软件工程 |
66.9 |
63.4 |
67.5 |
72.7 |
62.7 |
NL2Repo |
生成完整仓库 |
58 |
56.3 |
58 |
– |
61.1 |
SWE-Marathon v1.1 |
超长程工程 |
42.5 |
– |
48.1 |
42.5 |
– |
PostTrainBench |
ML 工程 |
39.8 |
– |
32 |
36.2 |
– |
CyberGym |
漏洞发现 |
84.5 |
– |
80 |
83.6 |
83.3 |
ExploitGym (2h/6h) |
漏洞利用 |
105/130 |
– |
36/70 |
216/293 |
– |
ExploitBench |
漏洞利用 |
54.4 |
– |
32.2 |
76.5 |
– |
Toolathlon Verified |
工具编排 |
73 |
78.4 |
76.5 |
74.9 |
74.1 |
AutomationBench v1.0.6 |
办公自动化 |
48.2 |
48.8 |
46.7 |
45.8 |
43.2 |
Agents’ Last Exam (CLI) |
代理能力上限 |
28.5 |
26.3 |
27.6 |
28.6 |
25.7 |
HLE w/ Tools |
前沿推理 |
62.5 |
55.3 |
59.8 |
64.5 |
60.0 |
GDPval-AA v2 |
专业工作交付(Elo) |
1769 |
1773 |
1682 |
1730 |
1590 |
(“–” 表示官方未公布该项;加粗为该行最优)
几点说明
- Terminal Bench 2.1 与 3.0 不可混比。3.0 难度大增——GLM-5.2 在 2.1 上拿 81.0,在 3.0 上只有 4.6。GLM-5.3 的 28.3 已是开源 SOTA,而 Flash 未公布 3.0 成绩。
数据来源:Z.ai 官方博客(GLM-5.3 与 GLM-5.3-Flash 发布文)、tbench.ai 官方榜单。