GLM-5.3-Flash 我要打十个

cogoxu 2026-08-28 19:54 1

Z.ai 先后发布了 GLM-5.3 和 GLM-5.3-Flash 两份评测报告,但两张图的基准版本并不一致(比如 Terminal Bench 一个用 2.1、一个用 3.0),直接对比会产生“84 分 vs 28 分”的错觉。我把两份报告的原始数据提取出来,对齐到同一基准,并补上 Kimi K3、GPT-5.6 Sol、DeepSeek-V4 Pro 作参照,整理成下面这张表。















































































































































基准 能力域 GLM-5.3 GLM-5.3-Flash Kimi K3 GPT-5.6 Sol DeepSeek-V4 Pro-0813
Terminal Bench 2.1 终端任务 88.2 84.3 88.3 88.8 87.9
Terminal Bench 3.0 终端任务(加难版) 28.3 17.4 34.6
DeepSWE v1.1 复杂软件工程 66.9 63.4 67.5 72.7 62.7
NL2Repo 生成完整仓库 58 56.3 58 61.1
SWE-Marathon v1.1 超长程工程 42.5 48.1 42.5
PostTrainBench ML 工程 39.8 32 36.2
CyberGym 漏洞发现 84.5 80 83.6 83.3
ExploitGym (2h/6h) 漏洞利用 105/130 36/70 216/293
ExploitBench 漏洞利用 54.4 32.2 76.5
Toolathlon Verified 工具编排 73 78.4 76.5 74.9 74.1
AutomationBench v1.0.6 办公自动化 48.2 48.8 46.7 45.8 43.2
Agents’ Last Exam (CLI) 代理能力上限 28.5 26.3 27.6 28.6 25.7
HLE w/ Tools 前沿推理 62.5 55.3 59.8 64.5 60.0
GDPval-AA v2 专业工作交付(Elo) 1769 1773 1682 1730 1590

(“–” 表示官方未公布该项;加粗为该行最优)


几点说明



  • Terminal Bench 2.1 与 3.0 不可混比。3.0 难度大增——GLM-5.2 在 2.1 上拿 81.0,在 3.0 上只有 4.6。GLM-5.3 的 28.3 已是开源 SOTA,而 Flash 未公布 3.0 成绩。


数据来源:Z.ai 官方博客(GLM-5.3 与 GLM-5.3-Flash 发布文)、tbench.ai 官方榜单。

最新回复 (2)
  • peter4lee 08-28 20:25
    1

    竟然有3个榜能拿第一^-^


    今天问了一个带矩阵的数学问题,回答里的第一段就把矩阵左下角的元素抄错了, 导致后面的结论全错… 我都不敢问他数学题了

  • odxun 08-28 20:29
    2

    我化腾的混元形意太极门不配上桌吗 ^-^

* 帖子来源Linux.do
返回