博客原文:GLM-5.3-Flash: Frontier Intelligence, Flash Cost
我们推出了GLM-5.3-Flash,这是GLM-5系列中首款原生多模态模型。该模型总参数量达3200亿,而激活参数量仅为180亿,在各项基准测试和实际工作负载中均优于GLM-5.2,且成本仅为后者的十分之一,同时在编程和智能体基准测试上接近Claude Opus 4.8的水平。
GLM-5.3-Flash在GLM-5的基础上引入了多项架构改进。我们首次推出结合稀疏注意力和线性注意力的混合架构,大幅降低长上下文服务成本,同时保持精准的长上下文能力。该模型还采用了流形约束超连接(mHC)以进一步提升扩展效率。结合我们最新的30T token多模态预训练语料库,这些改进使得GLM-5.3-Flash能够以更少的计算资源产生更强的智能。
在发布之前,我们以ox-alpha的身份在OpenCode和OpenRouter上匿名测试了GLM-5.3-Flash,以收集用户反馈。它迅速成为当周最受欢迎的模型——且所有这些流量均由国产AI芯片承载。


闪电成本下的竞争力表现
GLM-5.3-Flash 将人工智能分析指数 v4.1.1 的帕累托前沿推向新高度,以每个任务仅 0.045 美元(折扣价)的成本取得 57 分的成绩——这一智力水平此前仅能以约 10 倍的成本实现。这使其成为广泛工作负载下极具竞争力的默认选择。

在六项编程与智能体基准测试中,GLM-5.3-Flash 持续优于 GLM-5.2,且往往以较大幅度领先——在 DeepSWE v1.1 上为 63.4 对 46.2,在 AutomationBench 上为 48.8 对 26.2——同时整体接近 Claude Opus 4.8。

这一点在我们内部的编程评估中也得到了验证:在Z.ai Code Bench v1.0(基于Claude Code 2.1.207运行)上,GLM-5.3-Flash在各个努力水平下均明显优于GLM-5.2,并且在最高努力水平下几乎与Claude Opus 4.8持平(29.0对29.5)。

面向极致效率的架构

与GLM-4.5系列相比,GLM-5.3-Flash专为超低成本的推理而设计。尽管总参数量相近(320B对比355B),但其激活参数量(18B对比32B)和层数(45层对比92层)均几乎减半。
为了在长上下文场景中最小化注意力成本,我们采用了结合线性注意力与稀疏注意力的混合架构。线性注意力通过状态建模捕捉局部依赖,而稀疏注意力则通过轻量级索引器检索相关的全局上下文。为了进一步降低索引器在100万token上下文长度下的延迟和内存开销,我们引入了IndexPool,通过加权池化将四个索引器键向量压缩为一个。
为了说明我们架构的效率,我们将GLM-5.3-Flash与GLM-5.3以及两个近期开源模型DeepSeek-V4-Flash和Kimi-K3在每令牌计算量和KV缓存大小方面进行了对比。为了在不同规模间进行公平比较,我们计算了每个头每层的注意力计算量以及每层的平均KV缓存大小(BF16)。与GLM-5.3相比,GLM-5.3-Flash将注意力计算量和KV缓存大小分别降低了3.0倍和4.4倍。GLM-5.3-Flash在所有对比模型中拥有最低的注意力计算量。KV缓存大小仍略大于Kimi-K3和DeepSeek-V4-Flash,尚有进一步优化空间。
整体架构的改进,结合优化的预训练语料库,使GLM-5.3-Flash能够以更少的计算量产生更强的智能。 在下表中,我们展示了GLM-5.3-Flash基础模型的评估结果,并与我们之前的基础模型及DeepSeek-V4-Flash-Base进行了对比。结果表明,GLM-5.3-Flash-Base整体上优于GLM-4.5-Base,并且在大多数基准测试中与GLM-5-Base保持竞争力。

(DeepSeek-V4-Flash-Base的结果使用我们内部评估框架进行评测,以控制实现差异)
编码循环中的视觉智能
视觉编码不仅仅是处理图像。它拓展了编码所能触及的边界。对于前端开发、游戏开发和3D模拟等任务,最终输出不仅仅是代码,而是用户所体验的界面、交互或世界。许多失败只有通过渲染、交互或试玩才能显现。CUA进一步将编码从可编程系统扩展到可见且可交互的环境。因此,视觉需要原生集成到模型中,使其能够决定何时观察,并利用视觉反馈指导后续操作。
我们为视觉编码开发了数据合成流水线,重点关注自我视觉判断和测试时改进。由此产生的轨迹要求模型与环境交互、检查自身输出并迭代优化。对于前端编码,我们还探索了基于环境反馈的强化学习,并通过基于真实用户流程的智能体验证进一步加强了GUI判断。这使验证范围从功能正确性扩展到了渲染和交互式产品本身。
代码让模型构建并改变世界。视觉让它进入人们所看见和使用的世界。

编程之外——您工作中的伙伴
编程能力为智能知识工作提供了重要基础,而视觉智能则将这些能力延伸至更广泛的专业任务。相当一部分专业活动涉及解读异构的视觉与结构化信息,包括文档、电子表格、演示文稿、仪表盘、界面以及会议资料。
视觉智能将模型的能力扩展到以代码为中心的环境之外,使其能够联合推理文本、视觉和结构上下文。模型无需用户明确将其工作环境转化为文本指令,即可直接解读与任务相关的工件并识别相关信息。它还能依据视觉上下文和预期结果评估自身输出,从而实现更有效的自我验证与优化——包括对呈现质量和美感的更强判断力。
这些能力在以下专业工作流程示例中尤为明显。


在中国AI芯片上规模化部署服务
在过去一周里,我们在一大规模的中国AI芯片集群上部署了GLM-5.3-Flash,该集群由高带宽互联网络和针对底层硬件优化的服务栈提供支持。
为了克服单芯片计算和内存容量相对有限的挑战,我们在SGLang之上为该架构构建了一个专用推理引擎。值得一提的是,这一工作得到了我们基于GLM-5.3的智能基础设施代理的加速,该代理协助工程师开发与优化内核、诊断性能瓶颈并改进服务栈——形成了一个反馈循环,其中模型帮助优化了服务于模型自身的系统。
这些芯片主要受限于内存容量和带宽,尤其是在支持高达一百万个令牌的上下文长度时。这要求进行激进的内存优化,包括针对底层架构定制的计算换带宽和通信换带宽技术。我们的技术栈结合了节点内张量并行(用于线性注意力和LM头)、ReplaySSM、W8A8量化、混合INT8/FP8/BF16缓存量化以及层拆分。
在集群规模上,我们生产级的编码—预填充—解码(EPD)分离式架构将多模态编码、提示预填充和逐令牌解码分离为独立调度和可扩展的工作池,从而在数万块国产加速器上实现高效可靠的推理服务。
与我们在相同硬件上的初始基线相比,端到端推理性能提升了3倍,达到了与主流NVIDIA GPU相当的硬件利用率和单令牌成本。这证明了中国芯片能够高效且经济地支持前沿模型的大规模推理。
结论
GLM-5.3-Flash证明,前沿智能未必需要前沿成本。这并非源于单一技巧,而是三层机制协同作用的结果:以更少算力实现更强能力的架构、更丰富的多模态预训练语料库,以及与推理硬件协同设计的基础设施。我们正将这一方案扩展至更大规模的模型——GLM-5.3-Flash不断推进成本性能的边界,而构建它的经验已在塑造我们的下一代前沿模型。
GLM-5.3-Flash 快速入门
我们已将 GLM-5.3-Flash 全面开放给所有 GLM 编程计划用户。GLM-5.3-Flash 提供相当于 GLM-5.3 三倍的可使用额度。欢迎在 z.ai/subscribe 体验 GLM-5.3-Flash。
在 ZCode 中通过浏览器使用和计算机使用解锁 GLM-5.3-Flash 的多模态能力:智能体会点击并视觉验证网页,还能操作你的桌面应用。
GLM-5.3-Flash的模型权重已在HuggingFace上公开发布。在本地部署方面,GLM-5.3-Flash目前支持包括SGLang、vLLM和TokenSpeed在内的推理框架,其他框架也将很快推出。

脚注
- HLE w/ tools (full set):
HLE(含工具,完整测试集):我们采用温度=1.0、top_p=0.95的采样参数进行评估,最大生成长度为163,840个token。评估在最大上下文长度300,000个token下进行,并使用上下文管理策略。我们使用GPT-5.6-luna(中等规模)作为评判模型。
- NL2Repo:
NL2Repo:我们在1M上下文下,以温度=1.0、top_p=1.0、max_new_tokens=64k评估NL2Repo。为防止作弊行为,我们采用基于规则和基于LLM的判定机制,以阻止恶意操作(如未经授权的pip或curl操作)。
- DeepSWE:
DeepSWE:我们使用mini-swe-agent工具框架运行DeepSWE,设置temperature=0.95,top_p=1.0,超时时间为6小时,上下文长度为400K。
- Terminal-Bench 2.1:
Terminal-Bench 2.1:我们在Claude Code 2.1.207中进行评估,设置temperature=1.0,top_p=1,max_new_tokens=65536,超时时间为6小时。
- Agent’s Last Exam:
Agent’s Last Exam:我们使用官方评估协议和Claude Code工具框架评估ALE(推理努力程度=最高,1M上下文,64K最大输出)。禁用工具搜索,结果由官方ALE评估器评分。
- Toolathlon Verified:
Toolathlon Verified:我们通过官方评估服务获取所有结果,并报告3次独立运行的pass@1平均值。
- AutomationBench:
AutomationBench:我们使用 AutomationBench v1.0.6 进行评估,并纳入了 PR #13 中引入的空类型处理问题的修复。
- GDPval-AA v2:
GDPval-AA v2:模型由 Artificial Analysis 进行评估。
- BabyVision:
BabyVision:我们使用 temperature=1.0、top_p=0.95,以及最大上下文长度为 164K tokens。我们将输入图像调整为较短边至少为 1.5K 像素,与其他基线保持一致。
- OfficeQA Pro:
OfficeQA Pro:我们在不提供嵌入文本访问权限的情况下,对 Treasury Bulletin PDF 语料库中的智能体进行评估。我们使用 temperature=1.0、top_p=0.95,以及最大上下文长度为 512K tokens。
- CharXiv Reasoning:
CharXiv推理:我们使用温度=1.0,top_p=0.95,最大上下文长度为256K个标记。
- Chartography: We use temperature=1.0, top_p=0.95, and a maximum context length of 256K tokens.
图表绘制方法:我们采用温度参数=1.0,top_p=0.95,最大上下文长度为256K个令牌。
- MVBench and MMVU:
MVBench和MMVU:我们使用temperature=1.0,top_p=0.95,最大上下文长度为256K个token。对于原生支持视频输入的模型(如Gemini 3.7 Flash),我们直接输入原始视频进行评估。对于不支持视频输入的模型,我们采用默认的1帧每秒的帧提取策略。如果提取的总帧数超过API的最大限制,我们会在视频中均匀采样帧,直至达到最大帧数。
Deepseek-V4-Flash-0731翻译