我们对GLM-5.3所做的只有训练后规模调整。通过GLM-5.2,我们构建了协议栈:IndexShare用于高效的长上下文处理,SAO用于长期任务的强化学习,以及用于大规模异步训练的Slime——这些都运行在我们积累的长视野任务环境中。过去一个月,我们不断在这个堆栈上扩展:更多环境、更多多样化的任务,以及更多的计算资源培训。
今天我们将发布GLM-5.3。它使用与GLM-5.2相同的基础模型——所有增益均来自训练后。与GLM-5.2相比,它在复杂编码和长视野任务方面表现更佳:
更强的编码:GLM-5.3 是最强大的开放权重编码模型,在我们内部的 Z.ai 代码测试平台上比 GLM-5.2 提升了 50%。它还在包括Terminal Bench 3.0和Agents’ Last Exam在内的公开基准测试中实现了开源SOTA认证。
新兴网络能力:随着培训后的规模扩展,网络能力的发展速度超出了预期。GLM-5.3在CyberGym上的漏洞发现方面处于最先进水平,其提升在利用链的后端最大,在利用基准测试中是GLM-5.2的两倍多。
开源:我们将在安全评估和加固完成后两周内发布配重。


更强的编码
在GLM-5.3中,我们推动环境扩展任务,使其看起来不像编程练习,更像真正的专家工作单元。这些环境现在涵盖了更广泛的生产工作流程,任务围绕工程和研究工作在实际执行中的实际执行方式设计。有些工程师需要数天时间才能完成。例如,在机器学习基础设施任务中,模型可能被赋予与工程师相同的工作环境,访问计算集群、存储系统、内部文档、代码库和实验结果。它必须诊断训练栈中的瓶颈,实施优化,运行实验,并在保持正确性的前提下实现可衡量的端到端加速。在这一层面的环境培训推动模型承担大量端到端的工作责任,而非依赖用户拆解问题并监督每一步。
随着代理能力的提升,训练后扩展的难度从模型转移到了环境。一个有用的任务环境必须是可执行的、可验证的,并且接近真实的专业工作——我们需要很多这样的环境,而不是几台手工构建的。为了扩展这一过程,我们构建了能够从头到尾合成环境的流水线,并且对部分任务还包括强化学习的奖励信号。研究代理从真实工作中收集任务模式,并将其转化为具有多步依赖和隐藏状态的可运行长视野环境;法官代理随后尝试每个任务,以验证其是否真的可解决。验证器在不访问参考解的情况下合成,而求解器轨迹则用于发现和关闭奖励捷径。通过oracle、no-op和unsolved状态检查的验证器会产生足够可靠的二元奖励,可以直接训练。
它延续了GLM-5.2引入的强化学习策略,包括带压缩的SAO,这有助于这些成果在长视野任务中保持,而不仅仅是短期任务。这种效应在编码和通用代理任务中都能体现出来。GLM-5.3在Terminal-Bench 3.0中从4.6提升到28.3,在DeepSWE v1.1上从46.2提升到66.9,在Agents’ Last Exam中从23.8提升到28.5。这些管道仍然需要大量的人工参与;让环境生成和验证更加自主是下一步。
除了公开基准测试外,我们还推出了 Z.ai Code Bench,这是一个内部基准测试,旨在评估在真实用户场景下的编码代理。它涵盖了多样的任务类别,并将代理置于复杂的本地开发环境中。在不同的工作量层级,我们从两个维度评估代理:端到端任务完成率和细粒度的检查表准确性。作为私人基准,Z.ai Code Bench 还降低了公共测试集污染风险,并让我们更忠实地衡量真实用户体验。
新兴网络能力
作为培训后的一部分,我们将漏洞发现数据和环境引入训练组合。我们期望这能使模型在发现和推理漏洞方面更为出色。令我们惊讶的是,随着训练规模的扩大,该能力持续快速发展。GLM-5.3不仅仅是在识别孤立缺陷方面变得更好:它开始跨越多个利用阶段进行推理,形成完整的利用链条的连贯计划。

我们通过三个基准测试评估GLM-5.3,涵盖漏洞分析和利用的不同阶段。在CyberGym中,该测试基于白盒源代码,测试模型是否能通过触发故障识别和验证漏洞,GLM-5.3得分为84.5%,高于GLM-5.2的77.2%——这是基准测试中的最佳成绩,领先于Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。在需要深入推理真实漏洞及其利用方式的ExploitBench上,GLM-5.3达到了54.4%,是GLM-5.2的24.4%的两倍多,而Mythos 5和GPT-5.6 Sol分别得分为78.0%和76.5%。在ExploitGym上,该系统衡量模型在时间归一化预算下可完成的利用任务数量,GLM-5.3在两小时内完成105项任务,六小时内完成130项任务,而GLM-5.2分别为29和39项;预算通过各模型的吞吐量数据进行标准化,详见脚注。《神话5》依然以181和247个任务遥遥领先。三者间的规律一致:基准位于开采链的上游,GLM-5.2的涨幅越大,剩余的缺口也越大。能力增长最快的地方正是我们落后最远的地方。
随后我们测试了这些能力是否能超越受控基准。自 GLM-5.2 以来,我们一直与中国的多个安全团队合作,将模型与现实代码库对比。经过专家审核、筛查和重复去重,该模型在269个项目中识别出2436个漏洞,其中包括1097个中高严重性问题。研究结果涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web应用和网络协议。许多作品多年甚至数十年未被注意,最古老的大约有40年历史。
此后,这项工作发展成为一项持续的披露工作。我们建立了 Z.ai 安全披露账本,以维护披露过程中发现的公开记录。随着新漏洞的审查和披露,账本会持续更新,区分已公开的问题和仍在披露中的问题。对于已披露的问题,它会记录受影响项目、严重程度、可用CVE以及漏洞在代码库中存留的时间等信息。

Slime:为长视线强化分辨率(Long-Horizon RL)扩展而建
所有这些都基于slime——我们开源的强化学习后培训框架,Megatron负责训练,SGLang负责推广。其设计将训练、推广和数据缓冲区集中在一个数据流中,因此数学、代码、沙盒、验证器和长远代理环境作为数据生成而非训练循环的变更。这正是我们能够通过GLM-5.2和GLM-5.3不断添加环境,而无需每次重建训练栈的原因。
通过GLM-5.3,我们从两个方面继续建设。在算法方面,我们增加了面向强化学习的能力:top-p 掩码、top-k 和全词汇 OPD,以及提升训练-推广一致性的配置,包括 R3 风格的设置和训练与推广路径之间的完整数值对齐,这让我们对采样、培训和教师信号有更细致的控制,并加快了受控比较的运行速度。在我们的训练-推广一致性评估中,对数概率的平均差异(logprob)在1e-7层级被控制,较之前设置减少了99.99%以上。
我们还致力于大规模强化学习的资源效率和系统吞吐量。本地存储现在作为额外的缓存层,按层次方式保存模型状态和数据,这些数据本应存放在主机内存中。这对多教师的 OPD 尤为重要:在培训端采用动态教师切换和预取功能,可以同时使用多个教师,而无需为每个教师搭建专门的长期推理服务,且增加开销有限,资源消耗大幅降低。对于代理型和异步工作负载,我们改进了路由器与Slime之间的联合调度和负载均衡,使得长度和完成时间差异很大的部署请求能更好地利用推理资源。我们增加了工作负载感知启发式,能够根据每个部署环境的特性推导出以吞吐量为导向的配置——预填充/解码资源比率、并发设置及其他对吞吐量至关重要的参数。因此,对于长视野编码强化学习任务,这些系统级优化使端到端强化学习训练吞吐量提高了2.3×以上,使我们能够在更长路径和更复杂环境中以显著更高的效率进行训练扩展。
综合起来,这些因素为我们带来了更多的实验灵活性、更低的资源成本和更高的吞吐量——这正是持续扩展强化学习的可行性所在。
GLM-5.3的型号重量将在两周内公开。