官方博客:阶跃星辰
Step 5 Preview 在 AI 编程、软件工程、专业知识工作等任务上达到前沿水平,并在金融领域展现出尤为突出的能力。Step 5 Preview 采用稀疏 MoE 架构,总参数量 600B,每个 Token 激活 27B 参数,支持 1M Token 上下文窗口和视觉输入。
评分惊人,跻身第一梯队





Step 5 Preview 现已可通过我们的产品和 API 使用。 模型将于 10 月 15 日正式开源。
更完整的评测结果,覆盖 Reasoning、Coding、Agent、Finance 和 Multimodal 等多个方向。
评测基准 |
Step 5 Preview (High) |
GLM 5.3 (Max) |
Kimi K3 (Max) |
GPT-6 Astra (Max) |
Claude Fable 5.1 (Max) |
Claude Opus 5 (Max) |
|---|
推理与知识 |
|
|
|
|
|
|
GPQA Diamond |
93.5% |
91.7% |
93.5% |
96.1% |
93.7% |
93.2% |
HLE |
46.5% |
42.3% |
46.9% |
54.7% |
59.1% |
54.9% |
AA-LCR v1.1 |
88.3% |
79.7% |
88.7% |
80.7% |
85.3% |
79.3% |
CritPt |
20.9% |
19.1% |
23.4% |
31.7% |
29.7% |
29.1% |
Coding |
|
|
|
|
|
|
DeepSWE v1.1 |
67.7% |
66.9% |
67.5% |
74.1% |
67.4% |
74.0% |
Terminal-Bench v2.1 |
85.0% |
83.9% |
85.0% |
88.4% |
91.4% |
89.1% |
Terminal-Bench v4 |
33.3% |
41.9% |
12.6% |
57.9% |
55.8% |
52.3% |
CyberGym |
84.7% |
84.5% |
80.0% |
— |
— |
— |
SciCode |
58.9% |
59.0% |
59.5% |
56.5% |
63.1% |
56.4% |
RoadmapBench |
54.3% |
54.1% |
55.4% |
— |
— |
68.3% |
ProgramBench (Pass Rate) |
80.5% |
72.0% |
77.8% |
85.4% |
82.7% |
82.3% |
SWE-Marathon v1.1 (Partial Score) |
72.7% |
67.4% |
84.4% |
77.3% |
80.2% |
85.6% |
MLS-Bench-Lite |
40.5% |
37.3% |
48.3% |
— |
50.3% |
49.8% |
SWE-Atlas-QnA |
63.6% |
59.6% |
59.5% |
60.9% |
— |
66.0% |
SWE-Atlas-Test-writing |
50.8% |
50.4% |
50.4% |
51.1% |
— |
60.3% |
StepCodeBench† |
49.0% |
40.2% |
43.9% |
61.0% |
— |
63.9% |
StepCode-Bench-Daily† |
64.9% |
69.1% |
57.7% |
— |
— |
77.6% |
StepCode-Bench-General† |
65.0% |
62.0% |
65.2% |
64.3% |
— |
68.3% |
通用 Agent |
|
|
|
|
|
|
GDPval-AA v2 |
1571 |
1634 |
1548 |
1580 |
1724 |
1735 |
τ³-Banking |
42.5% |
50.3% |
46.0% |
41.4% |
47.2% |
42.1% |
AutomationBench-AA |
51.0% |
62.2% |
58.3% |
68.5% |
59.4% |
56.6% |
AutomationBench (public) |
44.0% |
48.2% |
46.7% |
— |
— |
— |
AA-Briefcase |
1417 |
1511 |
1492 |
1562 |
1662 |
1645 |
Toolathlon-Verified |
74.1% |
73.0% |
76.5% |
— |
77.8% |
80.6% |
MCP-Atlas |
85.6% |
86.8% |
85.3% |
— |
— |
87.0% |
PresentBench |
76.8% |
74.5% |
75.6% |
— |
— |
77.3% |
OfficeQA Pro |
60.3% |
59.1% |
62.6% |
67.7% |
— |
64.7% |
SpeadSheet v2 |
29.4% |
30.5% |
31.9% |
31.4% |
— |
32.8% |
JobBench |
59.0% |
61.4% |
54.3% |
— |
— |
65.7% |
Apex-Agents |
37.8% |
38.1% |
41.0% |
— |
— |
41.8% |
Draco |
83.3% |
82.3% |
78.5% |
76.8% |
87.7% |
87.6% |
BrowseComp |
88.7% |
— |
91.2% |
91.5% |
— |
90.2% |
HLE w/ tools‡ |
59.4% |
62.5% |
56.0% |
57.2% |
65.0% |
63.6% |
FinStepBench-LiveSearch† |
74.5% |
73.3% |
70.9% |
74.5% |
— |
76.2% |
FinStepBench-CorporateValuation† |
60.6% |
56.1% |
60.6% |
77.3% |
— |
69.7% |
FinStepBench-FinanceDR† |
55.8% |
53.3% |
48.9% |
45.0% |
— |
59.1% |
FrontierFinance |
66.4% |
64.1% |
62.6% |
55.0% |
— |
69.7% |
电脑操作 |
|
|
|
|
|
|
Agents’ Last Exam (ALE-CLI) |
29.5% |
28.6% |
27.6% |
33.3% |
— |
28.6% |
多模态与文档 |
|
|
|
|
|
|
MMMU-Pro |
76.0% |
— (text only) |
81.0% |
87.0% |
— |
85.0% |
GDP.pdf |
14.8% |
11.2% |
22.0% |
31.0% |
26.2% |
21.6% |
- 标注 † 的评测基准为内部自研。
- 加粗数值表示该行的最佳结果,下划线数值表示次佳结果。
- 对于 HLE w/ tools‡,Step 5 Preview (High)、DeepSeek V4.1 Flash (Max) 与 GLM-5.3 (Max) 在纯文本子集上评测,其余模型在完整数据集上评测。不同评测设置下的结果不具备直接可比性。