Step 5 Preview 600B-A27B 发布 新一代“帕累托前沿” 跻身国模第一梯队 并且会开源

fengchris 2026-09-20 10:22 1

官方博客:阶跃星辰


Step 5 Preview 在 AI 编程、软件工程、专业知识工作等任务上达到前沿水平,并在金融领域展现出尤为突出的能力。Step 5 Preview 采用稀疏 MoE 架构,总参数量 600B,每个 Token 激活 27B 参数,支持 1M Token 上下文窗口和视觉输入。


评分惊人,跻身第一梯队







Step 5 Preview 现已可通过我们的产品和 API 使用。 模型将于 10 月 15 日正式开源。


更完整的评测结果,覆盖 Reasoning、Coding、Agent、Finance 和 Multimodal 等多个方向。






































































































































































































































































































































































































































评测基准 Step 5 Preview (High) GLM 5.3 (Max) Kimi K3 (Max) GPT-6 Astra (Max) Claude Fable 5.1 (Max) Claude Opus 5 (Max)
推理与知识
GPQA Diamond 93.5% 91.7% 93.5% 96.1% 93.7% 93.2%
HLE 46.5% 42.3% 46.9% 54.7% 59.1% 54.9%
AA-LCR v1.1 88.3% 79.7% 88.7% 80.7% 85.3% 79.3%
CritPt 20.9% 19.1% 23.4% 31.7% 29.7% 29.1%
Coding
DeepSWE v1.1 67.7% 66.9% 67.5% 74.1% 67.4% 74.0%
Terminal-Bench v2.1 85.0% 83.9% 85.0% 88.4% 91.4% 89.1%
Terminal-Bench v4 33.3% 41.9% 12.6% 57.9% 55.8% 52.3%
CyberGym 84.7% 84.5% 80.0%
SciCode 58.9% 59.0% 59.5% 56.5% 63.1% 56.4%
RoadmapBench 54.3% 54.1% 55.4% 68.3%
ProgramBench (Pass Rate) 80.5% 72.0% 77.8% 85.4% 82.7% 82.3%
SWE-Marathon v1.1 (Partial Score) 72.7% 67.4% 84.4% 77.3% 80.2% 85.6%
MLS-Bench-Lite 40.5% 37.3% 48.3% 50.3% 49.8%
SWE-Atlas-QnA 63.6% 59.6% 59.5% 60.9% 66.0%
SWE-Atlas-Test-writing 50.8% 50.4% 50.4% 51.1% 60.3%
StepCodeBench† 49.0% 40.2% 43.9% 61.0% 63.9%
StepCode-Bench-Daily† 64.9% 69.1% 57.7% 77.6%
StepCode-Bench-General† 65.0% 62.0% 65.2% 64.3% 68.3%
通用 Agent
GDPval-AA v2 1571 1634 1548 1580 1724 1735
τ³-Banking 42.5% 50.3% 46.0% 41.4% 47.2% 42.1%
AutomationBench-AA 51.0% 62.2% 58.3% 68.5% 59.4% 56.6%
AutomationBench (public) 44.0% 48.2% 46.7%
AA-Briefcase 1417 1511 1492 1562 1662 1645
Toolathlon-Verified 74.1% 73.0% 76.5% 77.8% 80.6%
MCP-Atlas 85.6% 86.8% 85.3% 87.0%
PresentBench 76.8% 74.5% 75.6% 77.3%
OfficeQA Pro 60.3% 59.1% 62.6% 67.7% 64.7%
SpeadSheet v2 29.4% 30.5% 31.9% 31.4% 32.8%
JobBench 59.0% 61.4% 54.3% 65.7%
Apex-Agents 37.8% 38.1% 41.0% 41.8%
Draco 83.3% 82.3% 78.5% 76.8% 87.7% 87.6%
BrowseComp 88.7% 91.2% 91.5% 90.2%
HLE w/ tools‡ 59.4% 62.5% 56.0% 57.2% 65.0% 63.6%
FinStepBench-LiveSearch† 74.5% 73.3% 70.9% 74.5% 76.2%
FinStepBench-CorporateValuation† 60.6% 56.1% 60.6% 77.3% 69.7%
FinStepBench-FinanceDR† 55.8% 53.3% 48.9% 45.0% 59.1%
FrontierFinance 66.4% 64.1% 62.6% 55.0% 69.7%
电脑操作
Agents’ Last Exam (ALE-CLI) 29.5% 28.6% 27.6% 33.3% 28.6%
多模态与文档
MMMU-Pro 76.0% — (text only) 81.0% 87.0% 85.0%
GDP.pdf 14.8% 11.2% 22.0% 31.0% 26.2% 21.6%


  • 标注 † 的评测基准为内部自研。

  • 加粗数值表示该行的最佳结果,下划线数值表示次佳结果。

  • 对于 HLE w/ tools‡,Step 5 Preview (High)、DeepSeek V4.1 Flash (Max) 与 GLM-5.3 (Max) 在纯文本子集上评测,其余模型在完整数据集上评测。不同评测设置下的结果不具备直接可比性。

最新回复 (15)
  • fengchris 楼主 09-20 10:24
    1

    API价格也是涨得厉害


    部分Plan用户已经可用的

    (我这按次数的老mini套餐还不行,各位有plan的佬友自测)

  • asyu9912 09-20 10:29
    2

    这定价也是不低,高达1USD/3USD了

  • 栏杆拍遍 09-20 10:31
    3

    这怎么国内价格比 国外还贵呢?

  • jcc 09-20 10:34
    4

    套餐给的多,性价比很不错


    199套餐,每月有8000人民币的额度


    而且是套餐条款里,清清楚楚的写的每月给8000


    和gpt那种各种暗改的不确定的额度不一样

  • 野酒 09-20 10:36
    5

    他们家的plan给的额度堪称丧心病狂,不能按单价算的。49元8倍 99元16倍 199元40倍。

  • AiharaMahiru 09-20 10:36
    6

    这么看性价比挺高,就怕以后暗改额度和倍率

  • asyu9912 09-20 10:38
    7

    那这看起来确实,有佬实测一下智商吗,现在很怕做题模型(((

  • huachuan12 09-20 10:43
    8

    我昨晚跑了一下,思维链非常有问题,各种重复,思考效率很低

  • 内一衡径数 09-20 10:47
    9

    国模越来越喜欢搞几百B的编程特攻小模型(按现在的业界行情应该算小吧)了, 这样下去会被 GPT 和 A​^-^ 拉开的越来越大

  • ysin 09-20 10:48
    10

    这家从来没试过,有懂得佬吗?

  • Localhost 09-20 11:09
    11

    benchmark 里为啥不和 deepseek v4.1 flash比啊,是因为不想吗

  • wren 09-20 11:10
    12

    早上试了试 ,各位看看

  • 羽于羊 09-20 11:10
    13

    这个定价怎么实现性能-定价的帕累托最优啊

  • han154 09-20 11:27
    14

    画一个鹈鹕为什么能画15分钟都没画完 在claude cli里面使用的


  • unsafetrait 09-20 11:29
    15

    我就不试了,毕竟翻车的比较多,等诸位佬友测试,真牛逼的话我们再大量购入

* 帖子来源Linux.do
返回