DeepSWE更新了GPT-6 Astra各档位的结果:xhigh最聪明,medium性价比最高

lanvent 2026-09-05 13:10 1



虽然其他家已经把DeepSWE刷成野榜了,但我还是愿意相信OAI有道德,看看Astra自己的成绩。
























































档位 Pass@1 平均成本/任务 输出 Tokens 步数
low 67% ±1% $2.19 11k 20 省钱档位
medium 73% ±3% $4.38 20k 26 性价比首选
high 73% ±3% $5.72 27k 27
xhigh 74% ±3% $6.52 30k 29 最聪明
max 73% ±1% $12.37 61k 28

日常开发medium很适合,高智力需求选择xhigh。

最新回复 (14)
  • Steven lu 09-05 13:11
    1

    我还是默认max

  • 青四皈依 09-05 13:12
    2

    怎么还有倒反天罡

  • eroneko 09-05 13:13
    3

    Astra提高思考强度只会增加思考token不会增加步数,换言之对于deepswe这个任务从medium往上几乎都是无效思考了?一通思考之后操作其实还是差不多

  • BigFace 09-05 13:13
    4

    luna-max这么强吗?

  • 青四皈依 09-05 13:13
    5

    意思是题目太简单了?

  • wayned 09-05 13:20
    6

    补一张只有 Astra,清晰一点的图:

  • deepcake 09-05 13:24
    7

    Openai以前就刷过分了吧,所以DeepSWE看起来提升不大,Astra、SOL、TERRA、Luna的分数都很接近。

  • lanvent 楼主 09-05 13:28
    8


    让sol分析了下,佬可以看看

  • refalogy 09-05 13:37
    9

    astra我还以为能几乎满分呢

  • 曦岚 09-05 13:38
    10

    我看x上面说high

  • 时牧 09-05 13:42
    11

    gpt luna(max)把老大哥astra(low)干翻了,下克上

  • 萌面大虾 09-05 20:09
    12

    这样看哈基米3.8 Flash真的好恐怖 ^-^ ^-^

  • mi tu 09-05 20:33
    13

    3.8用下来还是gemini的感觉贼自信,用久了就瞎改,但是日常对话或者一轮写前端之类的确实很强了

  • mba03gl 09-05 20:37
    14

    Gemini 这个模型的能力要是认真干活就是日翻一切的节奏,天知道谷歌是怎么调教的。

* 帖子来源Linux.do
返回