旧Pro仅8分,DeepSeek-V4-Flash在DeepSWE冲到54.4分,接近Opus 4.8

你这是违法行为 2026-07-31 14:37 1

在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。


这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。


不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek 自己尚未发布的 Harness 极简模式,Agent 成绩会同时受到模型和执行框架影响。


最新回复 (6)
  • yxyxy 07-31 14:45
    1

    等v4pro,感觉还是鲸鱼是真正的国模一哥

  • 你这是违法行为 楼主 07-31 14:47
    2

    这玩意有点太猛了 我都怀疑是不是针对性刷榜了

  • blacksein 07-31 14:49
    3

    这就是后训练的力量吗…

    之前cursor微调kimi之后 模型能力也有比较大的突破

  • 朴实无华 07-31 14:51
    4

    后训练就是这么牛。所以这些厂家0.1发布模型,然后xai收购 cursor 就是为数据

  • yxyxy 07-31 14:59
    5

    你梁叔叔可是要搞AGI的人,在给我们梁圣四个月干翻你A÷

  • Sam Altman 07-31 15:01
    6

    今天唯一的输家只有一个涨价的小丑

* 帖子来源Linux.do
返回