根据网传消息复原v4.1f deepswe跑分:全部斩杀

羽织 2026-09-09 00:12 1



仅这一个榜,跑分消息来自网传微信截图

当然,跑分是跑分,实际是另一回事

来源:

微信群wy:

DeepSeek V4.1 Flash登顶世界第一模,DeepSWE超GPT6.0 Astra(消息源真假自辩) - 前沿快讯 - LINUX DO

最新回复 (19)
  • hanhanye 09-09 00:13
    1

    熟悉的全部斩杀,芜湖 ^-^

  • puppywang 09-09 00:13
    2

    啥, fable + astra 都被斩杀了? 传出去, tibo 被砍头啦…

  • Morax Cheng 09-09 00:13
    3

    呃, 这个跑分高实际效果其实待会儿又不咋样, 谁家musespark

  • Flask 09-09 00:14
    4

    我看的另一张图是mini swe呀,这不对吧

  • xzcokw 09-09 00:14
    5

    还是那么熟悉的感觉,不知道说什么。秒了

  • woshengqilenie 09-09 00:14
    6

    我只能说发狂了,以前还是很理性的,现在怎么变这样了 ^-^

  • Xiwis Homed 09-09 00:14
    7

    mini-swe可能指得是用mini-swe-agent跑的测试?


    一个官方的跑测评用的harness


  • Zef 09-09 00:14
    8

    佬,这个跑分图哪里来?官网上出分了吗?

  • crazycrazyshui 09-09 00:15
    9

    这种可以点举报吗?拿个网传图就发前沿快讯^-^

    官方一个字都没说,就你们天天给人家招黑^-^^-^

  • Dyna 09-09 00:15
    10

    把屎端着到处给人看,也不是一个好习惯。

  • Flask 09-09 00:15
    11

    那与deepswe有啥区别呀,我问ai说是不一样

  • test 09-09 00:17
    12

    mini-swe就是deepswe测评的时候会使用的harness规范

  • neteroster 09-09 00:17
    13

    真不错,那ds能拿出快两个月前fable水平的“灰测”checkpoint给大家看看吗(,想必过了这么久水平一定远超当前所有模型了吧

  • shaiNpaa 09-09 00:19
    14

    梁王回来了吗?deepseek微微发力,就是核弹?

  • xiedian 09-09 00:19
    15

    看b站视频对相同项目的评测,这个有不小的概率就是之前灰测的。

  • tufutufu 09-09 00:20
    16

    我看不是说可以达到 98%Astra 的效果,牛大了

  • CrisR 09-09 00:21
    17

    这参数量真有这分数和价格,OpenAI和A\倒闭算了

  • suiya 09-09 00:21
    18

    flash就能超越肥波5.1和gpt6那接下来的pro模型不得世界第一模型,gpt7才能打败。。不太相信

  • sxjeru 09-09 00:22
    19

    还是没能刷过第一刷分王吗。


* 帖子来源Linux.do
返回