DeepSeek V4 Flash GA 在 DeepSWE 上的排名与 Sonnet 5 和 Grok 4.5 持平

cherryfrei 2026-08-02 10:49 1

DeepSWE 这个榜单是我看到的最靠谱的榜单,不会把gemini flash和muse-spark这些明显刷分模型排到遥遥领先

最新回复 (15)
  • 大屁股家的粑粑 08-02 11:06
    1



    这个怎么看,怎么玩?大佬。。我这里怎么没ds

  • links23 08-02 11:07
    2

    谷歌真成美国豆包了,跌入谷底,除了世界知识看不出来有啥优势了

  • farq 08-02 11:10
    3

    DeepSWE 确实比那些刷分榜接地气,起码把 gemini flash 那种压下去了^-^ dsv4 能跟 sonnet5 一档挺意外,不过实战还是得分场景。

  • 08-02 11:13
    4

    我也是这样hhh为啥我这个里面没有看到国模

  • unsafetrait 08-02 11:13
    5

    确实好用,也确实解决问题的,反正这么说吧,FLASH无法解决的,你用GROK 4.5大概率也无法解决,不过GROK 4.5现在是前端要比FLASH好的


    FLASH无法解决的 SONNET5是100%无法解决的,这就很神奇了,用几个后端题测试了一下,确实这样,GROK 4.5还有概率,SONNET5基本上一坨,有2个代码BUG是FLASH解决了,SONNET5还没找到对应文件就特么奇葩


    所以为啥CLAUDE现在要从OPUS开始起步使用,SONNET真的没法用了



    这个问题是DEEPSEEK V4 FLASH解决的,SONNET5连影子都没找到,GLM5.2也没解决 ^-^


    所以很玄幻

  • yeekal 08-02 11:15
    6

    哪里的数据源,我看官方网站和x上都没有

  • 超大杯 08-02 11:17
    7

    说实话,这些榜单就像手机跑分榜一样,就是图个乐

    实际上 harness 和使用方式以及场景的影响大概能大到能把 terry 变成 sol 的程度

    各有各的优势,只要有特点的模型其实都不会很差,差的是没有特点的

  • BOOSTMEISTER 2014 DH 08-02 11:17
    8

    这是社区预测的吧,deepswe 可以自己本地跑的。但是官方网站要等他们用自己的 mini-swe-agent 独立跑一下。

  • kinda66 08-02 11:19
    9

    话说luna有那么厉害吗,不大对吧。都跟k3差不多了。

  • wc81 08-02 11:20
    10

    Flash大概就是参数太小,导致知识库太小,导致很多东西可能会想不明白,眼神清澈的985大学生,做事反而干净利落

  • kuku 08-02 11:21
    11

    能和 sonnet5 在一起了,也是非常厉害了

  • Sam Altman 08-02 11:23
    12

    Sonnet 是真垃圾,之前本人模型荒芜的时候用不起 Opus,想要用 Sonnet 凑合着一下,效果真的烂,写个 LaTeX 都写不来,到处报错

  • crazycrazyshui 08-02 11:23
    13

    5.6luna居然还比5.5强,luna不应该是个小模型吗

  • 水 楚留香 08-02 11:30
    14

    以前还经常用sonnet,3.5-4.5时期。后来opus4.5出来后,就基本再也不用sonnet.更何况现在,sonnet根本打不过gpt,更不可能去用了

  • CrisR 08-02 13:06
    15

    已经无限期待8月份的 dsv4pro了

* 帖子来源Linux.do
返回