gemini-3.8-flash high DeepSWE 超过 opus5 暂时登顶?

KK 2026-09-02 23:50 1




这真的还是我们的美国大豆包吗 ^-^

最新回复 (19)
  • deepcake 09-02 23:53
    1

    这怎么比谷歌官方自己测的还要高?

  • 蛋炒饭 09-02 23:54
    2

    这么强,谷歌怎么没有高调宣传一下,难道他们想扮猪吃老虎^-^

  • Hifumi Mizuhara 09-02 23:54
    3



    谷歌官方的图在这里,这里看是没有到Opus 5的

  • ikb 09-02 23:55
    4

    输出143k + 166步 还是有点高了,靠长输出长思考拿到的分数比较虚。token效率方面GPT还是绝对的王者。

  • 114 09-02 23:55
    5

    这套题都快过拟合了吧,最近的模型都69%左右,该升级了吧,不然毫无参考价值,沦为野榜 ^-^

  • ikb 09-02 23:56
    6

    这个图里gemini的分可能是medium的

  • 天则则 09-02 23:57
    7

    有咕噜咕噜的榜默认野榜就行了。

    当年从 2.5Pro 开始刷分就没停过。

  • Hifumi Mizuhara 09-02 23:58
    8

    坏了,现在DeepSWE也是野榜了吗

  • koubibulaien 09-02 23:59
    9

    虽然token是两倍多,但是TPS比两倍还多呀,sol的TPS日常是三四十,flash的tps日常200起步

  • 天则则 09-02 23:59
    10

    都让谷歌刷明白了,这套题也快退役了

  • Hifumi Mizuhara 09-02 23:59
    11

    价格也便宜两倍还多,总结上几乎无感

  • Hifumi Mizuhara 09-03 00:00
    12



    看起来Terminal Bench 4.0还没被刷明白,其他都刷的明白了

  • Elon1 09-03 00:00
    13

    这真的还是我们的美国大豆包吗 ^-^



    计划有变,准备夺冠!


    老将的力量这么强吗

  • Hifumi Mizuhara 09-03 00:01
    14

    看来大换血真的有点用,之前的GDM的人都在摸鱼吗

  • KK 楼主 09-03 00:01
    15

    埃隆,你家的 4.7 不是也要夺冠了吗 ^-^

  • ikb 09-03 00:02
    16

    虽然token是两倍多,但是TPS比两倍还多呀,sol的TPS日常是三四十,flash的tps日常200起步



    不能这么比,同样的任务输出token多了步骤多了会给心智注意力带来很大压力的,长程任务很容易不稳。GPT 400K context能干你GEMINI 1M context能干的事还能干得更好,GEMINI跑到1M context脑袋都一团浆糊了。

  • 吴亦Fan? 09-03 00:03
    17

    哈吉米长任务就是废,深度体验过气死人!

  • Hifumi Mizuhara 09-03 00:05
    18

    GPT官方都建议限制在256k context哎

  • ikb 09-03 00:07
    19

    codex里默认的context大小整体是272K+128K=400K

* 帖子来源Linux.do
返回