DSV4 0813 Terminal-Bench 官方跑分与 AA 榜跑分出现巨大差异(和Flash一模一样)

邱埋葬 2026-08-13 09:33 1



其他模型也略有差异(K3 & Fable 5 & Flash0731 AA榜低3分),但不至于差了10分。





分数跟 flash 完全一样,可能是 api 模型调度有问题?
[image]
最新回复 (16)
  • calendar 08-13 09:37
    2

    那我就放心了,悬着的心又悬了起来

  • 0xfa 08-13 09:37
    3

    DeepSeek这是跟前段时间qwen3.8一个问题,模型部署错了?还是啥问题,看不懂

  • Anew 08-13 09:38
    4

    感觉是出问题了,是部署错了,还是切换错了,还是遇到BUG了?不知道官方自己知不知道问题

  • 快热的鸭皮 08-13 09:39
    5

    感觉测的还是flash正式版,并不是pro正式版,等后面看会不会更新

  • IlIIlI 08-13 09:41
    6

    图一的grok4.6对吗,我看站内佬友测的醍醐骑自行车把背景都蹬转起来了 ^-^

  • yydxx 08-13 09:42
    7

    [image]
    ↑max
    ↓默认(high)
    [image]
    以相同的prompt,max思考的思考时间更短,质量更差,智商更低。high的风格和4f的后训练风格是一致的,反而max更像是根本没改模型或者路由到什么3.2去了
    [51fdd69d95a7dd7fe78e5bca39ec165]
    max的思考时间远不如high的600起步
    [fac8bc07e0bc47c1efb34…


    deepseek v4 pro正式版的max好像有问题

  • Soulize 08-13 09:46
    8

    我接zcode message api是正常的,鹈鹕测试max思考20分钟左右,high只会思考8分钟左右

  • He110 08-13 09:47
    9

    ds 已经写了,是基于自家 Agent 跑分的,这玩意都没发布,分数有差异很正常吧

  • SC 08-13 09:48
    10

    我悟了, 先装糖阴友商一波, 等他们发新模型然后涨价再发好的 ^-^

  • 邱埋葬 楼主 08-13 09:48
    11

    这也差得太远了吧……也就是说,在AA榜的跑分机制下flash和pro平起平坐。

  • jerry wu 08-13 09:53
    12

    aa榜跟实际使用感觉差不多,感觉还打不过flash,这是什么屌pro ^-^

  • sxjeru 08-13 09:54
    13

    分数跟 flash 完全一样,可能是 api 模型调度有问题?


  • fengchris 08-13 09:54
    14

    静待ds调好

    harness也一并出来吧

  • He110 08-13 10:03
    15

    等等看呗,站内之前有帖子,看起来可能之前 max 思考路由错了

  • 快热的鸭皮 08-13 10:07
    16

    看到有帖子说有时候调用的是flash吧,不是调用pro,可能是有点问题,不可能评分这么低

  • 酷睿哥 08-13 10:11
    17

    确实有问题,最终分数是58+,肯定强于Qwen3.8/Muse Spark 1.2



    AA的分数只有53, 仅比Flash 0731的52仅高1分,肯定有问题,
    很有可能是为了抬同期发布的Grok4.6,故意先压一下V4 Pro 0813, 毕竟是美国人搞的榜单 ^-^
    当然也不排除是DeepSeek部署的问题,很多人反应Max思考比High还弱,
    可以对比这个国人自己的榜单,用跑分计算的相对排名,比绝对分数更有参考性aHR0cHM6Ly9zdXlvdW1vLm…
* 帖子来源Linux.do
返回