又一个测评 v4f,有点夸张

waffie 2026-08-03 10:00 1


排第一了


(4) X 上的 Morgan:“Okay, the results on my DeepSeek V4 Flash benchmark are now complete on @VulcanBench. And wow, was not expecting this. This is also why I think it’s so important to benchmark across effort levels. DeepSeek took the top spot, but not with high effort with Medium effort, Grok https://t.co/JiaqJdByii” / X

最新回复 (17)
  • 思维建筑工 08-03 10:04
    1

    v4f干掉了肥波?而且预览版的ds也这么强?这是模型性价比排行吗?

  • 屑派大星 08-03 10:04
    2

    谁都能来评价一下了是吧,服了这些排榜的了

  • CaoBiang 08-03 10:05
    3

    他这个榜的指标是“一次生成通过测试的概率”,我觉得是野榜

  • Draw 08-03 10:05
    4

    不是,这什么排行榜啊,看着好野啊……

  • MicroSeg作者 08-03 10:06
    5

    和我的体感不符啊,虽然已经是我的主力代码模型了,但是拿来和肥波 sol比不合适

  • 白泽 08-03 10:06
    6

    我觉得现在需要一个排行榜置信度的排行榜…

  • 散装江苏 08-03 10:07
    7

    快进到无限嵌套,“子子孙孙无穷尽也”

  • Nxty 08-03 10:08
    8

    差不多得了,flash本质是小模型啊,性价比排最前就行了 ^-^

  • aeroides 08-03 10:08
    9

    哥 吹牛逼也不能这么吹啊 deepseek>fable/opus 还是在前端榜上

  • kuku 08-03 10:13
    10

    这就牛逼了,这个应该是解决某种特定的场景的问题

  • Decidable6471 08-03 10:14
    11

    最高信任度的榜 就是 deepswe 了

  • 08-03 10:41
    12

    没有干掉吧,我用v4f感觉跟glm5.2差不多,在trae和codebuddy里面用的,感觉上不如k3好,我用k3改问题一把过,这二个改了没改到点子上

  • Tsingten Hsu 08-03 10:48
    13

    再来一个排行榜置信度的排行榜置信度的排行榜

  • deqhi 08-03 10:50
    14

    这么强,必须得起飞了,holy shit.

  • kobexi 08-03 10:57
    15

    性价比排名必须第一,其他的排名能上第一就有点假了。今天已经上强度使用了,国模崛起!

  • Joker 08-03 11:01
    16

    这还没等DeepSeek harness端上来呢,这些评测标准不好统一啊,也就看看,最重要还是体感

  • clzero 08-03 11:18
    17

    这个排行榜成功把模型能力评测的焦点转换为了站点本身野性的评测

* 帖子来源Linux.do
返回