DeepSeek V4.1 Flash 大模型性价比斩杀线

LLMeme 2026-09-11 19:59 1

随着 GPT 6 Astra 发布, Artificial Analysis 可能是为了防止自己沦为野榜,紧急更新了几个版本。昨天 DeepSeek V4.1 Flash 的分数也出来了。现在把最新版的数据重新制图一下:



可以看出,把原来的 GPT 5.6 Luna (Max) 给超了。


标准修改最大的“受害者”或许是 MiMo ,原本是紧贴着帕累托前沿线的,现在直接掉到里面去了。


应之前 网友的需求,方便大家只看感兴趣的模型,专门做了一个网页版:




还搞一个切换,方便大家直观感受线性坐标的成本差距


最新回复 (5)
  • aaa 09-11 20:13
    1

    这波Flash把Luna Max超了挺猛,MiMo掉出前沿线有点惨。网页筛选模型挺方便的。

  • lueluelue 09-11 20:15
    2

    我不建议以“ Artificial Analysis”总榜来定

  • LLMeme 楼主 09-11 20:23
    3

    不过现在用什么指标最好,似乎已经进入到众说纷纭的阶段了

  • runner dhero 09-11 20:26
    4

    AAL的评分就图一乐,完全是用前列那几个大模型的体感去硬拟合出一套benchmark权重……实际上这么做没有任何道理,不然也不会搞出来astra刚发布的时候干不过5.6sol的搞笑事件


    人家别人的benchmark至少是benchmark检验模型,它家的是用模型去调整benchmark

  • unsafetrait 09-11 20:29
    5

    视觉上还是不太行的,纯斩杀有点难,前端也不太行,但是比GPT5.6好 ^-^ 比GLM略差


    但是视觉能力上差距太大,这个远不及GLM,更别提KIMI了,GEMINI那更是遥不可及,只说视觉这块

* 帖子来源Linux.do
返回