[Nao 榜] v4.1 flash,你在哪里……?往上走走啊

calendar 2026-09-10 18:31 1


还是……做不到吗?ds 系列就像一条毛毛虫,慢慢向上蠕动

最新回复 (19)
  • apparition 09-10 18:33
    1

    说不定是 claude code 的问题

    换 dsh 看看

  • person 09-10 18:33
    2

    比不上glm-5.3-flash?

  • kimi 09-10 18:33
    3

    Nao 榜通常QWEN 和 Gemini 都比大众体感的排名有差别

    是一个偏科的榜

  • lanvent 09-10 18:36
    4

    试试dsh吧,可能又训得过拟合了

  • listening 09-10 18:37
    5

    是一个偏科的榜



    我是比较认同nao榜的,逻辑测试ds v4.1 flash的分数就比较好看。编程能力属于正常范围。

  • 白学森 09-10 18:39
    6

    用Claude Code测试的


    不过其实也没差多少

  • undefined 09-10 18:42
    7

    国产三家都在,这榜至少不是一眼假。

    其他就没啥好说的了。


    那啥排那么前面,真有人用???

  • unsafetrait 09-10 18:43
    8

    现在野榜是真的多,前面有个AA,后面有个NAO,他家测评,别人说不好的模型,它都能测试出好了也是挺神奇的 ^-^


    现在的榜单就和安兔兔一样,各家都想办法订自己标准,然后从中间捞钱

  • Jiopaaaaa 09-10 18:46
    9

    个人体感DeepSeek的还是比glm5.3-flash要好用些,某次任务glm5.3-flash疯狂的来雷霆大思考,干思考不干活儿……还是换了DeepSeek pro快速的响应处理了

  • EAR_EAC 09-10 18:46
    10

    嘶。。。这么低吗?我体感感觉是比glm5.3flash好的哇

  • wayned 09-10 18:47
    11

    Gemini 3.7 Flash 和 GLM 5.3 Flash 的位置和我的体感有点差距,我感觉 V41F 可能比这两个好一点,当然也可能是场景差异

    Gemini 我感觉主要是短小的任务能力尚可,稍微长一点的任务就容易偏离了

    GLM 5.3 Flash 则是通过雷霆大思考,时间换的效果,不过鉴于价格便宜,倒是一个比较甜品的模型

    其他的感觉差距不太大

  • 君葯 09-10 18:47
    12

    看到鲲3.8Max排在中游就没必要继续看了,这个榜单无非两种情况①偏科严重②刷分方便但没有针对训练。今天项目跑了一天从GLM-5.3-Flash 切到DP4.1体感提升不少

  • Kassdin 09-10 18:48
    13

    Deepswe 一百道题都快成野榜了,nao 这常年不变五道题是不是有点草台了^-^

  • Procyon 09-10 18:51
    14

    常年不变五道题



    nao的题目是变了的,你可以看看前几个月的月榜

    大家都会做的题目被剔除,大家都不会的新题目被加入

  • 汉武帝(的大熊猫) 09-10 18:51
    15

    DDDD 声量大的不一定真的好. 现今互联网现状如此. 有些因为太烂挨骂, 有些因为好被骂.

  • listening 09-10 18:57
    16

    nao 这常年不变五道题是不是有点草台了



    前面有人怀疑公正性/准确性或许还有点道理(毕竟规模还是有限的),但你这里说“常年不变五道题”就是纯云了,J/K/L都是新题。


    glm5.3flash为什么排的高一位呢?它是8月末发布的,没测K/L。(排序不绝对)

  • 996 09-10 19:00
    17

    请问佬们deepseek v4.1 flash 打得过腾讯的hy4吗

  • nuJC0 09-10 19:07
    18

    这个博主就是hy员工,所以榜里没有,按照他的测试集应该和glm5.3差不多

  • 越rrdvdfvd 09-10 19:15
    19

    榜里的qwen和gemini实战中都没人长期用,何必加上去

* 帖子来源Linux.do
返回