大模型排行榜到底哪个权威?

fankcoder 2026-08-04 09:28 1

Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?



  1. 排行第 4 https://arena.ai/leaderboard/code/webdev

  2. 排行第 7 https://llm-stats.com/

  3. 第十名之后去了 https://artificialanalysis.ai/leaderboards/models

最新回复 (40)
  • vzextreme 08-04 09:33
    1
    看厂商对哪家测评机构特调🐶
  • hiddendeerer 08-04 09:39
    2
    https://artificialanalysis.ai/leaderboards/models
  • cowcomic 08-04 09:42
    3
    arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
    其他数据集评测的主要还是看测试数据分布和泄露情况了

    中文也有榜单
    https://www.superclueai.com/homepage
  • tcper 08-04 09:43
    4
    看评分标准,
    arena 就是通过匿名选择喜好,体现用户体验
    llm-stats 是多个评分集的聚合
    AA 自建评测集,这些集体现大模型对未知问题的推理能力

    不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。
  • lel020 08-04 09:44
    5
    牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
  • Bootis 08-04 09:58
    6
    arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
  • fankcoder 楼主 08-04 09:59
    7
    @tcper 感谢
  • opeth 08-04 10:00
    8
    我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
  • wang93wei 08-04 10:01
    9
    我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
  • klion 08-04 10:04
    10
    https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能

    Terminal-Bench Hard

    AA-Omniscience Accuracy

    Humanity’s Last Exam

    GPQA Diamond
  • xiaoxixi 08-04 10:23
    11
    好多排行站,之前都没关注过
  • soulflysimple123 08-04 10:42
    12
    看 https://artificialanalysis.ai/
    我看 Qwen3.8-max 里面还没有
  • sillydaddy 08-04 11:02
    13
    我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
  • rich1e 08-04 11:51
    14
    排行榜上的权威与真实体验,一些情况下并不相符合

    就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作

    - 视频分析时,可能会用到 claude vision
    - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet )

    以上这些,如果模型没有适配,CC 就无法工作

    所以,大模型排行榜看看就好,权威也改变不了真实体验

    推荐这个,https://x.com/karpathy/status/2083749667410727319
  • nakun233 08-04 12:00
    15
    当然是 DeepSWE 1.1
  • kuhung 08-04 12:18
    16
    我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
  • sxbaixing 08-04 12:24
    17
    千问向来是跑分高,体验差
  • mmdsun 08-04 12:32
    18
    论知名度还是 arena 靠谱
  • OumaeKumiko 08-04 12:38
    19
    竟然还没有人发东山奈央的😂 俺也不知道是否权威
    [toyama nao - 知乎]( https://www.zhihu.com/people/toyama)
  • uncleroot 08-04 12:41
    20
    不知道有没有各种语言的“人味”排行。机器味太重了
  • wakarimasen 08-04 12:47
    21
    权威这两个字令人困惑。

    如果你要权威数据应该看厂商发布的第一方数据
  • Wcowin 08-04 12:50
    22
    具体场景具体分析吧,适合自己就是最强的。
  • jonsmith 08-04 14:10
    23
    编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
  • cabudad 08-04 14:25
    24
    什么排行榜都没有自己亲身使用权威,好不好用了才知道
  • SeleiXi 08-04 14:30
    25
    让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
  • ybybwdwd 08-04 15:52
    26
    @cowcomic arena 是可以刷的,可以用提示词试出是哪个模型
  • levn 08-04 16:03
    27
    普通人类评价早就已经没用了在大多数时候
  • jark006 08-04 16:05
    28
    我比较信 DeepSWE
  • Bootis 08-04 16:10
    29
    https://cursor.com/cn/cursorbench
  • escapefear 08-04 17:13
    30
    我奉行对标谁就用谁的原则
  • LK996 08-04 17:19
    31
    和手机评测一样,都是给够前就上的婊子,没有干净的
  • Znemo 08-04 17:31
    32
    哪个 Gemini 排名最低相信哪个。
  • William337 08-04 17:31
    33
    没有,需要自行判断,仅供参考
  • Haku 08-04 17:37
    34
    arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
  • aes114514gcm 08-04 18:25
    35
    @OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
  • JerryZhi 08-04 18:38
    36
    目前普遍思路是采集十几个排行榜求平均(或者加权)
  • cellsyx 08-04 18:54
    37
    比较符合个人体验的是 DeepSWE (不包括前端设计能力)
  • FlashEcho 08-04 19:20
    38
    根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
  • Glauben 08-04 20:04
    39
    我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
  • Mandelo 08-04 20:48
    40
    没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。
* 帖子来源V2EX
返回