Opus 4.8 登顶 nao 逻辑推理榜单

calendar 2026-05-30 08:56 1

来源:LLM Benchmark Leaderboard


最新回复 (19)
  • GreatMOLA 05-30 09:03
    2

    怎么中位数还退步了?看起来耗时很长,难道是 Timeout?

  • 冰原Bill 05-30 09:07
    3

    中位数才反映智力水平,还应该加入方差,反映幻觉率。

  • Sokeu 05-30 09:14
    4

    我一般都按中位数排序.


    目前看来是没什么脑子.

  • 泡芙小圆手 05-30 09:15
    5

    那看来这个榜的含金量不大,4.8纯纯弱智模型,不如swe

  • Lx1523 05-30 09:16
    6

    现在大模型是不是都是发展没有那么快了,貌似差距越来越小了

  • 05-30 09:23
    7

    qwen3.7 max有用过的佬的吗,看很多名单都榜上有名

  • Eeevan 05-30 10:03
    8

    这个榜的关注点是中位数,而不是极限成绩,那个反应实际推理智力体验

  • 且拭羽 05-30 10:14
    9

    不是,按nao说法,这个模型有过度推理倾向导致很多题目超过80K推理限制从而记零分,所以中位分才会这么低,实际中位分应该更高,个人估计应该排gpt-5.5之前是没啥问题的

    不过也因为过度推理实际成本很比gpt-5.5更高

  • 阳青 05-30 10:17
    10

    那是不是说明这个榜单和实际差异太大,没什么参考价值了

  • Jeff Dean 05-30 10:19
    11

    感觉这个榜挺野的,推理能力难道不应该和数学能力挂钩,MathArena的结果和这个相差太大

  • 且拭羽 05-30 10:19
    12

    也不能这么讲,至少就我个人体感上是挺符合我对模型的排名的

    而且推理限额80K也很宽裕了,超限额是因为开的xhigh档位

  • 且拭羽 05-30 10:21
    13

    题目组成上似乎文字推理会更多一些

    nao这个榜单应该是仅有的中文文字推理榜单了,其他榜单要么不是文字推理(Coding的会比较多)要么不是中文

  • Jeff Dean 05-30 10:24
    14

    但是MathArena是数学(也算文字)推理不重coding

  • 彼方 05-30 10:48
    15

    这个榜测的是纯智力,swe测的是编程能力,,

  • 彼方 05-30 10:54
    16

    推理能力为什么会和数学能力挂钩?空间感知、上下文召回、指令遵循、幻觉控制、直觉能力,这些都不属于或不完全属于数学能力

  • karx 05-30 11:00
    17

    这个榜qwen3.7好牛,以后优化好agent能力的话,未来可期啊

  • Hooledy 05-30 13:22
    18

    数学与文字logic?这里应该有区别,从语义理解上,数学理解题意比刻意构建的文字推理更简单


    榜单侧重后者,和日常使用感知匹配,比如qwen3.7max的文字理解能力比DeepSeek V4 Pro强些


    可能以后会加一些自然科学和数学难题,GPT大力训练过的自然科学和数学能力就会显现

  • 星际泰迪 05-30 13:24
    19

    中位数排序的话Qwen3.7Max第二了诶

  • yuanc 05-30 18:02
    20

    claude最近的更新还是不错的,比codex还是好一点,不过codex编码能力更强一点

* 帖子来源Linux.do
返回