Asart在AA榜的表现是不是有点抽象了

lxb123 2026-09-04 04:04 1



足足前进了0.3直接被四舍五入了 ^-^

感觉完全没测出真实能力啊

最新回复 (14)
  • xiedian 09-04 04:08
    1

    666,难道gpt也炼废了?^-^就提升这么点

  • 天上火 09-04 04:10
    2

    看推特上说是他这个排行榜的权重聚合出了问题 astra 在他这个榜上连 muse1.3 都不如 扎克伯格知道自己的模型已经这么强了吗?

  • 天上火 09-04 04:11
    3

    这 aa 官方也是不带脑子的,敢带这种节奏,到时候但凡 astra 表现突出一点 aa 都要被清算,不知道怎么想的

  • Lazelz 09-04 04:12
    4

    很难想象gpt6是一个只比gemini 3.8flash高2分的模型…

  • mild_cloud 09-04 04:12
    5

    这个muse1.3是不是过于逆天了

    划时代的刷分机器吗这是

  • lueluelue 09-04 04:12
    6


    虽然Epoch ECI也不够完美,但我觉得比AA好

  • WolfHolo 09-04 04:21
    7

    aa太离谱了 不说别的muse-spark-1.3这条 能排这么高

  • polaris 09-04 04:23
    8

    ^-^这种情况算是AA榜抽象还是Asart抽象?

  • lueluelue 09-04 04:23
    9

    我特别期待这个刷分大王在ECI上给了多少分^-^

  • lueluelue 09-04 04:25
    10

    大概率是AA的榜太垃圾了,在Epoch 的 ECI上Astra遥遥领先

  • 天上火 09-04 04:31
    11

    关于 aa,出现这种情况也不是一次两次了



    gemini3.1Pro/4.6sonnet>4.6opus 的来 最有含金量的榜单耍起嘛

  • xiaomao 09-04 04:33
    12

    目前综合几个榜单看来coding能力不如fable5


    数学,思维比较强,学术佬有福了

  • lueluelue 09-04 04:34
    13

    对比,这是ECI的

  • Hifumi Mizuhara 09-04 04:36
    14

    看了半天什么叫Asart……

    我有一个猜想,会不会模型规模很大,训练容易炸膛,比如DS也是这样

* 帖子来源Linux.do
返回