gpt-6的AA智力出来了,啥情况

fade58887 2026-09-04 11:10 1



啥情况,AA智力基本没提升?


来源:AI Model & API Providers Analysis | Artificial Analysis

最新回复 (18)
  • 超大杯 09-04 11:12
    1

    智商全部用来

    “如何入侵友商服务器让他们停机了”^-^

  • blacksein 09-04 11:14
    2

    下面的子benchmark 大多数成绩似乎一般般


    难道是给他们路由到sol medium去了?

  • gezidd 09-04 11:16
    3

    AA野榜来的 muse1.3的评分是62

    fable5=muse1.3>astra

  • IkedaTeresa 09-04 11:16
    4

    terminal-bench不是已经4.0了吗,怎么还在用2.1?

  • master 09-04 11:17
    5

    astra没空玩无聊的AA过家家游戏,它的目标让群星爆炸(

  • mark 09-04 11:18
    6

    看到muse那么高我就觉得是野榜了 ^-^

  • 啁啾 09-04 11:21
    7

    AA榜单分数和使用体感差异越来越大了

  • push 09-04 11:22
    8

    嘻嘻,spark在这个位置,AA是什么野榜还看不出来吗? ^-^

  • Neptune 09-04 11:25
    9

    Terminal-Bench、DeepSWE 这俩比较有用,coding方面

  • EverScape 09-04 11:26
    10

    咋回事儿,这会不演了么。

  • glan chow 09-04 11:26
    11

    AA现在基本都路边一条了。推上也说了,AA的权重有问题。

  • 兰子p 09-04 11:27
    12


    terminal bench都4.0了,谷歌路边一条

  • Owen01 09-04 11:54
    13

    还看评分就 out 了,Gemini 是评分之王 haha


    顺着人性看,gpt6 官方对比的是 opus5 那说明能力应该和 fable5.1 差不多,但估计打不过 fable

  • 就不告诉你 09-04 11:57
    14

    等真的用上了再说


    榜这玩意儿看看就得了

  • Harmoney 09-04 11:57
    15

    这下压力反而给到了AA自己,坐实野榜

  • Neptune 09-04 11:59
    16

    之前只看A\几个领先到还没觉得怎样,但后边中间腰部已经非常野榜了,结果Astra一出直接证明野榜,小扎和咕咕嘎嘎俩路边都能上分,一用一个不吱声

  • Neptune 09-04 12:00
    17

  • 天上火 09-04 12:00
    18

    这 AA 也真的是神了 带起来这么大的节奏


    再次澄清关于 astra 在 aa 指数上得分低的原因

* 帖子来源Linux.do
返回