astra 官方基准测试成绩

天上火 2026-09-04 03:09 1

astra 的表现


数学:强 sota(指与第二名模型存在至少一代差距


编程:弱 sota(指与第二名存在不到半代差距)


科学:强 sota


知识工作:强 sota


泛逻辑推理:sota (指与第二名的差距在半代接近一代差距之间)


长任务:sota


上下文:世界第二水准 512k-1M 上下文捞针紧落后 muse1.3 两分



正如我之前说的,astra 必然比 fable5.1 强 这两个模型不是同一个级别的 今天来看 astra 数十项基准全都高于 fable5.1,确实如此

最新回复 (16)
  • HelsingenMosken 09-04 03:11
    1

    我就求他别发布完一周就开始流口水降智,还有就是抓紧改一改自动上下文压缩中 plan 异常缩水的问题,太难受了

  • BlueFunny 09-04 03:13
    2

    但愿不是纯纯跑分特化,sol 挺强但是跑分特化过拟合太难受了,写出来的东西除了 llm 没人能看懂

  • 天上火 楼主 09-04 03:15
    3

    从流出的结果来看,表现是对得起这个跑分的,甚至跑分有点保守了,而且 oai 再能刷分也不至于给几十项基准测试全部刷成 sota,

  • lueluelue 09-04 03:15
    4

    上下文:世界第二水准 512k-1M 上下文捞针紧落后 muse1.3 两分



    这个在哪里写的呀,没看到呢?没看到MRCR v2

  • 天上火 楼主 09-04 03:17
    5

    对的,发帖子的时候漏发了


  • W1nge 09-04 03:18
    6

    666居然能匹敌muse spark 1.3了

    真是倒反天罡

  • 吃风筝的人 09-04 03:19
    7

    gpt跟a\套路不一样,gpt重在走量


    你看claude的漏洞讨论的就很少,但oai的一大把。这不是睁一只眼闭一只眼的半默许我是不信的。


    astra发布,各种免费白嫖渠道一铺开,算力直接见底。发布当天估计就会负载过高,然后调整发布政策。甚至有可能面向个人用户的就直接是残血版,美其名曰安全分级

  • Rana Pathan 09-04 03:19
    8

    为什么 AA 分数 还没 Fable 5.1 高阿? 这下拉了。

  • canoez 09-04 03:19
    9

    openai官方 gpt astra帖子发完貌似秒删 这个帖子放的结果更全点,甚至ARC-AGI-3 99.9 ^-^

  • xiaomao 09-04 03:20
    10


    那还不快点入手,财富自由的机会就在眼前

  • 朱慧月 09-04 03:21
    11

    哥们大胆预言一下 订阅用户 272k 祖宗之法不可变

  • 天上火 楼主 09-04 03:26
    12

    因为 openai 莫名其妙将 astra 的官方博客发了又删,导致现在进入页面就 404,还好有老外保存了官网快照,大家从这个链接进去就能看到完整的官方博客了


    详情参考

  • 天上火 楼主 09-04 03:31
    13

    这个网站有时候也不靠谱,比如关于 fable5.1 是否在昨天发布的预测,认为发布的人一直到凌晨一点都才百分之 25,结果才过十几分钟有推特消息确定要发布就又一下子冲到百分之 70

  • BlueFunny 09-04 03:31
    14

    sol 那边是有点刷分特化了,就是它把所有任务都理解成一种答题测试了,必须得反复人工评分才能干得很好,欠缺自己的自我验证和反思能力,不知道 astra 咋样

  • LIFE001400 09-04 03:34
    15

    这个网站就是不靠谱,一堆人老说什么这个网站砸了真金白银,所以会很准确。实际上大部分人都是跟风的。Fable5 什么时候会恢复?这个上面也是直到恢复的前几个小时,赔率才开始波动。说白了,真的有内幕的人还是极少数的少数者。赔率也是少数者。

  • fablia 09-04 03:41
    16

    sol是已经可以开到1m了

* 帖子来源Linux.do
返回