nao 榜更新了 Opus 5.5 和 6 Sol 的评分

内一衡径数 2026-09-23 20:35 1

来源: 致知|大模型智力长期追踪榜单


作者在混元工作.





最惊喜的是 6Sol 完成任务的使用的成本

最新回复 (19)
  • Tahooo 09-23 20:37
    1

    为什么gpt 6还没有5.6的分数高呢

  • crazycrazyshui 09-23 20:37
    2

    这是逻辑推理榜,不是agent能力榜

  • kimi 09-23 20:40
    3

    SEED PRO 9515是豆包我豆妹吗?

  • Not_Found_404 09-23 20:40
    4



    6luna比5.6luna还差,拉完了O÷

  • 木原金 09-23 20:46
    5

    6 luna 是比 5.6luna 参数更小的模型,无敌了


    不会是重新训了个 gpt-oss-120b 拿出来糊弄人吧

  • 时牧 09-23 20:48
    6

    是啊,实际使用过程中明显感觉到6sol继承了6astra的省token高效率

    废话少了,汇报交流用词简洁明了

    可能性能方面没什么提升,但使用体感真好了不少

  • a12908 09-23 20:52
    7

    真的打不过5.6 真的倒吸了啊 ^-^ 离谱了

  • ensemble 09-23 20:53
    8

    这降得有点多啊,是后训练训废了还是换了个更小的基模 ^-^

  • huachuan12 09-23 20:55
    9

    6sol的基模肯定是换了,没想到豆包这么强

  • Hifumi Mizuhara 09-23 20:56
    10

    6 Sol是Opus 4.7/4.8类别模型


    降本增效?


    但是似乎效果确实好了很多,用量减少很多

  • 0v0 09-23 20:56
    11


    义正言辞的opus和正常的opus,原来是两个模型? ^-^

  • liu juntao 09-23 20:59
    12

    我更好奇的是,seed 2.1 pro 竟然这么排名靠前吗?

  • cangying33 09-23 21:01
    13

    只能说你豆姐这一生不弱于人了 ^-^

  • ANON 09-23 21:07
    14

    很好奇是怎么估计w/o情况的得分的

  • 美帝码工 09-23 21:08
    15



    上个月的榜单 5.6 也打不过 5.5 ,也是更省钱


    其实我估计开 MAX 就不一样了。5.6 体感上限还是高于 5.5 的。

  • 0v0 09-23 21:09
    16

    怎么不把astra和fable也拆成两个模型就是说

  • aoaochan 09-23 21:12
    17

    在这榜单上豆包也是好起来了hhhh ^-^

  • 还想成为88VIP 09-23 21:13
    18

    这个排名,前6名合理,第七名我不评价。

  • ANON 09-23 21:15
    19

    astra可能没触发refuse,不过fable确实奇怪,有估计的分数好像没看到with refuse的分数。

* 帖子来源Linux.do
返回