[不客观的客观评价] 国内外模型排序和Fable51 vs Astra的差异

zero42 2026-09-06 01:05 1

较主观的客观排序


Top: Qwen3.8-Max ~ Hy4 Preivew ~ Kimi-K3 [个人觉得Kimi-K3还是略逊色的,但比较均衡]



Qwen3.8-Max 和 Hy4 Preview 都很惊艳



Top3: GLM-5.3-Flash 大于或者小于 GLM-5.3 [性价比首选No.1 GLM-5.3-Flash,综合表现glm-5.3-flash在我心中超过GLM-5.3,但确实低于Top系列]


Gemini-3.8-Flash 目前最意外的一个模型,虽然是美国大豆包,但确实进步最大的模型,个人心中略高于或者接近Qwen3.8-Max ~ Hy4 Preivew


Astra vs Fable 差异点


Fable-5.1 大厂程序员专属,适配懂点技术但没有达到天才的小量用户群体[高质量的Coding预料,搜集到的数据集都是高难度的,毕竟A社已经把普通用户筛选掉了,只剩下任务非得用Fable5.1不可的群体,整体数据质量较高]


GPT-6-Astra 全面均衡的选手,大众逆袭的路线。由于大部分用户都能接触到OAI的模型,所以整体的任务表现会更加全面,比较均衡,但正式由于数据量大,质量良莠不齐,会混入很多额外的噪音,所以需要进行更多的后处理工作以及一些列更严格的数据飞轮。


从贡献而言,OpenAI确实将Fable级别的模型普适化,大众化了,会收到大家的青睐。后续也会收集到更多高质量的数据,但同时也会产生很多噪音,因为OAI的Bug太多了,会导致数据污染,需要更重的数据清洗。但是Fable的问题在于过于Coding化,追求极致Coding,并且有钱的用户会更加适合。


真正的天才适配的模型: 自部署的Qwen3.8-27B, Deepseek-v4-flash,天才专属,顶级优化MTP+推理速度,本人完全不配…,目前我们组的World Coding前10的老板的工作栈,高强度依赖自部署,自训练的Qwen3.8-27B,能力完美破限


我们之前做过ARG-AGI-3 Benchmark的研究,Astra的效果过于颠覆三观了,AGI-3是对任何模型来说都是未知的数据集,需要从零探索,从陌生环境的探测[action对应环境的feedback],进行环境的模拟和重构,然后进行目标的high-level规划,但决策的实施,环境反馈的纠正,然后不断迭代,来达到一个最终的目标。



对人来说很简单,靠直觉,但对于模型考验的是未知世界的探索和建模,所以历来无workflows,pipeline的效果都低于20%-30%,但Astra刷榜到了90%+,相当于当初CNN的出现,所以值得仔细查看背后的原因,数据集or Post trianing。Post Training的效果有点过于夸张,还是将认知框架pipeline训练进模型了。^-^



整体效果:


提示词都是公开的,可以进行复现,对于部分Prompt,并不是简单的one-shot任务,可以深入读一下prompt就知道了。关于长程任务,没人有钱真实测过,这个体验会更加因人而已,PostrTraingBench,CyberGym等也并不是唯一的Benchmark且不够真实,依旧存在很多问题。关于前者simulation环境没有进行控制变量,后者的CVE 0Day,其实依旧存在较多hack的情况。


目前提供的赛车和MC的前端,不仅仅是简单的一句话prompt,是包含很多细致的用户需求,前后端协同的,最后的效果都各有优劣势,网页端都明确进行说明了,都是模型rubric进行打分的。用户感观因人而已。


最后就是一点例子了,Hy4 preivew效果很不错的,我没有贴图。但Qwen3.8-MAX效果也很惊艳。




最后一点: 始终要说明一点GPT系列的Pro模型,不在上述排行榜。该模型完成一个任务质量非常高[没法和Fable51比较,TTS确实会带来质量非常高],但时间非常长。

最新回复 (19)
  • Seroton Karlbaey 09-06 01:06
    1

    Kimi K3 好像很快就被其他模型盖过去了,真是一天一个市场。

  • alizoed 09-06 01:07
    2

    这春秋笔法看得很难绷住,甚至不能算春秋笔法,倾向有点太明显了,确实很主观

    不是 怎么又是你啊

  • Kassdin 09-06 01:08
    3

    k3也快两个月了,月之暗面能不能也端个核弹上来?

  • Morax Cheng 09-06 01:12
    4

    怎么又是你啊, 好难绷啊

  • glan chow 09-06 01:13
    5

    号称Fable5.1是OpenAI的一辈子的辈子哥又来了,爱ATV真的不能没有你 ^-^

  • 还想成为88VIP 09-06 01:15
    6

    有一说一,虽然贴主有过一些争议性言论,但是还是对事不对人比较好。对别的帖子的内容不满意到对应帖子底下回复算了

  • skyway 09-06 01:16
    7

    感觉还是Codex性价比无敌啊

  • 兰子p 09-06 01:17
    8

    一看文字不对味,这不是一辈子哥吗?这次又是谁的一辈子

  • wklwkl 09-06 01:18
    9


    高质量的 Coding 预料,搜集到的数据集都是高难度的,毕竟 A 社已经把普通用户筛选掉了,只剩下任务非得用 Fable5.1 不可的群体,整体数据质量较高


    这句话怎么咋看咋别扭,好多人不都是双开的嘛,怎么叫非得用,什么叫筛选

  • heymeow 09-06 01:18
    10

    astra在闭源逻辑榜上已经达到另一个境界了 图1



  • ANON 09-06 01:19
    11

    如果我没理解错的话,所以你想表达的是某种“精英化”相关的思想?


    用xxx模型就是有眼光,就是小天才or天才,就是精英群体和高级用户;同时也有另一条线是所谓的“平民叙事”?


    不过为什么天才要用自部署呢,这不是浪费人类的高质量数据么。天才的话随便找哪家公司都可以谈点条件,用数据换一些小权限(速度,破甲等)吧。还是说你推荐的那两个相对小的模型其实也是天才数据训出来的?

  • wklwkl 09-06 01:20
    12

    是的,我也感觉是,搞得好像用claude的就是最屌的一样

  • BananaPancake 09-06 01:20
    13

    自训练的Qwen3.8-27B



    这个是真牛B,自训练不是微调,没个十万刀能下来吗

  • 兰子p 09-06 01:21
    14

    都一样200刀谁比谁高贵了,哦也许Claude封号更贵吧 ^-^

  • 海森堡 09-06 01:24
    15

    不是哥们,你的这几个测试结果到底能发多少个帖子,不是已经发过了吗 ^-^

  • Morax Cheng 09-06 01:25
    16

    ??这人是在给自己网站引流吧, 一直发这种争议贴, 然后放自己网站的链接

  • alizoed 09-06 01:25
    17

    然而这个帖子实际上是之前帖子的延伸。我实在是看这个,用 Fable 的都是什么“高端大气上档次”的用户,用 Astra 的都是什么,对吧,普通小白用户。真是看了这个描述,我看到这里就感觉味儿不对了

    张嘴就是良莠不齐,没绷住

    还大厂程序员专属 真能往自己脸上贴金

    管他想干什么 举报先给他举报一个

  • PositronCannon 09-06 01:26
    18

    主要是,其实这篇帖子本身就很扭捏。

    看了前几行过后觉得怎么怪乎乎的,然后一看标题和作者,发现是辈子哥,所以就有点戏剧性了。


    但单就内容来说确实有点奇怪了


    先是标题是Fable5.1 vs Astra (辈子哥这几天就跟这对组合杠上了,大伙看热闹都散了,辈子哥又来搞对比了)


    然后一进来后正文部分的第一句话是Top: Qwen3.8-Max ~ Hy4 Preivew ~ Kimi-K3 [个人觉得Kimi-K3还是略逊色的,但比较均衡]

    标题直接和正文主角不匹配,这里一个蒙太奇就给我搞得有点昏了。


    然后评了2段,突然又插进一个不在他自己榜单上的Gemini,然后说Gemini位置 高于或者接近Qwen3.8-Max ~ Hy4 Preivew


    那Gemini到底在不在榜单上?


    然后我带着疑惑往下读,突然一个急弯,开始了 Astra vs Fable


    然后又是庞大的大文字大标题和大量的加粗和引用,但都是一些没有重点的琐碎堆砌,然后说着说着又突然开始急转弯, 毫无逻辑地空间跳跃到Qwen3.8-27B, Deepseek-v4-flash,然后又说到了infra 层级的内容


    然后又一个回马枪,扯数据集 ARC-AGI-3 Benchmark(然后楼主说自己做过这个benchmark的研究,并把名字打错了)


    我是想要认真看的,但是后面的我看不下去了,全文支离破碎。


    然后表面上看起来是想要做评测对比,但细看字里行间又扭扭捏捏地说什么平民化大众化,和精英化的道路问题,就真的一头问号。


    我想大多数读者也是这种观感,然后中途停下来看了一下标题和作者,发现是辈子哥,于是果不其然……

  • 兰子p 09-06 01:26
    19

    看起来是这样的,很劣质的引流方式

* 帖子来源Linux.do
返回