gpt-6-sol?可能是5.5或者5.4换名

泡面 2026-09-25 00:54 1

因为个人习惯在新模型是否可用前,会进行一系列智力和额度消耗测试,以及问gpt模型对比。然后发现,6sol和6luna:很拉。


2026.09.25先说结论:

如题,6sol和luna,感觉就是5.5和5.4,智力简直惨不忍睹。

6sol和luna的max,还不如5.6sol的low。


下面图,所有测试都是同一个号的,我为了测试额度消耗,顺便测试了多个推理模型

(其实测试的这个号,不是第一个号了,是第三个号,前面的信息没做记录,因为当时没想过要发帖子,所以,其实不仅只有图中的测试量)




糖果测试





额度消耗如下图,单位是plus-5小时额度

个人认为,astra的low和medium额度消耗比xh更高,应该是经历了更多轮的推理,所以虽然价格更低,但是同问题使用额度的频率更高了,导致额度消耗更高。而xh一次就推出结果,所以消耗更低。




额度消耗



GPT给的模型对比信息如下图(个人感觉:吹牛、打了草稿):




gpt回答信息





怀疑降智的

(其实水杯提我也并入糖果题的程序了,但是这个回答太慢,所以上面就还是用糖果题来展示结果)




水杯和醍醐





至少,需要在oai进行更新/修复之后,估计才能达到gpt回答的程度,至于什么时候修复,各位佬快去催tibo吧。

最新回复 (12)
  • xiedian 09-25 00:58
    1楼

    别这样侮辱5.5 ^-^6 sol其实就是terra换了个名

  • ethereal49 09-25 01:02
    2楼

    你这个降智了吧,我用着勉强能接受,astra规划和验收,sol xhigh实现

  • 泡面 楼主 09-25 01:02
    3楼

    哈哈哈 5.6terra其实还是可以的,我印象中也不会像6sol、luna这样错这么多。

    不过我很少用terra所以几乎没做过它的测试,只有刚出5.6时测过,现在懒得测了,反正不会用它

  • 文月 09-25 01:04
    4楼

    真的是5.4吗


    当时用5.4感觉还是挺好的

  • 泡面 楼主 09-25 01:05
    5楼

    数据和对比放在这里,如果你觉得还是降智了,那我也没别的数据反驳了。

    但是你至少得先找出降智的证据,真降智了,你看我上面的6astra和5.6sol的测试是怎么测对的?

    你可能想看到的水杯和醍醐来判断是否降智。



  • xiedian 09-25 01:07
    6楼

    确实,5.6 terra做糖果还是没问题的,这6 sol糖果都做不明白,下限太低了

  • Jingo 09-25 01:07
    7楼

    只想说公司项目之前一直5.6sol medium跑, 极少写出bug, 昨天用了一天gpt6索嗨, 给今天的我造了一天的工作量(本来准备摸鱼等放假了)

  • 泡面 楼主 09-25 01:08
    8楼

    你只是"使用感受","使用感受"这种东西,如果你没有切实、标准的答案和对比,你根本不会意识到到底是否降智。

    直到,有重大错误,明显到你的"使用感受"或者眼睛能看到了,那就很重大很离谱的错误了。

  • 泡面 楼主 09-25 01:10
    9楼

    (帖子已被作者删除)

  • Blackwood416 09-25 01:12
    10楼

    GPT6 Sol今天用了一下,感觉还不如Gemini 3.8 Flash,这Sol Max耗了我70%的5小时额度证明了已经写在接手文档里的事实,不想说啥了 ^-^

  • 泡面 楼主 09-25 01:15
    11楼

    哈哈哈哈我本来也想用6sol的,但是我习惯在新模型要进行一些系列测试和gpt对比后才会用,以免被坑。

  • 泡面 楼主 09-25 01:20
    12楼

    哈哈哈刚出那会肯定好呀,但是后来5.5和5.4不是流口水了吗,尤其是5.5哈哈哈哈

* 帖子来源Linux.do
返回