谨慎看待 C***x 雷达的测试结果

Caphhh 2026-08-06 01:05 1

野榜/娱乐向/被害妄想症向


本人对C***x 雷达没什么意见,但是对某些拿其结果当唯一准则的人有意见


不同推理强度、不同模型的“智力”与“智力”之间不能直接比较


你是信 luna max = sol medium > sol high

还是信 luna max > terra max = luna xhigh > terra xhigh

还是信我是秦始皇?





智力不能仅仅通过“通过率”来反映

最新回复 (19)
  • lueluelue 08-06 01:07
    1

    最难绷的是众包跑的。。。那跑的人被降智怎么办

  • HLH2077 08-06 01:07
    2

    同意,实际表现和榜上的智力完全不一样,luna-max 用起来又慢又不好用,无法处理复杂需求。

  • 文月 08-06 01:09
    3

    luna max高强度用了两天了,除了慢没啥问题,真香

  • wqfc09 08-06 01:11
    4

    怎么说呢,codex套餐内还没有降智的先例吧。又不是用web测试的。

  • jkcqw 08-06 01:12
    5

    其实标准是自己的体感,现在的Terra xhigh的确就是降智,用雷达就是想大概了解不同模型当前是否降智而已,不降智的情况下官方的分级是对的,但是问题是现在GPT自己也说有人滥用极高思考导致官方自己降了一点智,所以才催生出雷达

  • 初九猫 08-06 01:12
    6

    你好https://linux.do/t/topic/2689249

  • wqfc09 08-06 01:13
    7

    和deepseek flash一样的,用长思维链换执行能力

    问题在于这种小模型的tps不该这么低,纯纯是被OpenAI限制了

    依旧不建议用它干任何需要用脑子的事

    它就适合干目标明确的任务

    Sol当主代理分发协调任务+luna干活属于不错的组合

  • Lunafleur 08-06 01:13
    8

    没毛病,只能说可以拿来做参考而不能做标杆,这确实可以看模型智商趋势,实际用起来luna在长任务里毛病总比sol多,反而多返工了

  • Angel 08-06 01:13
    9

    最难绷的是众包跑的。。。



    众包的并不是一个人吧^-^^-^^-^

  • wqfc09 08-06 01:16
    10

    我可能表达的不太准确,我重新说一下

    就是:

    OpenAI不是那种像grok那样那么彻底的降智。他可能是新的checkpoint或者说是新的量化版本,亦或者是单纯降低了think token的数量等等。他不是网页端那种,你用的是5.6Sol,结果给你路由到5.5-mini的场景

    你当然可以指责说,要是测试的人被降智了,其他人没降智呢?但是反之也是同理的,要是其他的人被降智了,就你没降呢。中心化和去中心化的优势和劣势本身就是一体两面,更何况,这个测试人数基本都有50人以上,这个参数量是具有统计学意义的。

  • alizoed 08-06 01:18
    11

    luna max如果真的强于sol high,奥特曼就会给它改名叫sol端上来,我是不信奥特曼这个发明了模型路由的孙子会给你爽用强模型的


    还是那句话,模型分级是人家为了区分价格才分的,越级这种事等同于砸自己饭碗,奥特曼刀法再不精湛会干出这种事吗


    而且我说白了我试了一下,照着文档写简单输入输出脚本都写不明白,你指望它能干什么,也就做那种饭都端到脸上来,照着输出成代码呗

  • lueluelue 08-06 01:19
    12

    是呀,要是一个人长期稳定跑,那还可以

  • lueluelue 08-06 01:20
    13

    对,就是这种新的checkpoint,新的量化版本,或者限制了thinking token的数量。这种的话就会影响它的排行榜分数


    看起来这个降智雷达像是跑的DeepSWE?我也不知道




    尤其是限制了thinking token,会导致很多很多排行榜上分数大大下降

  • esarchivx 08-06 01:21
    14

    (帖子已被作者删除)

  • 咸鱼 08-06 01:21
    15

    sol-max做需求设计出文档和验收点

    luna-max写代码

    sol-max审核luna写的代码

    当然,要是token富裕,全程sol-max就行了

  • 苍真 08-06 01:26
    16

    全程sol-max速度和质量,未必有sol-meduim好其实,频繁压缩,过度思考,导致执行着执行着就歪了。。。(luna max同理)

    个人大量实践下来sol-max想方案和验收,sol-meduim执行,小步快跑,交付的结果是时间和质量综合下来最好的体验。(哪怕不考虑token)

  • YDD 08-06 01:29
    17

    luna max用了快一周了吧,free号跑的,真的就除了慢,没啥毛病啊,现在deepseek干粗活。luna max指挥,效率更快点

  • Winn 08-06 01:30
    18

    luna-max只能做简单任务,没法替代sol,一个简单功能,返工四五遍得不到一个好的结果,有时候觉得还不如用5.5

  • Edward1 08-06 01:35
    19

    我直接梭哈 sol

    默认 sol xhigh

    sol max 做方案和 review 和解决 sol xhigh 处理不了的问题

    子代理默认 sol medium


    Hermes 倒是用的 luna max

* 帖子来源Linux.do
返回