感觉好像大多数人觉得的模型降智都是凭感觉

geekjam 2026-07-30 13:26 1

感觉应该有个科学化测试或检验试题来横向反复测试,才能得出较好的结论

最新回复 (13)
  • 乍见之欢 07-30 13:27
    1

    东西没有什么创新,一直在收割客户。GPT做的像坨屎也不去优化客户端。

  • 24 07-30 13:31
    2

    有的佬,有个叫codex雷达的地方,专门做测试题

  • Bright Peng 07-30 13:32
    3

    有个网站做了codex的智力测试,还可以众测呢


  • neteroster 07-30 13:33
    4

    有:




    但它的测试点可能不太够,置信区间宽了一些,如果测出来降智肯定是降,但没有测出来未必没降


    不过总的来说肯定还是比感觉靠谱的

  • cc 07-30 13:43
    5

    (帖子已被作者删除)

  • peach310 07-30 13:45
    6

    感觉就够了吧ai是工具我还得给工具造检测的工具何必呐 就算真检测出来 也是没法改变的 ^-^

  • 冰原Bill 07-30 13:47
    7

    模型的能力不一定在变化,但供应商调节参数会导致模型的行为发生显著变化。

    后者的体感会非常明显,并且打破原有工作流程,然后就被笼统归为降智了。

  • thirking 07-30 14:14
    8

    Tibo 雷达笑死我了

  • GPLer 07-30 16:03
    9

    感觉远比题目靠谱吧,题目还能应试,感觉没法造假

    至于感觉偏差直接看是否是个例就行了,如果很多人都觉得降智,那大概率确实降智了。

  • geekjam 楼主 07-30 16:09
    10

    这个网站只能gpt模型吗, 要是能其他模型就好了

  • 8817 07-30 16:10
    11

    每天都在蹬的模型,有没有问题真能感觉出来吧。

  • geekjam 楼主 07-30 16:11
    12

    比如还有个点,就是感觉上降智了,实际可能是网络环境、账户风控、对接的中转站搞鬼了等,然后你上网上一说咋模型降智了啊,就容易误导

  • joel1 07-30 16:12
    13

    降不降智的不清楚,但速度是慢了很多。

* 帖子来源Linux.do
返回