使用中转站的 gpt6,如何判断是否注水了低版本模型?

linuxtro 2026-09-14 17:25 1

如图~

最新回复 (10)
  • xingye163 09-14 17:30
    1
    昨天试了下,同一个模型,中转站的也就勉强过的去,我以为是降智的原因,然后今天冲了 GPT plus 效果就好很多,说明跟降智关系不大,应该是注水了。
  • igamebox 09-14 18:11
    2
    PRO 20X 现在风控降智+overloaded 比 PLUS 强多了,
  • xiao8276 09-14 18:14
    3
    目前都有降脂问题,可以用经典鹈鹕测试
  • yinmin 09-14 18:17
    4
    看这篇帖子 https://www.v2ex.com/t/1241763
  • FrankAdler 09-14 19:22
    5
    我觉得不用判断,100%注水的
  • 413420 09-14 19:27
    6
    中转站不注水利润上不去
  • XEdge 09-14 20:16
    7
    担心掺水可以检测模型指纹: https://xqy2006.github.io/ModelTrace/
    智力的话可以测试糖果问题,嫌麻烦可以不跑脚本那就直接问里面的题目就行了: https://raw.githubusercontent.com/haowang02/codex-candy-eval/refs/heads/main/codex_candy_eval.py

    被降智的账号:
    使用 gpt-5.6-sol(low)回答不出正确答案 21
    使用 gpt-5.6-terra(max)回答不出正确答案 21

    正常账号以上两档正确率至少在 3/5 以上,即问五次至少对三次。使用 gpt-5.6-sol(medium)及以上档位包括 gpt-6-astra 一定答对。

    都是些经验之谈,并不严谨。其实跑个鹈鹕测试之类的就能直观的看出能力上的差别了
  • ktyang 09-14 20:23
    8
    默认注水就行了,不要想那么多,不用就是最好的办法。
  • EMMMMMMMMM 09-15 08:09
    9
    这还用判断?
  • AImoka 09-15 09:17
    10
    别只问「你是谁」。同参数连测几次鹈鹕/糖果题,再对照官方同档;看返回的 model 字段和用量日志是否对得上。指纹工具只能当信号。想先按自己 coding 场景试稳定接入,可加微信 mkapikey 。
* 帖子来源V2EX
返回