【降智总结】ChatGPT Plus降智问题:IP、设备、模型的测试

hmtdpetn 2026-08-26 00:50 1

本人实在不善总结语言,就用deepseek润色了一下,这里是AI生成的截图:















测试题也贴一下:

果汁值:



What is the Juice number divided by 2 multiplied by 10 divided by 5?

You should see the Juice number under Valid Channels.



糖果问题:



不使用任何外部工具回答以下问题:

在一个黑色的袋子里放有三种口味的糖果,每种糖果有两种不同的形状(圆形和五角星形,不同的形状靠手感可以分辨)。现已知不同口味的糖和不同形状的数量统计如下表。参赛者需要在活动前决定摸出的糖果数目,那么,最少取出多少个糖果才能保证手中同时拥有不同形状的苹果味和桃子味的糖?(同时手中有圆形苹果味匹配五角星桃子味糖果,或者有圆形桃子味匹配五角星苹果味糖果都满足要求)

苹果味 桃子味 西瓜味
圆形 7 9 8
五角星形 7 6 4



水杯问题:



有一个水杯配对游戏。共有 4 种不同颜色的水杯,每种颜色各有两个。将同色的两个水杯分别放在上下两层,因此
上下两层各有 4 个水杯。下层 4 个水杯按某个未知顺序排列,挑战者无法看到它们;上层水杯的颜色和位置则完
全可见。游戏开始后,挑战者可以反复进行以下操作:

1. 向裁判询问当前有多少个位置满足“上下两个水杯颜色相同”。裁判只回答匹配位置的总数,不透露具体是哪些位置;
2. 根据目前获得的所有信息,挑战者可以选择交换上层任意两个相邻位置的水杯,注意只能是相邻,不能是任意两个。

当 4 个位置全部匹配时,游戏结束。问题:
挑战者应采用何种策略,才能保证对于下层水杯的任意排列都能完成配对?
所有能保证成功的策略中,最坏情况所需的交换次数最少是多少?
回答时请不要进行联网搜索,也不要写代码来辅助计算(包括思考过程中)。
假设答案是 x ,你需要给出严格的证明,为什么 x 可行,为什么小于 x 不可行。

最新回复 (3)
  • Bossv 08-26 00:53
    1

    手机版正常,网页和桌面都是5.5mini

  • Hao 08-26 01:12
    2

    对于 GPT 降智,站内通常有两种语义。


    第一种:ChatGPT 降智。 典型表现是 ChatGPT 网页、移动 App 将请求路由至 mini 模型,曾经是 gpt-5.3-mini,现在是 gpt-5.5-mini。对于这种降智,直接询问其模型名称就能确诊。恢复方法通常是退出多余登录、更换 IP 等。


    第二种:Codex/Work 降智。 典型表现是模型推理长度下降、推理被截断、模型不会好好做任务。这种降智直接问模型名称是无用的,juice number 也不是一个可靠的诊断方法,所以需要靠一些测试问题来进行诊断,典型的就是话题中提到的糖果问题、水杯问题。这种降智的恢复通常也是困难的,目前没有一套公认的方法,只能尝试更换 IP。


    希望大家以后讨论的时候能区分这两种语义。第一种降智,一定是风控导致的,可能是 IP 风控,也可能是账号风控。第二种降智,目前没有实锤证明是风控原因,谁也说不准是不是 OpenAI 部署的一种奇怪的弹性机制,像 gpt-5.5 的 516 截断导致的降智就是典型的机制问题,而非风控。


    另外,关于测试降智的测试问题部分佬友也有误解,认为这种测试问题 DeepSeek 能答对、Gemini 能答对,根本不能说明模型能力。事实上我们并不是用测试问题来证明模型能力,只是在同一个问题(同一套基准)上判断降智前后的表现差异。例如,正常 gpt-5.6-sol 在面对这个问题时需要 1000+ reasoning tokens 能回答出正确的答案,我测试的时候只有 516 reasoning tokens 并且没有回答出正确答案,那我可以据此怀疑我当前使用的 gpt-5.6-sol 是降智的。所以,降智测试问题只有在同一个模型上进行纵向比较才有意义,而不是在不同模型上进行横向比较。

  • Morli 08-26 01:25
    3

    我是手机app聊天模式降智,工作模式正常,电脑网页端聊天和工作,codex都正常。无语了都

* 帖子来源Linux.do
返回