背景
最近GPT降智问题,搞得中转站和普通用户都很头疼,我刚好抽时间研究了一下。在研究的过程中,发现大家普遍采用的糖果题。从结果统计上来讲,糖果题还是有一定区分度的,但不够实锤。我感觉主要还是本身过于简单,其实我人脑仔细思考一下,也能做出来。AI之所以答错成29,主要还是一个思维盲区——没有注意到摸的时候可以区分形状。
所以我一直在想有没有更好的问题来区分是否降智,于是有了前面一个主题 一道自创的AI测试题,有感兴趣的佬友来试试吗
有挺多热心佬友也参与了测试,最终证明这个方法算是一个失败的尝试:问题太难,解决一次需要花费的时间太久;允许大模型写代码调用,即使是弱鸡模型,借助暴力搜索,也能取得不错结果。
昨天突然灵光一现:我能不能把这个问题稍微改一下,把规模降低,但是不允许写代码?然后把目标也收敛一下,不为别的,就是为了区分是 gpt-5.6-sol 还是 gpt-5.6-luna 。
正文
我设计的问题如下
有一个水杯配对游戏。共有 4 种不同颜色的水杯,每种颜色各有两个。将同色的两个水杯分别放在上下两层,因此上下两层各有 4 个水杯。
下层 4 个水杯按某个未知顺序排列,挑战者无法看到它们;上层水杯的颜色和位置则完全可见。游戏开始后,挑战者可以反复进行以下操作:
1. 向裁判询问当前有多少个位置满足“上下两个水杯颜色相同”。裁判只回答匹配位置的总数,不透露具体是哪些位置。
2. 根据目前获得的所有信息,挑战者可以选择交换上层任意两个相邻位置的水杯,注意只能是相邻,不能是任意两个。
当 4 个位置全部匹配时,游戏结束。问题:
挑战者应采用何种策略,才能保证对于下层水杯的任意排列都能完成配对?所有能保证成功的策略中,最坏情况所需的交换次数最少是多少?
回答时请不要进行联网搜索,也不要写代码来暴力破解(包括思考过程中)。
假设答案是 x ,你需要给出严格的证明,为什么 x 可行,为什么小于 x 不可行。
先跑基准测试
我有一个官方订阅的GPT Plus账号,平时使用很注意卫生(独立出口IP,不和其他任何共用),使用时也能感觉出来智商在线。它的测试结果如下
codex-app | gpt-5.6-luna | high | 9m56s | 8 ✅
codex-app | gpt-5.6-luna | medium | 1m18s | 6 ❌
codex-app | gpt-5.6-luna | low | 0m32s | 6 ❌
codex-cli | gpt-5.6-luna | high | 14m29s | 8 ✅
codex-cli | gpt-5.6-luna | medium | 2m11s | 6 ❌
codex-cli | gpt-5.6-luna | low | 1m12s | 6 ❌
codex-app | gpt-5.6-sol | high | 8m26s | 8 ✅
codex-app | gpt-5.6-sol | medium | 6m51s | 8 ✅
codex-app | gpt-5.6-sol | low | 2m41s | 8 ✅
codex-cli | gpt-5.6-sol | high | 11m32s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 9m49s | 8 ✅
codex-cli | gpt-5.6-sol | low | 4m18s | 7 ❌
chatgpt-web | gpt-5.6-sol | high | 6m41s | 8 ✅
chatgpt-web | gpt-5.6-sol | medium | 4m10s | 8 ✅
chatgpt-web | gpt-5.6-sol | low | 3m47s | 8 ✅
这个结果很有意思:也就是说对于我设计的这个水杯题,初步看起来 sol medium & high 能对,但是 sol low 有可能出错;然后 luna low & medium 会错,但是 luna high 能对。
于是一个想法形成:要不用 medium 来做水杯题,这样的区分度应该最高。
加强基准测试
于是我又用这个官方订阅号做了多轮加强测试,形成更强的支撑,结果如下
codex-app | gpt-5.6-luna | medium | 2m9s | 6 ❌
codex-app | gpt-5.6-luna | medium | 1m36s | 6 ❌
codex-app | gpt-5.6-luna | medium | 1m51s | 6 ❌
codex-app | gpt-5.6-luna | medium | 1m29s | 7 ❌
codex-app | gpt-5.6-luna | medium | 1m16s | 8 (答案懵对了,但过程错误)
codex-cli | gpt-5.6-luna | medium | 2m23s | 6 ❌
codex-cli | gpt-5.6-luna | medium | 2m3s | 6 ❌
codex-cli | gpt-5.6-luna | medium | 2m15s | 6 ❌
codex-cli | gpt-5.6-luna | medium | 2m9s | 6 ❌
codex-cli | gpt-5.6-luna | medium | 1m35s | 6 ❌
codex-app | gpt-5.6-sol | medium | 6m1s | 8 ✅
codex-app | gpt-5.6-sol | medium | 8m19s | 8 ✅
codex-app | gpt-5.6-sol | medium | 5m44s | 8 ✅
codex-app | gpt-5.6-sol | medium | 10m18s | 8 ✅
codex-app | gpt-5.6-sol | medium | 8m25s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 12m7s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 8m2s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 9m26s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 10m30s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 11m15s | 8 ✅
chatgpt-web | gpt-5.6-sol | medium | 5m5s | 8 ✅
chatgpt-web | gpt-5.6-sol | medium | 4m11s | 8 ✅
chatgpt-web | gpt-5.6-sol | medium | 4m30s | 8 ✅
chatgpt-web | gpt-5.6-sol | medium | 4m10s | 8 ✅
chatgpt-web | gpt-5.6-sol | medium | 4m36s | 8 ✅
好家伙,区分度非常之高,几乎实锤了:sol medium 能做对,luna medium 做不对。而且还观察到一个现象对于能做对的情形,时间几乎都是超过 5m 的(web要快一点,不知道为什么);而凡是做不对的,时间都是在 3m以内。顺便说一下,codex-app luna 最后那次测试结果没冤枉它,它的过程确实是错的。

拿朋友小试牛刀
我有一个朋友刚好在开中转站(属于副业,他的主业是电商,搭建这个主要是给自己员工用,顺便对外开放),比较知根知底,于是先拿他的站来开刀,测试结果如下,他估计中招最严重:
#### linux
codex-cli | gpt-5.6-sol | medium | 2m6s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 1m35s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 2m2s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 1m49s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 1m31s | 6 ❌
我给他反馈以后,他怀疑是我测试方法或者环境有问题,于是我又重新在自己电脑上补测了两组数据
#### macos
codex-app | gpt-5.6-sol | medium | 7m43s | 8 ✅
codex-app | gpt-5.6-sol | medium | 1m31s | 6 ❌
codex-app | gpt-5.6-sol | medium | 1m38s | 7 ❌
codex-app | gpt-5.6-sol | medium | 1m8s | 6 ❌
codex-app | gpt-5.6-sol | medium | 1m27s | 7 ❌
#### macos
codex-cli | gpt-5.6-sol | medium | 2m7s | 8 (答案懵对了,但过程错误)
codex-cli | gpt-5.6-sol | medium | 1m52s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 2m3s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 1m53s | 7 ❌
codex-cli | gpt-5.6-sol | medium | 2m3s | 6 ❌
macos codex-cli 的第一组也没有冤枉它,有图为证

再试试富可敌国
然后我又试了试两家富可敌国(都是我比较信任的)
### 某富可敌国中转站A(0.2x倍率pro号池)
#### linux
codex-cli | gpt-5.6-sol | medium | 6m13s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 8m46s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 10m48s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 2m31s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 9m44s | 8 ✅
### 某富可敌国中转站B(0.2x倍率pro号池)
#### linux
codex-cli | gpt-5.6-sol | medium | 2m16s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 2m20s | 8 (答案懵对了,但过程错误)
codex-cli | gpt-5.6-sol | medium | 8m22s | 8 ✅
codex-cli | gpt-5.6-sol | medium | 1m34s | 6 ❌
codex-cli | gpt-5.6-sol | medium | 2m15s | 7 ❌
结语
因为时间有限,可能并没有把整个实验设计得非常完善,但我觉得可以形成几个初步结论:
- 降智问题是客观存在的,我自己的号没问题,但是中转站很严重,不一定是主动掺水;
- 可以用水杯题去测试 gpt-5.6-sol medium,如果完成时间超过 5m 且答案是 8,那就是没降智;如果完成时间少于 3m,答案不是 8,肯定降智,答案是 8,可以把它的证明过程发给 xhigh 审核,大概率证明过程偷工减料,或者就是错的,还是属于降智范畴。
希望对水杯题感兴趣的佬友继续参与测试,留下更多的实验样本,算是对糖果问题的补充,造福整个社区。