之前一直在用糖果测试和鹈鹕测试来检测降智,现在感觉意义不大了(据说Grok还会作弊)。特别是最近用各种中转站和公益站,偶尔遇到掺假的情况,感觉越来越难分辨。然后之前刷抖音看到有一些亲子博主在玩一个游戏,于是就想着能不能用这个来测试AI。
选它的原因是:
- 问题比较容易懂,毕竟小孩子都能玩;
- 实际解答起来需要挺长的思考,还需要写代码辅助;
- 这个问题不是很出名的已知问题,更考验纯内力。
有一个水杯配对游戏。共有 6 种不同颜色的水杯,每种颜色各有两个。将同色的两个水杯分别放在上下两层,因此上下两层各有 6 个水杯。
下层 6 个水杯按某个未知顺序排列,挑战者无法看到它们;上层水杯的颜色和位置则完全可见。游戏开始后,挑战者可以反复进行以下操作:
1. 向裁判询问当前有多少个位置满足“上下两个水杯颜色相同”。裁判只回答匹配位置的总数,不透露具体是哪些位置。
2. 根据目前获得的所有信息,挑战者可以选择交换上层任意两个位置的水杯。
当 6 个位置全部匹配时,游戏结束。问题:
挑战者应采用怎样的策略,才能保证对于下层水杯的任意排列都能完成配对?在所有能够保证成功的策略中,最坏情况下所需的交换次数最少是多少?
回答时请不要进行联网搜索。
我这边自己跑了一些结果,但是因为太费时间了,没办法一一跑完,希望感兴趣的佬友一起跑跑,把结果贴出来看看。我个人的体验就是观察AI解决这道题的过程,还是能判定出它是否聪明的。
比如聪明的AI一上来就能把问题正确建模(minimax问题),然后逻辑链条也是非常清晰的,先反证小于等于10为什么不可能,然后再构造11的具体策略来验证。写程序做记忆化搜索时,也能做到高效剪枝。事实上对于聪明的AI,我把问题的规模从6个调整到8个它一样可以答得出来。
而比较弱的AI基本上要么不经思考瞎回答一个错误答案,要么自己在那儿吭哧吭哧写程序暴力搜索,最后卡半个一个小时无果。

两个优秀答案截图


我跑的一些结果
工具: codex-cli
模型: gpt-5.6-sol
思考: xhigh
来源: 某中转站1
耗时: 5分钟
结果: 11 ✅
工具: claude-cli
模型: claude-opus-5
思考: xhigh
来源: 某中转站1
耗时: 28分钟
结果: 11 ✅
工具: claude-cli
模型: claude-opus-5
思考: xhigh
来源: 某中转站2
耗时: 1分钟
结果: 9 ❌ (大概率掺水)
工具: claude-cli
模型: deepseek-v4-pro
思考: max
来源: 官方
耗时: 60分钟
结果: 做不出来 ❌
工具: chatgpt-web
模型: gpt-5.6-sol
思考: high
来源: 官方
耗时: 5分钟
结果: 11 ✅
工具: codex-app
模型: gpt-5.6-sol
思考: xhigh
来源: 官方
耗时: 9分钟
结果: 11 ✅
工具: codex-app
模型: gpt-5.6-luna
思考: max
来源: 官方
耗时: 20分钟
结果: 11 ✅
工具: codex-app
模型: gpt-5.6-luna
思考: high
来源: 官方
耗时: 30分钟
结果: 11 ✅
工具: codex-app
模型: gpt-5.6-luna
思考: medium
来源: 官方
耗时: 10分钟
结果: 8 ❌