一道自创的AI测试题,有感兴趣的佬友来试试吗

Russ Cox 2026-08-14 15:32 1

之前一直在用糖果测试和鹈鹕测试来检测降智,现在感觉意义不大了(据说Grok还会作弊)。特别是最近用各种中转站和公益站,偶尔遇到掺假的情况,感觉越来越难分辨。然后之前刷抖音看到有一些亲子博主在玩一个游戏,于是就想着能不能用这个来测试AI。


选它的原因是:



  1. 问题比较容易懂,毕竟小孩子都能玩;

  2. 实际解答起来需要挺长的思考,还需要写代码辅助;

  3. 这个问题不是很出名的已知问题,更考验纯内力。


有一个水杯配对游戏。共有 6 种不同颜色的水杯,每种颜色各有两个。将同色的两个水杯分别放在上下两层,因此上下两层各有 6 个水杯。
下层 6 个水杯按某个未知顺序排列,挑战者无法看到它们;上层水杯的颜色和位置则完全可见。游戏开始后,挑战者可以反复进行以下操作:
1. 向裁判询问当前有多少个位置满足“上下两个水杯颜色相同”。裁判只回答匹配位置的总数,不透露具体是哪些位置。
2. 根据目前获得的所有信息,挑战者可以选择交换上层任意两个位置的水杯。
当 6 个位置全部匹配时,游戏结束。问题:
挑战者应采用怎样的策略,才能保证对于下层水杯的任意排列都能完成配对?在所有能够保证成功的策略中,最坏情况下所需的交换次数最少是多少?
回答时请不要进行联网搜索。

我这边自己跑了一些结果,但是因为太费时间了,没办法一一跑完,希望感兴趣的佬友一起跑跑,把结果贴出来看看。我个人的体验就是观察AI解决这道题的过程,还是能判定出它是否聪明的。


比如聪明的AI一上来就能把问题正确建模(minimax问题),然后逻辑链条也是非常清晰的,先反证小于等于10为什么不可能,然后再构造11的具体策略来验证。写程序做记忆化搜索时,也能做到高效剪枝。事实上对于聪明的AI,我把问题的规模从6个调整到8个它一样可以答得出来。


而比较弱的AI基本上要么不经思考瞎回答一个错误答案,要么自己在那儿吭哧吭哧写程序暴力搜索,最后卡半个一个小时无果。





两个优秀答案截图







我跑的一些结果

工具: codex-cli
模型: gpt-5.6-sol
思考: xhigh
来源: 某中转站1
耗时: 5分钟
结果: 11 ✅

工具: claude-cli
模型: claude-opus-5
思考: xhigh
来源: 某中转站1
耗时: 28分钟
结果: 11 ✅

工具: claude-cli
模型: claude-opus-5
思考: xhigh
来源: 某中转站2
耗时: 1分钟
结果: 9 ❌ (大概率掺水)

工具: claude-cli
模型: deepseek-v4-pro
思考: max
来源: 官方
耗时: 60分钟
结果: 做不出来 ❌

工具: chatgpt-web
模型: gpt-5.6-sol
思考: high
来源: 官方
耗时: 5分钟
结果: 11 ✅

工具: codex-app
模型: gpt-5.6-sol
思考: xhigh
来源: 官方
耗时: 9分钟
结果: 11 ✅

工具: codex-app
模型: gpt-5.6-luna
思考: max
来源: 官方
耗时: 20分钟
结果: 11 ✅

工具: codex-app
模型: gpt-5.6-luna
思考: high
来源: 官方
耗时: 30分钟
结果: 11 ✅

工具: codex-app
模型: gpt-5.6-luna
思考: medium
来源: 官方
耗时: 10分钟
结果: 8 ❌

最新回复 (13)
  • RuiQian Qin 08-14 15:50
    1

    这么一看 deepseek拉完了啊啊 flash测试了吗

  • Russ Cox 楼主 08-14 16:41
    2

    deepseek-v4-flash 不愧是劳模,虽然天资不高,但是勤勤恳恳任劳任怨,中途虽然出了很多错,但自己慢慢改正重新尝试,终于在 40 分钟后做出来了。

  • RuiQian Qin 08-14 16:44
    3

    哈哈哈 真的值了 这个模型便宜 看起来还真不错呢

  • 翠花上酸菜 08-14 16:44
    4

    那pro太拉了,希望ds下一个pro能变正常 ^-^

  • Gforward 08-14 17:34
    5



    大概吭哧了四五十分钟 ^-^

  • zh522130 08-14 17:58
    6

    grok-4.6


  • likoloco 08-14 18:34
    7

    dsh-session-session-020b8d7d-18dd-49b8-837a-1f3ec4556094.zip (1.4 MB)

    V4P 用Dsh,跑了45分钟终于跑出来了

  • lueluelue 08-14 18:43
    8

    允许工具调用吗?纯思考做还是带工具

  • lueluelue 08-14 18:50
    9

    GPT 5.6 medium成功了


  • 浅影阿 08-14 18:59
    10

    网页版,5.6-sol-xhigh

  • WWT 08-14 19:09
    11





    反重力 Gemini 3.7 flash 5分钟^-^^-^^-^

  • HHF 08-14 19:12
    12

    想问佬友,这个截图是gpt-image-2做出来的吗?就是这个解释的图,感觉很好看哎

  • Russ Cox 楼主 08-14 19:15
    13

    嗯,GPT回答完以后直接追加一句聊天,让它把思考过程转成一张图

* 帖子来源Linux.do
返回