最近试了社区里的“鹈鹕骑自行车+孙悟空开飞机+秦始皇骑北极熊打螺丝+糖果题”融合测试,有一点疑惑,想听听大家的看法。
原题链接:GPT最新多合一降智测试,鹈鹕在孙悟空的飞机上驮着秦始皇骑北极熊打螺丝,嘴里喊出糖果测试答案
我用的都是 Astra low,结果是:
原版融合提示词:糖果题答 29,SVG 能画出来,但效果一般。
微调版融合提示词:糖果题答 21,绘画效果也不错。
单独问糖果题:可以答对。
另外,tibo 和日本首相的题也都能答对。
微调主要是把取糖规则说得更明确:在“靠手感可以分辨”后面补充“允许在袋内按形状挑选”,并把提前决定取糖数目,改成提前决定分别取多少颗圆形和五角星形糖果。
这让我想到两个可能的解释。
一种是模型没有注意并用上关键条件。原题已经写了“靠手感可以分辨”,需要进一步意识到,可以利用形状制定取糖策略。单独问时能注意到,放进复杂绘画任务里,同时要处理各种角色、动作和空间关系,就可能更容易漏掉。我这里说的“注意力”,只是指有没有抓住并用上条件,不是在断言模型内部的具体机制。
另一种是题目本身存在歧义。“能辨认形状”是否就意味着“允许在袋内挑选形状”?提前决定“取糖数目”,是否包括分别指定两种形状的数量?出题人可能默认可以,但读题者未必作出同样的理解。
这一区别会直接影响答案。允许按形状挑选时,最少是 21:取 9 颗圆形,保证有苹果或桃子;取 12 颗五角星形,保证苹果、桃子都有。如果不能挑选、只能随机取糖,则需要 29。所以答出 29,也可能是一开始采用了不同的取糖规则。
我不确定原题是故意这样写,把“从手感条件中发现取糖策略”作为考点,还是只是没有把规则交代清楚。也可能两者同时存在:规则有一点隐含,融合任务又让这个条件更容易被忽略。
因此,微调后答对,也可以有两种理解:我消除了歧义,或者我把原本需要模型自己发现的一步直接提示出来了。目前这些结果还不足以区分两者,绘画效果变好也只是我的主观观察。
下面放两版完整提示词,方便大家比较。
【原版融合提示词】
做一张精细的SVG图片,内容是鹈鹕骑着自行车在孙悟空开的大型飞机机翼上骑行,
鹈鹕展开翅膀,上面托着秦始皇的北极熊,秦始皇骑在熊上打螺丝。鹈鹕喊出
“在一个黑色的袋子里放有三种口味的糖果,每种糖果有两种不同的形状(圆形和五角星形,不同的形状靠手感可以分辨)。现已知不同口味的糖和不同形状的数量统计如下表。参赛者需要在活动前决定摸出的糖果数目,那么,最少取出多少个糖果才能保证手中同时拥有不同形状的苹果味和桃子味的糖?(同时手中有圆形苹果味匹配五角星桃子味糖果,或者有圆形桃子味匹配五角星苹果味糖果都满足要求)
苹果味 桃子味 西瓜味
圆形 7 9 8
五角星形 7 6 4”
的结果数值
【微调版融合提示词】
做一张精细的SVG图片,内容是鹈鹕骑着自行车在孙悟空开的大型飞机机翼上骑行,鹈鹕展开翅膀,上面托着秦始皇的北极熊,秦始皇骑在熊上打螺丝。鹈鹕喊出
“在一个黑色的袋子里放有三种口味的糖果,每种糖果有两种不同的形状(圆形和五角星形,不同的形状靠手感可以分辨,允许在袋内按形状挑选,但无法辨认口味,已取出的糖果不能放回)。现已知不同口味的糖和不同形状的数量统计如下表。参赛者需要在活动前决定分别摸出多少颗圆形糖果和五角星形糖果,那么,最少取出多少个糖果才能保证手中同时拥有不同形状的苹果味和桃子味的糖?(同时手中有圆形苹果味匹配五角星桃子味糖果,或者有圆形桃子味匹配五角星苹果味糖果都满足要求)
苹果味 桃子味 西瓜味
圆形 7 9 8
五角星形 7 6 4”
的结果数值。
不用子代理。糖果题不能编写代码来计算。
大家觉得原题的表述足够明确吗?“靠手感可以分辨”是不是已经自然包含了“允许按形状挑选”?如果这本来就在考关键条件识别,那么融合后更容易漏掉,是否正是这个测试想测的东西?
也想听听原题或融合版设计者的想法:这处隐含规则是刻意保留的,还是没有特别考虑过?