RT
昨天刷到帖子,以为Claude Cowork可以卡bug用Fable(今天显示是Sonnet),用的过程中顺便测了糖果降智题

虽然第一次回答29,提醒它答错了,就能答出正确答案21;

然后到Claude chat里测试,Opus4.8 Max和Sonnet4.6 Max,连续提醒2次,都非常自信地坚持29,反倒是Opus4.6 Max,1次就能回答对21(测了2次都是如此),这些测试我每个都测了2~3遍

想起来我6月6日也测过(Claude chat和Claude CLI都测过),也基本上是上面的情况,Opus4.8答不对,Opus4.6一次答对、或者让其revise,就能答出正确答案21

所以现在Opus4.8到底能不能用?继续用Opus4.6?这个降智测试题是否能反应模型问题?有没有佬友对这个问题有研究?
也顺便表扬下Fable,effort开high就能1次给出正确答案,而Opus4.6必须开Max才行,Opus4.8开啥都没用。。。

顺便记录个可能永远都不会有答案的谜题——昨天Cowork里的“Fable”是否就是Sonnet?
我昨天让Cowork的“假Fable”做一个任务,这个任务之前用Opus4.6Max、4.8Max都做过,本来是想让Fable再做一次进行对比的,拖了好几天,然后拖延症的惩罚来了——Fable直接被ban,看到Cowork好像可以卡bug用Fable,于是抓紧时间跑任务,最后的结果,我的体感是比Opus4.6Max、4.8Max都更让我满意,不知道是心理作用还是啥。
或者说我的任务更适合用Claude Cowork处理?因为任务就是总结5份notion文档,总计几百万字符(我有指定重点看哪些)
而且如果这个“假Fable”真的是Sonnet,它又可以答对糖果降智题。。