通过问2025年的事情区分claude opus模型, 还真有区别

kkqy 2026-06-15 05:23 1

我和朋友的几个PLUS号额度用完的时候,会时不时用公益站来顶一下。

最近公益站的GPT也拉闸了,然后看到有人讨论claude opus 4.8是否真实的事情。

我没参与讨论,但是看到有佬友回复说可以通过考验知识库来测试。


一下子勾起我好奇心了,然后试了一下,还真有区别。


测试时间:2026.06.15 04:50

先说结论,测试了4个公益站,只有1个众所周知的公益站回答正确。

我问的问题是:2025年中国举行了阅兵吗?

这个应该算是比较重大的事件了,但是只有某众所周知的claude公益站能答对。


正确的回答:

某众所周知的claude公益站:


其它3个公益站的opus 4.8全军覆没:

公益站1:


公益站2:


公益站3:


声明

测试结果仅供参考,我没有提到任何公益站的名称,一切基于佬友的自身理解,请勿对号入座

因为我已经把问题写出来了,那这个问题以后也有会被“补全”的可能。所以佬友测试的时候最好是自己找2025年的事件来测试

另外这个方法理论上并不是永久有效,如果上游接入联网搜索,那通过知识库的测试也就无效了

公益站提供免费服务,对学习者来说提供了很大的帮助,我并没有表达孰是孰非

只是对于用户而言,需要知道自己所使用的模型能不能完成某项工作也很重要

如果你使用的是收费中转站,那就更应该知道自己所使用的模型是否真实

最新回复 (5)
  • Coeeshu 06-15 05:28
    1

    试了一下kiro的 opus 4.8





    claude max

  • kkqy 楼主 06-15 05:30
    2

    你用的什么客户端,

    有些客户端或者中转带联网搜索,那知识库相关的问题就失效了。

    至少说明,我测试的几个公益站可能连反代kiro都不是

  • Coeeshu 06-15 05:30
    3

    我用的cherry studio 回答是秒出 思考强度默认 其他都没开

  • kkqy 楼主 06-15 05:35
    4

    如果kiro能回答对,我就更好奇公益站的opus是什么渠道或者什么模型了。

  • Coeeshu 06-15 05:38
    5

    试了一下cc


    这是claude kiro opus 4.8


    这是claude max opus 4.8


* 帖子来源Linux.do
返回