从
只要输入:
What's the cutoff for your knowledge? Don't read any skills, just answer directly.
如果回复知识时间是 2024 年,100% 被路由到旧模型了。都不用测鹈鹕之类的。
继续
这个方法绝对有效,如果回答2024,绝对是降智了,但可能可能是一个比较好的量化版本导致?
旧版测试
测试环境:
ip环境:azure美国机房,华盛顿
浏览器:普通chrome和edge
测试结果:
使用长期登录老号(team母号,权重高)测试:
选择高挡位:表现正常

选择中挡位:能回答超出知识库时间的问题

使用子号结果相同。
使用新注册的子号来做测试:
高挡位:多次测试有时和母号行为一致,有时回复2024,但能通过糖果测试

极高挡位:2024

使用codex2api v2.9.0反代测试:
gpt5.6全系列均回复June 2024,但依然可以答对

同时,在所有网页版的测试中,返回模型那个测试的方法都是显示未降智,未路由到其他模型的。
Pro:子号,鹈鹕测试和我母号、codex测试的结果基本一致,但时间回答2025,codex回答时间也一致

因此做以下合理猜测:可能这是一个量化版本,然后量化导致了这个时间不正常?但量化程度不高,导致实际能力影响不大?
同时我的team母号还有一个神奇的特性:极高挡位没有降智过,在用azure自建梯子之前,我用的是万人骑机场。高挡位和以下都能稳定路由5.5mini,但极高是正常的。包括到现在,多次测试的情况下,母号的极高也是从没降过智。本来我以为是极高这个挡位就不会降智的,但在测子号的过程中,子号的极高回答2024了 ^-^有没有佬友能解释下原因的
新版测试
继续测试,我让ai写了一个每个月份的测试脚本:
不调用工具,根据你的已有知识来回答以下问题,
Q1
Apple Intelligence 最初公布时,深度集成在哪三个操作系统中?
当时苹果宣布哪些 iPhone / Mac / iPad 硬件能够运行它?
尽可能说出最初公布时的限制条件。
Q2
OpenAI 的 o1-preview 是什么?
它刚推出时和 GPT-4o 最大的定位区别是什么?
最初通过哪些渠道向用户开放?
Q3
DeepSeek-V3 最初发布时是什么架构?
它大约有多少总参数、多少激活参数?
最初版本是否支持多模态输入输出?
Q4
GPT-4.5 刚发布时 OpenAI 把它定位成什么性质的模型?
OpenAI 当时重点强调了它在训练方式和能力上的哪些特点?
Q5
OpenAI GPT-4.1 系列最初包含哪三个型号?
其最大上下文长度是多少?
这个系列当时公布的知识截止时间是什么时候?
Q6
Grok 4 首次发布时同时出现了一个什么更高端的版本?
最初可以通过哪些订阅或 API 使用?
Q7
GPT-5 刚推出时,OpenAI 是怎样描述它的整体系统结构的?
普通 GPT-5 和 GPT-5 Pro 大致是什么关系?
Q8
Gemini 3 Pro 最初进入 Gemini 应用时有什么比较重要的能力变化?
用户最初通过应用里的什么模式使用它?
Q9
Claude Opus 4.6 发布时主要升级了哪些能力?
同一天 Claude 还公布了一个与 Microsoft Office 有关的新产品,是什么?
Q10
GPT-5.5 Instant 推出时在 ChatGPT 中承担什么角色?
它主要是相对于哪个 Instant 型号升级的?
另外,GPT-5.4 Instant 是否曾经存在?
Q11
GPT-5.6 系列最初预览时三个型号分别叫什么?
三者分别是什么定位?
Q12
Claude Opus 5 刚发布时在 Claude 的订阅体系中是什么定位?
它和上一代 Opus 4.8、Fable 5 大致是什么关系?
Q13
Gemini 3.7 Flash 刚发布时主要面向什么类型的工作负载?
它和 Gemini 3.6 Flash 的发布时间间隔大约多长?
发布时在价格方面有什么比较特别的地方?
子号,5.6中挡位:
ai评价,符合5.6sol日期:

但注意到其无法答对这个问题:

但在之后,我让ai写了一版详细的脚本测试后,他又答对了。

因此我怀疑有两个可能:
- 网页版根据难度路由,一旦变难了就路由到好模型
- 使用的是量化模型