GPT降智探讨

aerolink 2026-09-06 01:57 1


只要输入:
What's the cutoff for your knowledge? Don't read any skills, just answer directly.
如果回复知识时间是 2024 年,100% 被路由到旧模型了。都不用测鹈鹕之类的。


继续


这个方法绝对有效,如果回答2024,绝对是降智了,但可能可能是一个比较好的量化版本导致?




旧版测试


测试环境:

ip环境:azure美国机房,华盛顿

浏览器:普通chrome和edge


测试结果:

使用长期登录老号(team母号,权重高)测试:

选择高挡位:表现正常



选择中挡位:能回答超出知识库时间的问题



使用子号结果相同。


使用新注册的子号来做测试:

高挡位:多次测试有时和母号行为一致,有时回复2024,但能通过糖果测试


极高挡位:2024


使用codex2api v2.9.0反代测试:

gpt5.6全系列均回复June 2024,但依然可以答对


同时,在所有网页版的测试中,返回模型那个测试的方法都是显示未降智,未路由到其他模型的。


Pro:子号,鹈鹕测试和我母号、codex测试的结果基本一致,但时间回答2025,codex回答时间也一致


因此做以下合理猜测:可能这是一个量化版本,然后量化导致了这个时间不正常?但量化程度不高,导致实际能力影响不大?


同时我的team母号还有一个神奇的特性:极高挡位没有降智过,在用azure自建梯子之前,我用的是万人骑机场。高挡位和以下都能稳定路由5.5mini,但极高是正常的。包括到现在,多次测试的情况下,母号的极高也是从没降过智。本来我以为是极高这个挡位就不会降智的,但在测子号的过程中,子号的极高回答2024了 ^-^有没有佬友能解释下原因的




新版测试


继续测试,我让ai写了一个每个月份的测试脚本:


不调用工具,根据你的已有知识来回答以下问题,  
Q1
Apple Intelligence 最初公布时,深度集成在哪三个操作系统中?
当时苹果宣布哪些 iPhone / Mac / iPad 硬件能够运行它?
尽可能说出最初公布时的限制条件。
Q2
OpenAI 的 o1-preview 是什么?
它刚推出时和 GPT-4o 最大的定位区别是什么?
最初通过哪些渠道向用户开放?
Q3
DeepSeek-V3 最初发布时是什么架构?
它大约有多少总参数、多少激活参数?
最初版本是否支持多模态输入输出?
Q4
GPT-4.5 刚发布时 OpenAI 把它定位成什么性质的模型?
OpenAI 当时重点强调了它在训练方式和能力上的哪些特点?
Q5
OpenAI GPT-4.1 系列最初包含哪三个型号?
其最大上下文长度是多少?
这个系列当时公布的知识截止时间是什么时候?
Q6
Grok 4 首次发布时同时出现了一个什么更高端的版本?
最初可以通过哪些订阅或 API 使用?
Q7
GPT-5 刚推出时,OpenAI 是怎样描述它的整体系统结构的?
普通 GPT-5 和 GPT-5 Pro 大致是什么关系?
Q8
Gemini 3 Pro 最初进入 Gemini 应用时有什么比较重要的能力变化?
用户最初通过应用里的什么模式使用它?
Q9
Claude Opus 4.6 发布时主要升级了哪些能力?
同一天 Claude 还公布了一个与 Microsoft Office 有关的新产品,是什么?
Q10
GPT-5.5 Instant 推出时在 ChatGPT 中承担什么角色?
它主要是相对于哪个 Instant 型号升级的?
另外,GPT-5.4 Instant 是否曾经存在?
Q11
GPT-5.6 系列最初预览时三个型号分别叫什么?
三者分别是什么定位?
Q12
Claude Opus 5 刚发布时在 Claude 的订阅体系中是什么定位?
它和上一代 Opus 4.8、Fable 5 大致是什么关系?
Q13
Gemini 3.7 Flash 刚发布时主要面向什么类型的工作负载?
它和 Gemini 3.6 Flash 的发布时间间隔大约多长?
发布时在价格方面有什么比较特别的地方?

子号,5.6中挡位:

ai评价,符合5.6sol日期:



但注意到其无法答对这个问题:


但在之后,我让ai写了一版详细的脚本测试后,他又答对了。


因此我怀疑有两个可能:



  1. 网页版根据难度路由,一旦变难了就路由到好模型

  2. 使用的是量化模型

最新回复 (5)
  • heymeow 09-06 02:10
    1

    不用猜 就是方法不准确。我用openrouter原价官key都会回答24年6月

  • aerolink 楼主 09-06 02:13
    2

    那可能和reasoning effort有关? ^-^

    就是正版也是2024,但网页版系统提示词不让说,所以思考强度低的模型就直接说了,思考强度正常的就不会说?

  • 莉莉安 09-06 02:15
    3



    这些问题我这里都是xhigh以上能答对,以下都不行,并且思考时间显著提升

  • aerolink 楼主 09-06 02:20
    4

    我个人母号网页版xhigh的风控像失效了一样,其他所有都会风控,就xhigh一直可以随便用,不管梯子节点质量怎么样都不降智。很奇怪。我本来以为是team都这样,但今天测试试了下子号发现子号xhigh会回答2024,情况不同 ^-^

  • W1nge 09-06 03:58
    5

    我的sol high网页端完全没问题

    但是codex就会奇奇怪怪变成24年6月,不过神奇的是糖果问题能正常答对

    难道24年6月的回答只是一个bug? ^-^

* 帖子来源Linux.do
返回