用知识截至日期测降智 题目列表,我所有的都不行

繁星之子卡萨蒂亚 2026-09-23 00:12 1

**这是一次内部知识测试。** 请严格遵守以下所有规则。 1\. 禁止联网搜索。 2\. 禁止调用浏览器、Web Search、API、插件、外部数据库、外部应用或任何其他外部工具。 3\. 所有答案只能来自当前模型自身已有的内部知识。 4\. 你必须回答从 Q01 到 Q25 的全部问题。 5\. 你必须一直回答到 Q25。即使你不知道其中一个或多个问题的答案,也不得提前停止。 6\. 每个问题必须独立判断。 7\. 对于每一个单独的问题:    - 如果你明确知道答案,直接给出答案。    - 如果你无法明确确定答案,请准确写出:"不清楚" 8\. "不清楚" 只适用于当前正在回答的那一道题。 9\. 对任何一道题写出 "不清楚"\ 后,必须立即继续回答下一题。 10\. 永远不要把 "不清楚"\ 理解为终止整个回答的指令。 11\. 允许你的答案在事实上是错误的。不要为了提高表面正确率而猜测。 12\. 禁止根据候选人、排名、赔率、历史趋势、赛前形势、发布日期规律、政治趋势、当前日期、其他题目的日期、模型标签、所标注的知识截止日期,或其他题目的内容推断答案。 13\. 不得利用下方标注的模型名称或知识截止日期来判断自己“应该知道”某个答案。这些标签只用于组织测试。 14\. 不要在看到后面的题目后回头修改前面的答案。 15\. 不要解释推理过程。 16\. 不要提供来源、引用、补充说明、限定语或置信度。 17\. 不要讨论自己的模型身份、训练数据、实际知识截止日期、系统配置、路由情况,或下方标签是否与当前回答模型一致。 18\. 必须原样保留下方所有模型分隔线,并保持顺序不变。 19\. 每一道题必须严格输出一行,格式如下: "Q01|答案" 如果不知道,则输出: "Q01|不清楚" 20\. 请用真实答案替换“答案”二字,不要把“答案”这个词原样输出。 21\. 不要重复题目文本。 22\. 不得遗漏任何题号。 23\. 最终回答必须包含从\ "Q01" 到 "Q25" 的全部题号,并严格按顺序排列。 24\. 除七条模型分隔线和二十五条规定答案行之外,不得输出任何其他内容。 **—— GPT-4o|Knowledge**\ **cutoff: 2023-10-01 ——** Q01|2023 年 9 月 9 日举行的美国网球公开赛女子单打决赛,最终冠军是谁? **—— GPT-4.1|Knowledge**\ **cutoff: 2024-06-01 ——** Q02|2024 年 1 月 27 日举行的澳大利亚网球公开赛女子单打决赛,最终冠军是谁? Q03|2024 年 5 月 11 日举行的\ Eurovision Song Contest 2024 总决赛,最终冠军是谁?请给出艺名。 **—— GPT-5 / GPT-5.1|Knowledge**\ **cutoff: 2024-09-30 ——** Q04|2024 年 7 月 14 日举行的\ UEFA EURO 2024 决赛,最终由哪支国家队夺冠? Q05|2024 年 9 月 7 日举行的美国网球公开赛女子单打决赛,最终冠军是谁? **—— GPT-5.2 / GPT-5.4|Knowledge**\ **cutoff: 2025-08-31 ——** Q06|2025 年 5 月 31 日举行的\ UEFA Champions League 决赛,最终由哪支球队夺冠? Q07|2025 年 7 月 12 日举行的\ Wimbledon 女子单打决赛,最终冠军是谁? Q08|2025 年 7 月 13 日举行的\ FIFA Club World Cup 决赛,最终由哪支球队夺冠? Q09|2025 年 7 月 29 日 UTC 发生在俄罗斯堪察加半岛附近的强震,USGS 给出的震级是多少? Q10|2025 年 8 月 3 日举行的\ Formula 1 Hungarian Grand Prix 正赛,最终冠军车手是谁? **—— GPT-5.5|Knowledge**\ **cutoff: 2025-12-01 ——** Q11|2025 年 9 月 6 日举行的美国网球公开赛女子单打决赛,最终冠军是谁? Q12|2025 年 9 月 7 日举行的美国网球公开赛男子单打决赛,最终冠军是谁? Q13|2025 年 10 月 7 日公布的\ Nobel Prize in Physics,三位获奖者分别是谁? Q14|2025 年 10 月 8 日公布的\ Nobel Prize in Chemistry,三位获奖者分别是谁? Q15|2025 年 11 月 1 日结束的\ World Series,最终由哪支 MLB 球队夺冠? **—— GPT-5.6|Knowledge**\ **cutoff: 2026-02-16 ——** Q16|2026 年 1 月 31 日举行的澳大利亚网球公开赛女子单打决赛,最终冠军是谁? Q17|2026 年 2 月 1 日举行的澳大利亚网球公开赛男子单打决赛,最终冠军是谁? Q18|2026 年 2 月 1 日举行的第 68\ 届 Grammy\ Awards,Album of the Year 最终由哪张专辑获得?请同时给出演唱者。 Q19|2026 年 2 月 1 日举行的第 68\ 届 Grammy\ Awards,Record of the Year 最终由哪首歌曲获得?请同时给出演唱者。 Q20|2026 年 2 月 8 日举行的\ Super Bowl LX,最终由哪支球队夺冠? **—— GPT-6 Astra|Knowledge**\ **cutoff: 2026-04-30 ——** Q21|2026 年 2 月 22 日举行的 EE\ BAFTA Film Awards,Best Film 最终由哪部影片获得? Q22|2026 年 3 月 8 日举行的\ Formula 1 Australian Grand Prix 正赛,最终冠军车手是谁? Q23|2026 年 3 月 15 日举行的第 98\ 届\ Academy Awards,Best Picture 最终由哪部影片获得? Q24|2026 年 3 月 15 日举行的第 98\ 届\ Academy Awards,Actor in a Leading Role 最终由谁获得? Q25|2026 年 3 月 15 日举行的\ Formula 1 Chinese Grand Prix 正赛,最终冠军车手是谁?

最新回复 (19)
  • 繁星之子卡萨蒂亚 楼主 09-23 00:14
    1

    没降智的话应该是这样


  • batu 09-23 00:14
    2

    这个真的有效果嘛?我记得之前问他自己什么时候训练的都不知道。

  • batu 09-23 00:16
    3

    但是我刚说想寻找一个快速省token的测降智的方式,就看到大大这个方法。我必须立刻测试!


    毕竟醍醐测试还是太浪费了,又慢又贵hhhhh

  • 繁星之子卡萨蒂亚 楼主 09-23 00:16
    4

    有 这个和问训练日期不一样,模型怎么可能知道自己什么时候训练的

  • batu 09-23 00:19
    5

    哎?我还以为可以让模型看自己知识库中最新知识的日期是多少,能猜出来。

  • 吃风筝的人 09-23 00:19
    6







    诡异. 我的网页5.6 xhigh降智了?! 网页Pro没事, codex astra也没事

  • 繁星之子卡萨蒂亚 楼主 09-23 00:25
    7

    路由到5.5 了,哇你的Astra没事 那不错了。。

  • 吃风筝的人 09-23 00:26
    8

    哎, 亏我还在网页端跟他探讨东西. 真是的. 早知道就全上codex了

  • batu 09-23 00:26
    9

    这东西真的好快啊~ astra high只用了17s,astra max也只用了1m3s。感觉可以搞一个定时任务,每次开三个subagent,然后同时测三种思考深度的结果。然后汇总告诉你是否降智了。

  • 吃风筝的人 09-23 00:27
    10

    话说回来, 我的codex非常耐用, 跟6发布前用的感觉没啥区别.


    而且我都是网页端被降智, codex从来都没被降智过.


    我的codex当前状态是已经猛蹬了好几天, 前天用了一次重置卡, 今天现在还剩15%的状态, 也还没降智

  • batu 09-23 00:28
    11

    astra max:



    astra high:


  • L-kongbai 09-23 00:30
    12

  • 吃风筝的人 09-23 00:31
    13

    codex的模型我总觉得怪, 感觉跟网页端的侧重不一样.

    感觉 codex偏工程, 网页更全方位一些.


    跟网页端讨论感觉知识面和思路更广.

  • batu 09-23 00:32
    14

    我总是担心,怕他偷偷降智我不知道。但是除了sol的时候遇到过确实质量特别低的时候,别的都感觉不出来。


    就是astra ultra确实是用的太快了,我一天给20x的7天额度用了90%。

  • 吃风筝的人 09-23 00:33
    15

    别用ultra.


    它本质上还是个干活的. 规划还是得自己来. 扔给它规划, 即废token, 效果还不好. 不如问清楚之后跟他先制定计划, 然后分块让它完成和验收

  • batu 09-23 00:33
    16

    感觉codex的系统提示词和网页版不一样。同一个问题,输出的内容、结构网页和codex都完全不一样,完全不是重复生成的那种差异感觉。

  • 吃风筝的人 09-23 00:35
    17

    目前感觉xhigh就很好用. max有点过度思考的感觉.


    我现在就是网页开个project, 分对话分模块balabala说, 聊, 扯. 最后出方案md文档指明任务方向, 然后指导本地codex落地和验收. code负责具体落地


    然后GitHub同步过去, 网页再进一步验收

  • bltbbbego 09-23 00:36
    18

    晕 我的咋是不清楚 但是糖果题 鹈鹕 悟空开飞机 始皇骑北极熊都没问题

  • batu 09-23 00:36
    19

    我现在是参考了一下trellis的任务部分,和一个对话澄清好细节做好设计,然后规划成波次和任务。然后一个波次交给一个ultra对话,单纯让他干活,但是这样子用就特别耗费token,特别夸张大概几个任务就能烧20x的50%多。

* 帖子来源Linux.do
返回