ChatGPT已经降智到没法用的程度

sa 2026-08-15 09:16 1

只比当年的Gemini3.0pro好点,但已经和上个月刚发布时没法比了.原先随便一个问题就思考一分多钟,现在秒回或者只思考十来秒.明明是推理模型说话风格和instant一样不说人话.每次回答第一个词要么是"对",要么是"可以".东扯西扯没有重点.

最新回复 (30)
  • mignonnataliens 08-15 09:17
    1

    是用的高吗

  • sa 楼主 08-15 09:17
    2

    @mignonnataliens #1 一直开高

  • superneed 08-15 09:18
    3

    换Kimi k3吧,用起来还行

  • zhu0823 08-15 09:18
    4

    sol max感觉还行

  • yam69 08-15 09:18
    5

    不敢苟同

  • 锦鲤 08-15 09:20
    6

    不敢苟同

  • sa 楼主 08-15 09:20
    7

    8月初模型回答风格突然大变,之后和instant一样在结尾问"如果你xx,我可以继续讲xx",还出现零星的emoji

  • 403Forbidden 08-15 09:21
    8

    现在确实秒回。

  • 胡七八骑 08-15 09:23
    9

    对截图中“ChatGPT 已经降智到没法用的程度”帖子的分析


    这帖子的核心抱怨有四个:


    “刚发布时随便一个问题思考一分钟,现在秒回或十几秒”

    “明明是推理模型,说话风格和 instant 一样”

    “每次回答开头不是‘对’就是‘可以’”

    “东扯西扯,没有重点”


    我觉得这里面,体验上的抱怨可能是真实的,但用“思考时间缩短 = 模型降智”来下结论并不可靠。


    1. 响应快慢不能直接代表推理强弱


    现在 ChatGPT 的产品机制本来就存在“按问题动态分配推理量”的设计。OpenAI 当前官方说明里,GPT-5.6 在 ChatGPT 中即使选着 Instant,对于复杂请求也可以自动投入更多推理;用户还可以关闭/开启这种自动推理,或直接选择推理等级。


    参考:https://help.openai.com/articles/11909943


    换句话说,同一个“推理模型”并不意味着每次都固定思考 60 秒。简单题十几秒甚至很快返回,本身不能证明它被换成了小模型。


    而且这种趋势并不是临时说辞。OpenAI 此前对 GPT-5 系列的公开设计就是“该快的时候快,该深入的时候深入”,后续版本也持续强调更少 token、更高推理效率。例如 GPT-5.5 官方资料明确表示,它在不少任务上能够用更少 token 完成同样工作,同时维持或提升能力。


    参考:https://openai.com/index/introducing-gpt-5-5/


    所以“以前想一分钟,现在只想十秒”有三种可能:



    • 真的分配了更少计算;

    • 模型效率提高了;

    • 这次问题被系统判断为不值得高推理量。


    光靠 UI 上的等待时间没法区分。


    2. “推理模型越来越像 Instant”可能是真实的产品体验变化


    这个完全可能发生,而且不需要模型本身智力下降。


    因为“聪明程度”和“回答风格”是两条不同的轴。一个模型完全可能内部做了不错的推理,但最后输出被调成:



    • 更短;

    • 更口语;

    • 更快给结论;

    • 少展示分析过程;

    • 少写背景铺垫。


    OpenAI 目前也明确把 Instant / Thinking、自动切换以及 reasoning level 做成产品层面的独立控制。


    参考:https://help.openai.com/articles/11909943


    因此用户感觉“Thinking 说话越来越像 Instant”,未必是错觉,但它并不能单独证明底层模型被偷偷降级。


    3. “开头总是‘对’、‘可以’”是一个很具体的风格问题


    比如用户问:


    有没有可能 A 导致 B?


    模型如果机械地回答:


    对,这种情况确实有可能……


    或者:


    可以,我们可以从三个方面来看……


    用多了以后确实会产生非常明显的“AI 腔”。


    这里楼主实际抱怨的是:


    模型越来越倾向于先顺着用户说,再开始组织内容。


    这和逻辑能力不是一回事,但会让人产生很强的“降智感”,因为好的推理回答更应该先判断:



    • 前提成立吗?

    • 问题有没有混淆概念?

    • 哪部分确定,哪部分只是猜测?


    而不是先来一句“对”。


    所以如果他的历史体验确实从“先分析问题”变成了“大量确认式开场”,那我认为这是一个有效的质量反馈,只是应该叫“回答风格/指令遵循退化”,而不是直接等同于“智力下降”。


    4. “东扯西扯没重点”比思考时间更能衡量是否真的退化


    真正判断模型有没有降智,最好不要看:


    思考了多久。


    而要拿同一批测试题去比较:



    1. 有没有漏掉关键约束;

    2. 能不能发现题目里的错误前提;

    3. 多步推理是否正确;

    4. 是否反复说废话;

    5. 是否回答了真正的问题;

    6. 同一个 prompt 多跑几次,稳定性如何。


    如果一个月前和现在用完全相同的 20~50 个问题做 A/B,当前版本持续出现更多漏条件、错推理、答非所问,那才是比较强的“降智”证据。


    只凭截图里的:


    以前一分钟,现在十秒


    证据力度其实很弱。


    5. ChatGPT 本身确实不是一个永远固定不变的推理端点


    官方现在会持续调整模型、自动 reasoning、model picker 和产品配置。当前帮助文档甚至专门提供了关闭自动推理、选择 reasoning level 的设置。


    参考:https://help.openai.com/articles/11909943


    因此一个用户说:


    “一个月前的同一个 ChatGPT 和今天体感不一样”


    这件事情本身完全可能发生


    但从外部很难进一步证明究竟是:



    • 模型权重变了;

    • reasoning budget 调低了;

    • 自动路由变了;

    • 输出风格调了;

    • 上下文或个性化影响;

    • 用户碰巧测试的问题不同。


    这几件事在体感上都可能表现成“降智”。


    结论


    我对这个帖子的评价大概是:


    “体感反馈有价值,因果判断证据不足。”


    尤其是楼主说的 “废话变多、重点变少、Thinking 像 Instant、机械式‘对/可以’开头”,这些比“思考时间变短”更值得重视;但要据此证明“OpenAI 把推理能力砍了”,目前这张图里的证据远远不够。


    如果要更可靠地验证“是否真的降智”,最好的方法是准备一组固定题目,对不同时间、不同模式做 A/B 测试,并记录:



    • 正确率;

    • 是否遗漏约束;

    • 推理完整性;

    • 输出冗余程度;

    • 稳定性;

    • 是否真正回答了问题。

  • Sing- 08-15 09:24
    10

    开工作模式

  • sa 楼主 08-15 09:24
    11

    @Sing- #10 codex额度已经用完了

  • sa 楼主 08-15 09:27
    12

    @胡七八骑 #9 但是思考时间确实变短了,现在经常直接不思考.同样的模型思考时间变短回答质量肯定会下降,除非已经到过度思考的程度.而不是像这个ai说的一样思考时间"不能简单的当作参考"

  • wangsk 08-15 09:30
    13

    我的没啥问题

  • ffhmfd 08-15 09:33
    14

    @sa #7 这个太典了,我也遇到过,感觉gpt变豆包了

  • wzx 08-15 09:34
    15

    上家宽吧

  • sa 楼主 08-15 09:35
    16

    @wzx #15 跟ip没啥关系,我一直在用同一台鸡.之前没问题,现在回答质量变差.

  • Dinosaur 08-15 09:36
    17

    确实有点降智了

  • wzx 08-15 09:36
    18

    @sa #16 被邻居注册机玩坏了就是这样的,换ip就好了

  • sa 楼主 08-15 09:37
    19

    @wzx #18 nobrand的jp,IP一直很干净.

  • yxmyxmyyy 08-15 09:37
    20

    现在都是用codex,有额度的一般不会降智商太狠 ^-^

  • cozy 08-15 09:45
    21

    不敢苟同

  • Dell-Vnie 08-15 09:46
    22

    5.6 似乎还很烧token

  • TianPing 08-15 09:48
    23

    之前用sol xhigh遇到过降智,后面就一直用sol max了

  • MC-BBQ 08-15 09:49
    24

    不敢苟同

  • fotxitek 08-15 11:00
    25

    换depseek v4flash,这是咱们中国人自己的模型,中国人已经站起来了

  • cybort 08-15 12:07
    26

    减少废话,多干活

  • 陌生人 08-15 12:09
    27

    不敢苟同

    你被降智了吧

  • lehuoyisheng 08-15 13:18
    28

    一直真家宽,没觉得降至

  • RiverLinn 08-15 13:41
    29

    前几次重置后,推上就已经很多人测出来gpt有了降智了。

  • sa 楼主 08-15 13:49
    30

    IP差解释不了之前用起来没问题,我手上也不止一台鸡,不可能全部因为IP降智

* 帖子来源NodeSeek
返回