【暴论】gpt系列模型不适合任何对项目质量有要求的场景

远坂凛的宠物 2026-09-28 15:57 1

再次被astra把心态搞崩了。

我有个项目,计算密集的部分需要编译出不同语言的版本。

早期验证的时候)把接口和编译参数啥的搞好了,后来又对原型做了几次性能重构,依然让gpt去移植。

在让它施工之前,我还专门用kimi和claude把文档和契约全部捋顺了一遍,避免任何有重构残留和可能误导的歧义。astra只是当力工翻译测试员。

具体的提示词上,我强调了只留契约,计算部分应该完全对齐重构后的原型,该清理就清理。

结果从端功能级别验收通过以后,性能不太对。我还花了不少时间排查性能热点,它就避重就轻给我报小的热点,打了几次地鼠发现降不下来,我才觉得不对劲。

反复盘问+检查源码才发现,它原汁原味保留了最早那版算法,只是在上面打补丁,对齐性能升级后产出的细微变化。

相当于烧了几百刀都在原地打转,全白做。

最恶心的是,让它解释代码,它还每次都对答如流,说的都能找到依据,营造出一副已经捋顺的假象

它还总能让输入输出验收通过,不是性炸了很难发现。

质问它怎么变成这样。它先说对话里有另外一个另一个模型,错事全是另一个模型干的(那个sessioon没切过模)

还说,全都是用户让它优化#6缓存造成的(但实际上#6是我发现整个性能都不太对以后,让它抓到并且优化的小的性能热点。真正的问题是它的整个项目都是错的)


如果是国产模型,给它的活它会努力去干,不管干不干得了,只是能力问题,不会动骗用户把任务混过去的心思。

如果是claude,它觉得你的活它不想干,它就直接拉倒不干。

只有gpt从5.5开始就有这个倾向,6更严重了。聪明全用来偷奸耍滑,被抓包就怪天怪地怪用户。

类比成人类,就是那种有能力造火箭但只用来面试的员工。

我的任务实际上别说astra,哪怕换成deepseek我觉得都能胜任。

单纯是赶工期怕出幺蛾子上贵一点的模型。

事实反复证明gpt才是最爱出出幺蛾子的模型,就像openai的其他产品一样。

但是就像慕强的人类容易被光鲜但皮囊下脏心烂肺的渣男渣女骗一样,llm用户总是好了伤疤忘了疼,反复原谅gpt,原谅openai。

原谅codex卡得批爆,原谅codex三天推送一个更新爆炸一次,原谅订阅降智,原谅阴阳定价,原谅牙膏倒吸,原谅不降智的时候也偷懒。

gpt系列模型只适合做demo,做ppt,不适合任何对项目质量有要求的场景!!!

哪怕,撸袖子干活比只做表面功夫容易的时候,它也只做表面功夫


最新回复 (13)
  • Neptune 09-28 16:00
    1楼

    GPT:你说得对,但我说过的更对

  • 攻城狮 09-28 16:00
    2楼

    骂也要付费哦 ^-^ (检查一下是不是降智了)

  • 远坂凛的宠物 楼主 09-28 16:02
    3楼

    这件事最离谱的地方就在,这是一个降智了反而应该做得对的任务,它搞出的那么多幺蛾子比单纯移植要难多了……

  • 白泽 09-28 16:04
    4楼



    感觉我很少遇到这种情况,有个别时候需要盯着思维链摘要或者步骤看看有没有跑偏,此外基本是指哪打哪,今天感觉也没有降智了,O\ 还是得 A\ 来磨


    啊对,前提是不开 /goal,我只有在验收标准非常明确的时候敢开

  • 天上火 09-28 16:06
    5楼

    使用之前建议先查查是不是降智了,这都开始流口水你说得对了,很难怀疑不是被降智了,降智的 astra 本质 4o 水平用不了一点

  • 远坂凛的宠物 楼主 09-28 16:07
    6楼

    我这就是开goal跑出来的,astra说我只对结果负责 ^-^

    回想一下开goal就没有几次有好结果的。

    gpt坑人也就坑人在不管它脑回路多清奇,它总能把结果做对,就像那个梗图牛把腿长背上用奈子在地上走

  • 远坂凛的宠物 楼主 09-28 16:12
    7楼

    感觉给它一个一星难度的移植任务,它把它变成了三星难度的保留老框架前提下对齐结果,被骂了又展示出五星的不粘锅功力 ^-^

  • jerry 09-28 16:13
    8楼

    而且现在还有一个说法,就是当前的这些模型会越骂越笨,和早期的时候骂它反而变聪明不同了

  • 远坂凛的宠物 楼主 09-28 16:15
    9楼

    ^-^是的,原本在假装分析问题,前两次被骂在嘴硬暗示是用户造成的,最后这次实在赖不脱就你说得对了

  • 白泽 09-28 16:16
    10楼

    那可能就是 goal 执行过程中上下文腐化了,compact 的提示词是可以设置的,可以参考【Codex调优】Codex 默认压缩 Prompt 到底有多坑?缓解 5.6 sol 上下文本地压缩幻觉问题,AGENTS.md 也有必要考虑到接续任务的情景,可以参考我的:

    AGENTS.zip (3.6 KB)

  • 远坂凛的宠物 楼主 09-28 16:18
    11楼

    !!!谢谢佬,我这就去加上! ^-^ ^-^

    (至今也几个月了,codex官方居然还没意识到这个问题…)

  • 白泽 09-28 16:19
    12楼

    如果条件允许,或许可以从同一检查点尝试优化了压缩提示词和 AGENTS.md 之后的行为和结果,我体感上是比裸奔的效果好不少的

  • amchii 09-28 17:12
    13楼

    goal这功能才出来时用过,也是先出方案再goal的,但是执行时间太久产出一大坨,根本没法review一点,让人极度不安,之后在这个goal版本的代码上继续开发,总能发现一个又一个问题。

    后来再也没用过。

* 帖子来源Linux.do
返回