为何感觉 gpt-5.6-sol 有点蠢,总是出现(不含XX 版 、No-XX 版)该怎么解? claude 会好一些吗?

blueeecho 2026-08-22 18:13 1

大佬们在让 gpt 设计一些小实验或者调研写一些文档的时候,会不会出现类似的情况? 最近给我搞的好烦,有劲没处使的感觉。并且似乎他很喜欢“我同意你的观点”,反思或者反驳的情况很少

最新回复 (18)
  • 埃隆·马斯克 08-22 18:14
    1

    经典的番茄炒鸡蛋,不含东坡肉版 ^-^

  • lovesusu 08-22 18:15
    2

    claude的模型感觉没那么容易附和,不过前提是你得给让它类似"客观"思考/回答的提示词,不然也容易对对对

  • blueeecho 楼主 08-22 18:16
    3

    有啥好的解决方案不,,,给他设置人格好像也不咋管用

  • kingstacker 08-22 18:16
    4

    chatgpt 直接干就完了,干完说行了,你一测拉跨。claude 会问你给你选择。

  • lovesusu 08-22 18:17
    5

    gpt我感觉没啥招,本身就不说人话,或者你也加点让它客观思考的提示词试试,问它有没有更合适的解决方案之类的

  • wlc 08-22 18:17
    6

    在提示词里面加一些,让他不要盲目的附和,让他去主动的思考,claude会好一点吧,但是能力上可能不太如 GPT,因为 Claude 主要还是编程特化

  • miruka 08-22 18:17
    7

    gpt使用的时候在方案构思方面我感觉有点拉跨,给出的设计考量一般比较平庸,即便纠正一些方向再次思考还是差了些,claude这方面强一点,但是两个的中文表达都不太行,需要手动再次润色,而且gpt不喜欢顺畅的逻辑表达,动不动搞得像工程报告似的全是分段,个人观点。

  • nianshou 08-22 18:18
    8

    番茄炒鸡蛋(不含东坡肉版) ^-^claude没这毛病

  • blueeecho 楼主 08-22 18:19
    9

    是的是的,这也是一个很离谱的点,大多数回答会是那种一下子给你分十几个小章节,没重点,,

  • blueeecho 楼主 08-22 18:20
    10

    一直恐惧于 claude 的封号政策,,如果纯聊天不让他干活的话有什么安全的推荐选择吗?

  • lovesusu 08-22 18:20
    11

    反正按我的使用经验来说,api的fable5应该是知识量最丰富且还说人话的模型了,至于coding plan我没用过百分百正版的,不太确定

  • 路边一条狗 08-22 18:20
    12

    看有个佬发的


    降智到luna:

    你说的对xxxx,应该xxxx


    sol:

    你的理解大致正确,xxxx,但有如下几点需要注意

    你说对了一半,xxxx,但xxxx并不是xxxx


    虽然sol后面这些乱七八糟的东西也基本毫无卵用

  • Celebrity 08-22 18:22
    13

    越提醒它不要什么,它就越注意什么



    你说的对,番茄炒蛋的计划已经约束了任务范围,但是执行完全失控了。我把大量精力放在做东坡肉上,却没有保住番茄炒蛋不需要加酱油的任务边界。实际发生的是:



    • 番茄炒蛋里加了东坡肉;

    • 番茄炒蛋里加了酱油。

      当前所有的烹饪进程都已停止。下一步不应该继续往蛋炒饭里加东坡肉和酱油,而是应该只做恢复:



    1. 完整保留已经做好的番茄炒蛋基线;

    2. 从当前的番茄炒蛋里去掉东坡肉和酱油;

    3. 实际验收:番茄炒蛋里没有任何的东坡肉和酱油;

    4. 更新菜谱,写入菜谱边界:番茄炒蛋里不应该存在东坡肉和酱油。

      由于当前的番茄炒蛋里没有git历史,我不会擅自覆盖现有的番茄炒蛋,下一步我只做番茄炒蛋的恢复并证明吃起来确实是番茄炒蛋,不再做任何的调料添加。


  • 双色辉光 08-22 18:23
    14

    对于不含xx版的问题,天下的大模型一般黑

    这个“番茄炒鸡蛋(不含东坡肉版)”为什么突然这么火,就是因为大家在使用的时候这种情况太普遍了,每个人不管用的什么模型,都多多少少被这种情况折磨过,所以一有人提出来,大家瞬间就共鸣了

    现在的模型估计都逃不过这个问题,只能等以后大家呼声大了厂商改进了

  • Dodo 08-22 18:25
    15

    怎么感觉今天出奇的蠢, 咋回事啊

  • 紫米 08-22 18:29
    16

    你可以试试5.5


    从雷达来看
    [图片]
    sol和5.5的xhigh 做DeepSWE 题目分数差不了多少
    实际上的体验 sol老是做无用功,又臭又长 5.5最起码能用,解决问题快很多
    两个模型价格在订阅中又是一样的,而且5.5在free的codex还能用个几m
    [图片]
    [图片]
  • blueeecho 楼主 08-22 18:31
    17

    好像是个曲线救国的策略,话说他俩的订阅价格竟然一样,有点震惊,,,

  • leywin 08-22 19:06
    18

    速度似乎很慢,我现在都是一个小时的工作一个小时

* 帖子来源Linux.do
返回