继DeepSeek不同思维链任务表现差异明显,我发现GLM似乎也一样

幻方集团Anthropic中心Gemini事业部MiniMax业务组GLM&Grok生态合作计划大中华区销售总监 - 山姆·奥特曼(试用期) 2026-08-19 00:42 1

众所周知,前几天D老师三种思维链吵得沸沸扬扬,“we need”是最强的,实打实的差异,感知还是挺明显。


GLM5.3上了之后,听说谱子增加算力了,直接开了个冤种订阅,确实429不怎么出现了。


这几天从早蹬到晚,就发现有的时候GLM像脑子抽筋了一样,比如上午干活还好好的,规划阶段能考虑到你没想到的方向提出盲点和新的创意,下午突然就开始听不懂话,干完返工,说一步干一步需要仔细盯着。

一开始我把这种情况归类为降智,可能是高峰期的出生行为,毕竟Z/嘛,就在今天我突然注意到GLM思维链也不只一种,最明显的就是语种不同,然后开始翻会话,重点看thinking内容,发现思维链是英文任务过程都是很流畅的,中文就差点意思,甚至会让人破防


英文思维链,还会自己评审方案


中文思维链,没睡醒的糊涂蛋


个人样本不足难下定论,并且具体触发方式没找到,不能稳定复现,有没有用GLM的佬来讨论下这种情况真实存在还是心理作用


(不会是蒸的人格分裂了吧,如果真是后遗症那就太悲观了)

最新回复 (3)
  • 白学森 08-19 01:12
    1

    DSv4P的问题是后训练不足,GLM是后训练过头了;

    感觉都容易出现学习做题半生半熟的情况。熟悉的做的很快,不熟悉的直接流口水

  • dabao1955 08-19 01:13
    2

    deepseek v4 pro 不仅后训练不足,貌似还出现了过拟合的情况

  • 白学森 08-19 01:16
    3

    确实,详见K3报告)一直在一个Harness上训练,没做别的训练就丢上来的

* 帖子来源Linux.do
返回