GLM5.2的注意力似乎有点儿【过头】了? 不知道佬们有没有感觉

zeusfunk 2026-06-26 00:30 1

GLM5.2刚出的时候就宣传1M“真”上下文,这几天蹬了4~5亿Tokens吧,发现问题:

(首先GLM5.2确实Coding挺强)在长上下文的真实工程中,


到200k作用时仍然能够回归检索最开始的一些内容,

实际实际体验是在150k左右思考链会变得特别长,

观察thinking block会发现大量的wait /actually /let me等“左右脑互博”的内容,且经常是于最最开始的内容相关(比如我最开始几轮对话有一个要求它已经实现了,但是它还是会提到该事件)或者一些【关系不大的之前的内容】。这种情况随着上下文越长,越严重,在300k左右的时候,每次思考耗时都超过1分钟多。

最新回复 (5)
  • ohgo 06-26 00:31
    1楼

    感觉这个模型就是思维链超级长……

  • YP 06-26 00:46
    2楼

    感觉国模的思维都比较长,我用到的 deepseek 和 glm 表现尤为明显,而且仔细看的话大部分就是在原地绕圈,在一些trivial的事情上 wait, actually, but,而且一转就是十几分钟。

  • ceilf6🛡 06-26 00:49
    3楼

    主动多次裸 /compact 收口 session memory 能改善体验

  • lueluelue 06-26 00:54
    4楼

    不靠这么长的思维链,怎么能拿到这么好的成绩


    能力不行,只能思维链凑了。就和 GPT 5.2 似的,从 5.1 到 5.2 的飞跃就是思维链长度堆出来的,也和 GPT OSS 似的,但这样真的不长久

  • lueluelue 06-26 00:57
    5楼

    估计智谱和谷歌去年似的,有 kingfall 这种相对强度的模型,但是成本太高,可能连 API 都开不起

* 帖子来源Linux.do
返回