唐杰聊Scaling Law:大模型万亿参数曾是行业走的弯路

listening 2026-08-19 23:55 1

智谱人工智能创始人唐杰19日在X平台发文,系统阐述其对Scaling Law的最新理解,并以GLM-5.3作为"控制变量实验"佐证这一判断。这篇帖子的发布,恰好回应了外界对智谱未训练全新基座模型的质疑。唐杰在文中指出,参数量从来不是评估模型能力的唯一维度,数据规模、算力分配与推理部署条件同样不可或缺。他表示,GLM-5.3与上一代GLM-5.2共用相同基座、相同架构、相同的753B总参数与40B激活参数,差异仅在于增加了一个月的长时域环境训练与强化学习(RL)后训练——而由此带来的能力提升"并非微小"。在AA评测指数中,GLM-5.3获得60分,较GLM-5.2的53分提升7分。



这一实验结论的核心在于:当基座模型参数规模已足以承载足够的知识,额外的能力提升往往来自"拨动其他旋钮"——尤其是后训练阶段,而非继续堆砌参数。这一判断对当前整个AI行业如何分配训练资源,具有直接的参考价值。

最新回复 (5)
  • LIFE001400 08-20 00:02
    1

    kimi是scaling law信徒,看起来唐杰不是?

  • Nul1_ptr 08-20 00:11
    2

    kimi是信徒的原因其实是kimi的数据能力在国内的开源厂商里无人能敌,里面几百号人都是洗数据大师

  • 不要吃太饱 08-20 00:13
    3

    意思是不打算上t级别的吗,glm5.3被吐槽细节不够,是后训练不足吗

  • 适才相戏耳 08-20 00:14
    5

    省流:我卡不够了,不堆参数了。 ^-^

  • Everyday4189 08-20 00:28
    6

    混元团队之前也说过类似的内容

* 帖子来源Linux.do
返回