先叠个甲。我希望DKG等国模越来越强,早日超过Astra和Fable,这对普通开发者和用户都好。
本篇主要分析为什么Anthropic、OpenAI为什么会如此反感别人蒸馏自己。注意:“理解它们为什么反对”,不等于“支持它们反对蒸馏”,更不代表我认同它们对“什么算合理蒸馏、什么算不合理蒸馏”的定义。
蒸馏本身当然不是什么邪门技术,OpenAI自己就提供过官方的model distillation工作流,A\在自己的文章里也明确承认distillation是行业内很常见、很正常的训练方法。争议从来都不是“student向teacher学习”这件事本身。
真正有分歧的是:
- teacher的输出怎么拿到?
- 有没有违反服务条款?
- 有没有把不知道自己正在参与这件事的真实用户也卷进来?
以及最核心的一点——竞争对手到底可以在多大程度上利用另一个公司的研发成果?
我自己理解OA为什么对这个事情这么敏感,主要还是因为现在做frontier model,最贵的可能已经不只是训练,而是探索。
可以很粗糙地把模型研发想成一张考试卷。
- 从30分做到60分是一种成本。
- 从60分做到90分是另一种成本。
- 从90分做到100分,成本又高不止一个数量级。
但最麻烦的其实是已经做到100分以后,想办法找一道以前不存在的题,把能力做到101。
因为前面至少知道题目是什么,而到了最前沿以后,连下一步做什么都不一定知道。
你可能有十个看起来都非常合理的研究方向,每一个都需要大量人力物力和时间。
但最后事实证明前九个路子没用,真正发布出来的只有剩下那个。
外界看到的是最后那一个成功的方案,但公司真正花掉的钱,其实包括前面九次失败。
我觉得这才是理解“为什么前沿公司这么害怕蒸馏”的关键,如果别人能够观察你的最终模型,然后用大量query去拟合它,那么他节省的不只是几次训练的FLOPs,而是对方不用完整走一遍你走过的探索空间。
这也是我认为为什么R1问世就震撼了硅谷和华尔街:DS-R1-Zero用如此有限的算力证明了大规模RL本身可以诱导出很强的reasoning behavior,R1又展示了冷启、RL、SFT等环节如何组合,连强模型的reasoning能力可以有效蒸馏给小模型这件事都直接做了一遍,而且官方明确允许其他人继续拿R1做蒸馏
所以如果继续刚刚的分数比喻:R1最重要的影响之一,是让大量团队突然知道“30到60怎么走”了,而这正是之前OA一直想藏的事
以前大家连RL能不能稳定地产生这种reasoning、该怎么训、会出现什么现象,都要自己摸,后来至少知道这条路存在。在研究里,“知道一条路存在”和“不知道这条路到底存不存在”,完全是不同的难度。
这也解释了为什么OA非常反感别人蒸馏自己,而DKG把模型开源以后,又非常欢迎别人基于自己的东西继续训练。
如果我是frontier的最前面那家公司,我当然不愿意把这种探索成本免费变成竞争对手的监督信号。但如果我是追赶者,或者我想让自己的模型成为一个事实上的开源基础设施,那么事情正好反过来。
所以我个人不太喜欢把这个问题简单概括成“开源正义vs闭源邪恶”,或者反过来变成“蒸馏就是偷”。
商业公司首先还是在做符合自身位置的事情。
国模目前一个比较现实的约束仍然是顶级GPU算力。虽然CN在电力、数据中心建设、工程成本和庞大的墙内市场上有自己的条件,但这些都不能凭空替代高端芯片。
因此,在算力受限的环境下,想办法提高每一单位算力的研发效率,本身就特别重要。蒸馏、合成数据、RL、MoE、推理优化,本质上多少都有一点这个少花钱多做事的味道。
我觉得DKG这些公司的存在,对整个行业都是好事,只要它们能一直能追在后面,甚至偶尔某些能力反超,前沿闭源厂商就不可能完全无视价格、推理成本和开放程度。
站在用户角度,我其实挺希望这种状态维持得久一点。
至于蒸馏行为合不合规,路由方式是不是合适,会对普通用户带来什么影响,不是本帖讨论的内容
当然,蒸馏有效的前提还是自己本身得够硬。MiniMax就是一个很典型的例子,就算真的从更强模型那里学到了不少东西,如果自己的基座能力、后训练方法和奖励设计靠不住,最后也很难把这些稳定转化成真正的模型能力