同样是蒸馏,为什么OA和国产开源模型的利益并不一样?

Timoris 2026-09-12 15:29 1

先叠个甲。我希望DKG等国模越来越强,早日超过Astra和Fable,这对普通开发者和用户都好。


本篇主要分析为什么Anthropic、OpenAI为什么会如此反感别人蒸馏自己。注意:“理解它们为什么反对”,不等于“支持它们反对蒸馏”,更不代表我认同它们对“什么算合理蒸馏、什么算不合理蒸馏”的定义。


蒸馏本身当然不是什么邪门技术,OpenAI自己就提供过官方的model distillation工作流,A\在自己的文章里也明确承认distillation是行业内很常见、很正常的训练方法。争议从来都不是“student向teacher学习”这件事本身。


真正有分歧的是:



  • teacher的输出怎么拿到?

  • 有没有违反服务条款?

  • 有没有把不知道自己正在参与这件事的真实用户也卷进来?


以及最核心的一点——竞争对手到底可以在多大程度上利用另一个公司的研发成果?


我自己理解OA为什么对这个事情这么敏感,主要还是因为现在做frontier model,最贵的可能已经不只是训练,而是探索。


可以很粗糙地把模型研发想成一张考试卷。



  • 从30分做到60分是一种成本。

  • 从60分做到90分是另一种成本。

  • 从90分做到100分,成本又高不止一个数量级。


但最麻烦的其实是已经做到100分以后,想办法找一道以前不存在的题,把能力做到101。

因为前面至少知道题目是什么,而到了最前沿以后,连下一步做什么都不一定知道。

你可能有十个看起来都非常合理的研究方向,每一个都需要大量人力物力和时间。

但最后事实证明前九个路子没用,真正发布出来的只有剩下那个。

外界看到的是最后那一个成功的方案,但公司真正花掉的钱,其实包括前面九次失败。


我觉得这才是理解“为什么前沿公司这么害怕蒸馏”的关键,如果别人能够观察你的最终模型,然后用大量query去拟合它,那么他节省的不只是几次训练的FLOPs,而是对方不用完整走一遍你走过的探索空间。


这也是我认为为什么R1问世就震撼了硅谷和华尔街:DS-R1-Zero用如此有限的算力证明了大规模RL本身可以诱导出很强的reasoning behavior,R1又展示了冷启、RL、SFT等环节如何组合,连强模型的reasoning能力可以有效蒸馏给小模型这件事都直接做了一遍,而且官方明确允许其他人继续拿R1做蒸馏


所以如果继续刚刚的分数比喻:R1最重要的影响之一,是让大量团队突然知道“30到60怎么走”了,而这正是之前OA一直想藏的事


以前大家连RL能不能稳定地产生这种reasoning、该怎么训、会出现什么现象,都要自己摸,后来至少知道这条路存在。在研究里,“知道一条路存在”和“不知道这条路到底存不存在”,完全是不同的难度。


这也解释了为什么OA非常反感别人蒸馏自己,而DKG把模型开源以后,又非常欢迎别人基于自己的东西继续训练。


如果我是frontier的最前面那家公司,我当然不愿意把这种探索成本免费变成竞争对手的监督信号。但如果我是追赶者,或者我想让自己的模型成为一个事实上的开源基础设施,那么事情正好反过来。


所以我个人不太喜欢把这个问题简单概括成“开源正义vs闭源邪恶”,或者反过来变成“蒸馏就是偷”。


商业公司首先还是在做符合自身位置的事情。


国模目前一个比较现实的约束仍然是顶级GPU算力。虽然CN在电力、数据中心建设、工程成本和庞大的墙内市场上有自己的条件,但这些都不能凭空替代高端芯片。


因此,在算力受限的环境下,想办法提高每一单位算力的研发效率,本身就特别重要。蒸馏、合成数据、RL、MoE、推理优化,本质上多少都有一点这个少花钱多做事的味道。


我觉得DKG这些公司的存在,对整个行业都是好事,只要它们能一直能追在后面,甚至偶尔某些能力反超,前沿闭源厂商就不可能完全无视价格、推理成本和开放程度。


站在用户角度,我其实挺希望这种状态维持得久一点。


至于蒸馏行为合不合规,路由方式是不是合适,会对普通用户带来什么影响,不是本帖讨论的内容


当然,蒸馏有效的前提还是自己本身得够硬。MiniMax就是一个很典型的例子,就算真的从更强模型那里学到了不少东西,如果自己的基座能力、后训练方法和奖励设计靠不住,最后也很难把这些稳定转化成真正的模型能力

最新回复 (16)
  • yu1745 09-12 15:35
    1

    觉得蒸馏能学到真东西的可以歇歇睡了,Anthropic这种檄文发过不止一次了,曾经被指责最多的不是阿里巴巴,而是MiniMax,不信的可以去搜Anthropic的上一篇檄文,然后MiniMax蒸馏了那么多,最后做了个什么出来,大家都清楚。

    一个大模型的长任务能力到底来自于什么?来自于它的后训练的奖励函数的设计。MiniMax的设计是有天大的问题的,它对于过程的奖励过弱,而对于结果的奖励过强,这就导致了它的模型在实际推理的时候,解决问题的时候,明明中间过程全是错的,它还是会强行给你结果,这就说明整个MiniMax这个公司,它不懂得如何进行后训练,也不懂得如何设计奖励函数。

    从这一点反过来看,智谱清言就是MiniMax相反的一面,为什么GLM是第一,因为它真的是第一个找到了长程任务的正确奖励函数的公司,他是什么时候找到的呢?他在今年的5月份就找到了。落后OpenAI和Anthropic半年,但是为时未晚,它仍然是国产模型中第一个找到的。

  • xiedian 09-12 15:36
    2

    A​^-^那么恨蒸馏,还那么喜欢宣传,也是为了宣传自己“都在蒸馏我,我才是最厉害的模型”,算力差距太大,不想落伍只能尽量蒸馏了,就是蒸馏的太慢了,gkd这三家在蒸馏上还是要搞快点,到时候给a​^-^蒸完,看他还说啥

  • yu1745 09-12 15:38
    3

    关于长任务和高度内聚的单任务的区别,你们可以去看TerminalBenchV4和DeepSWE,这是两个相反的极端。DeepSWE是高度内聚的,它会把你解决问题所需要的所有东西全部给你,在一个环境中全部提供。但是Terminal Bench是一个长程的、异步的,会遇到非常非常多问题,需要你去主动解决的,一旦你的注意力分散,那你就不可能得到高分。TerminalBenchV4的发布晚于GLM 5.3,晚了将近一个月,但是GLM 5.3仍然能在TerminalBench V4得到相当高的分数,这种能力是蒸馏蒸不来的。你去对比Deepseek V4.1 Flash和GLM 5.3,他们的TerminalBench V3的成绩是非常接近的,但是V4能拉开1/3。

  • LanFeng1 09-12 15:42
    4

    叠甲:不反驳其他所有观点,也不站队,也不当小粉红也不当黄香蕉,只做纯粹的论文探讨

    我感觉 R1 的最大贡献不是说明了在 Base Model 有一定的能力以及 RM 信号非常清晰的情况下直接进行 RL 可以低成本地放大这种能力么

  • Timoris 楼主 09-12 15:45
    5

    和我说的差不多一个意思,R1-Zero最重要的意义之一就是证明了Basemodel本身已经有一定推理能力、奖励又足够清晰时,直接RL就能把这种能力明显放大,不一定需要先靠大量人工CoT(我所说的30到60),不过低成本更准确地说是低人工监督成本,RL本身其实并不便宜

  • Bad_GuY 09-12 15:46
    6

    我希望DKG等国模越来越强,早日超过Astra和Fable,这对普通开发者和用户都好。



    为什么一定要超过?你追我赶对开发者跟普通人来讲才是比较好的状态,今天你家强明天我家比你的要强后天他家的又赶上来了,这样用户能有更多的选择而不是top1级别就只有那么一两家。争论来争论去在别的帖我看到的是就算拿出依据来也还是会被情绪裹挟的口水淹没,那么技术论坛原本以“讨论技术”作为核心的地方就逐渐很少有人认真跟你讨论“为什么”了^-^

  • hexinzhe 09-12 15:46
    7

    (帖子已被作者删除)

  • 夜长久 09-12 15:49
    8

    蒸馏能超过?蒸馏的本质就是把teacher模型的能力学个8成。

    我支持使劲蒸馏,能白嫖为啥自己创新,有钱留着弄算力不是更好。

  • Bad_GuY 09-12 15:51
    11

    只要它们能一直能追在后面,甚至偶尔某些能力反超,前沿闭源厂商就不可能完全无视价格、推理成本和开放程度。



    另外其实比较让我疑惑的是Google在开局时手头的一手好牌到后面打的稀烂不知道是发生了什么,从推特上看到的传闻来看就是团队内部不合。当初其实有些东西deepmind跟google brain团队在我看来蛮厉害的,结果现在的Gemini。。只能说太可惜,论web端的审美来讲其实我更喜欢Gemini的多于OA两家,而且flash价格不高,刚推出时性能表现也不拉胯

  • beautifulrem 09-12 15:52
    12

    首先,要是企业真的能蒸馏出来100%相似度的模型,那这模型就是这企业的,这本身就是一个从表面去逆向内部的过程,你根本就不知道隐藏层架构,更别说训练这个被蒸馏对象的企业自己恐怕也不知道这个黑盒内部怎么工作的。这种情况下你去说蒸馏没什么意义,如果真的靠吐出的结果就能把里面的权重调整好那这家公司技术已经可以训出来比你强十倍的模型了。蒸馏的过程本身就是技术的进一步探寻和发展,对模型的可解释性也能更好的探索,对蒸馏能力的提升本身就有助于对训练技术的提升,而不是单纯的就跟复制粘贴一样模型就啥都会了,很多企业不知道AI模型从何做起,蒸馏模型是一个很好的抓手,有着眼点往下做,A\很明显就是想锁死这步,让其他人都没得做而已,说实话你的模型要是有什么特别的架构,特别的设计的话,这些东西是能蒸馏出来的吗;而如果你只是让模型去不停吸收世界知识吸收的比别人都多的话,都是世界的知识,你当初学习的时候版权也不是你的,为什么不让从你这里获得呢?


    而且规模小一些的模型蒸馏超大模型效果是可以更好的,超大模型里面的权重必然有相当一部分是冗余的,信息是无效的,怎么把有效的信息提取出来无效的剔除掉也是一个有用方向。

  • Timoris 楼主 09-12 15:53
    13

    确实,像Minimax这样蒸馏只学答案的话那和DPO没什么区别,但蒸馏本身当然也可能蒸馏出可泛化策略

  • Timoris 楼主 09-12 15:55
    14

    蒸馏本来就不需要恢复teacher的架构或者原始权重,它要做的是让student在目标分布上尽量逼近teacher的行为。这个过程当然需要技术,但“需要技术”和“teacher帮你大幅缩小了探索空间”并不矛盾

  • beautifulrem 09-12 16:12
    15

    是这样,我只是觉得OA这些公司的反应不符合正常的反应,因为理论上底层架构,RL机制或深层算法通过蒸馏是学不走的。如果OA在惧怕只要靠外部生成数据就能被别人逼近90%的能力,那说明他们的护城河很大程度上也没那么牢靠。


    而只是说学习知识这块,OA也是在Wiki,书籍,代码仓这些已经很大程度上搭好的东西上学习的。不过国内算力确实也是问题,直接学习普遍规律肯定更快就是了。

  • undefined 09-12 16:21
    16

    实际用起来,

    glm53指令遵循度、指令理解力都是排在前面的,

    可能世界知识没那么全,有些时候会要去推理这些东西。

    gpt6这方面的确没的说,全还准,还听话。


    但a畜家模型是麻回事?为啥喜欢和用户杠呢

  • songbailu 09-12 16:58
    17

    不是,你从哪看到国内公司承认蒸馏了?

  • 神影丹仪的老公 09-12 17:13
    18

    大模型的核心到底在于什么?OA这些公司,真的知道大模型是怎么自己探索出智能的吗?真正有技术力的,并不是模型输出的答案。而是在他们没有公开的那些算法探索。

    对着答案蒸馏和对着厉害的原始数据学习,没有本质区别,只不过因为他们是头部,拥有更多数据来源。但这些一样是别人的劳动成果。

* 帖子来源Linux.do
返回