关于蒸馏,刷到X上一个英语区用户的观点,可是说到我心坎上了

runner dhero 2026-10-04 18:43 1


稍微精翻了一下,如下


OpenAI 和 Anthropic 居然他妈还有脸抱怨别人搞“模型蒸馏”。


人类花了几十年写代码、解释科学知识、回答问题,把自己知道的东西分享出来。AI 公司拿这些人类成果去训练模型,然后建立起一门生意,再把训练出来的东西卖回给我们。


他们他妈把我们所有人都“蒸馏”了一遍。


现在呢?有人花钱调用他们的 API,再拿模型给出的回答去训练一个竞争模型。突然之间,这就成了要封号、要发报告警告大家的所谓“蒸馏攻击”。


OpenAI 自己甚至就提供模型蒸馏的工作流。他们会帮你在自己的平台上,用大模型生成的回答去训练一个更小的模型。


但如果你拿这些回答去做一个跟他们竞争的模型,那你就“违反规定”了。


他们的条款甚至还写着:模型输出归我所有。


我付了钱,按他们自己的说法,这些输出也是我的——但最后他们还是要决定,我能拿这些属于我的输出去训练什么模型、不能训练什么模型。


你们花了这么多年为“机器有权学习别人的作品”这件事辩护。


那现在轮到机器学习你们自己的作品了,就继续坚持你们那套说法啊。


这就是为什么我支持中国的 AI 实验室发布可以直接下载的模型权重——我可以自己下载、自己运行、自己在它上面继续开发。


至于你们?


滚你妈的。


最新回复 (16)
  • jaydenmirror 10-04 18:46
    1楼

    赞同

    模型的输出应该归全人类所有 得到输出数据的用户有权利任意支配

  • 时牧 10-04 18:46
    2楼

    有人把明明大家都知道的事拿出来说,说得好像揭了什么天机似的… 这还用你讲?

    去年l站说到蒸馏,底下还都是在科普这技术原理的,以调侃为主,因为都知道业内都很普遍在用,天下乌鸦一般黑,根本不会真去在意这些

    结果今年也不知道是咋了


    前段时间我还在某个帖子下玩过馆长那个梗

    台上在说“我有两颗x丸”

    底下的同类们全部欣喜若狂“哦他说出来了,他有两颗x丸”“天呐,他太勇敢了”

  • HitC 10-04 18:48
    3楼

    原则上者是不一样的

    毕竟人家服务条款明确说不能用来蒸馏,注册就意味着同意这个合同。你去蒸馏了就是违反合同,属于违约。不能接受可以不注册人家的账号

    但是人家用人类的知识去训练,并不违约。这些知识是全人类共有的

  • refalogy 10-04 18:51
    4楼

    反正我是没想过那么多,能让我用上便宜好用国模的蒸馏就是好蒸馏^-^

  • 时牧 10-04 18:51
    5楼

    请举出你遵守openai和antigravity用户条例的例子,我就很坦然,我不是什么好人,因为我伪造过学生身份去骗取google的学生pro,还用假资料注册过海外金融账户,还到处薅别人用来给新用户赠送的福利

    所以我不会去用过高的道德绑架别人

    当你为了自己的私欲,用道德去绑架别人的时候,我就知道你也不是

  • chnaxoeng 10-04 18:52
    6楼

    说实话我已经厌烦了蒸馏相关的讨论了,差不多v3那会我妈妈还会问我那到底是不是ds“抄袭”了别人,我还会说蒸馏也是分黑盒蒸馏白盒蒸馏,而黑盒蒸馏进行数据合成是业内统一做法(当然闭源模型生成不了softlabel,所以就没有办法进行白盒蒸馏)

    现在一个是这个没有意义的讨论已经进行了太久了,另一个讨论这个话题的时候基本都只是在单纯的吵架,包括前段时间有个ds灰测是否路由了的争执,b站有个被很多人支持的论据视频,我点进去那个人居然连glitch token和预处理都分不清,真的就很无奈,基本上没什么所谓的“技术讨论”,大家都只是要吵架而已

  • Eika 10-04 18:53
    7楼

    也没什么好说的,只能说支持开源,支持国模。

  • mark 10-04 18:56
    8楼

    便宜利我的模型就是好模型,管你怎么来的 ^-^

  • sssssasdf 10-04 18:56
    9楼

    不一样,你购买的到底是什么服务?

    实际上没有任何人任何机构阻止你去搜集全人类语料并训练模型

    而这两家虽然不干好事,但是针对反蒸馏来说,这是他们提供服务的合理范畴限缩。对应现实其他行业来说,就是你能不能转卖、能不能再分发

    你要是自己做项目,你自己想想能不能接受别人拿你的项目去训练蒸馏?

    仅仅针对反蒸馏我觉得是合理的商业需求

    但是,这两家要是说没有蒸馏过别人我是完全不信的 ^-^

  • Megasoft 10-04 19:01
    10楼

    因为O\、A\最近又在发报告点名指责蒸馏了

  • Megasoft 10-04 19:02
    11楼

    实际上没有任何人任何机构阻止你去搜集全人类语料并训练模型



    其实还是有的,O A 都有版权官司哈哈

  • xqyqx 10-04 19:04
    12楼

    黑盒蒸馏就是拿模型输入输出构建数据集然后丢给自己模型训练,但是O/A两家非法获取数据集吃的官司还少吗,他立的规则是规则,实际上他也没办法完全阻止

  • MystDove 10-04 19:06
    13楼

    反过来说,知识付费,o和a用了多少effort和力气,买书扫描获取语料训练…reddit都能成靠卖数据赚钱的论坛了

  • mou wang 10-04 19:06
    14楼

    那些说"不一样" 你使用他们的服务就同意了他们的条款, 你也可以蒸馏全人类的知识。 我请 OAI和A/ 训练模型的数据来源都是合法的吗?经过别人允许了吗,无论是博客还是书籍 , 他们的模型用书籍上的知识来回答问题 有版权吗, 版权清晰吗? 他们的数据来源没有一个是合法的, 即使版权方卖给他们,也不能代表作者的本意,版权包不包含允许训练 这个从来都没明确过, 别再讨论蒸馏了

  • liu168 10-04 19:41
    15楼

    说的好!要按他的逻辑,要合规要合约,我们都不能用外国模型了。

  • Elon1 10-04 19:43
    16楼

    人类花了几十年写代码、解释科学知识、回答问题,把自己知道的东西分享出来。AI 公司拿这些人类成果去训练模型,然后建立起一门生意,再把训练出来的东西卖回给我们



    我想说:贼寇贼寇都是zcode(bushi

* 帖子来源Linux.do
返回