论国模与O/A差距

基围虾 2026-10-04 17:29 1

国模与O/A的差距某种程度上是与ANY站的可用程度成反比的(玩笑之举)。有没有佬you深耕 强化学习后训练的,可以给解释下为何在SFT和cot的推理思维链时代,蒸馏没有作为国模追上O/A的主要手段。而在强化学习做后训练后,蒸馏这个词就被提及的这么频繁呢? 难道国内的基模团队不能自己从头搭建强化学习后训练 么? 国内的豆包好像就完全脱离 了这条路,但感觉还是没什么动静的样子 。 还是说大量的优质的数据都掌握在A\ O\ 这类公司的手里

最新回复 (6)
  • jinyu30 10-04 17:33
    1楼

    关键还是数据量,包括数量和质量。any站不是简单蒸馏,更准确的说是合成数据。


    看看OA的爬虫有多疯狂就知道了,而且OA外包了大量拉美非国家的数据标注员

  • 漱漱みこ 10-04 17:39
    2楼

    其实优质数据也确实都在OA和cursor这种公司里吧

    毕竟他们的订阅用户真的太多了>︿<

    国内的公司不会加起来也只够他们的零头吧(;´д`)ゞ

  • refalogy 10-04 17:54
    3楼

    oa的爬虫有什么报道或者案例吗?我没太听说过

  • ba lao 10-04 17:57
    4楼

    可以给解释下为何在 SFT 和 cot 的推理思维链时代,蒸馏没有作为国模追上 O/A 的主要手段。而在强化学习做后训练后,蒸馏这个词就被提及的这么频繁呢?



    就用我自己的实际上的训练而言。

    蒸馏不使用在sft上面的。

    反倒是用在RL上面的。

    因为SFT对模型是没有用处的,只有RL是有用处

  • 路人甲 10-04 17:59
    5楼

    只有a没有o 已经把o除名了 模型垃圾要死 还慢

  • refalogy 10-04 18:02
    6楼

    先说数据的问题,业界好像一般认为互联网上的公开数据已经用得差不多了(不过国模应该还没用完),真正高质量的数据需要自己造,比如让模型操作什么软件、写什么程序,这些任务得自己设计

    蒸馏可以获得的一是从强模型处拿到正确且高质量的答案,二是思维链,用来教弱模型如何思考,比如什么时候该反思,什么时候多尝试。这比人类专家标注数据节省很多成本

    还有软一点的蒸馏,比如做reward model

* 帖子来源Linux.do
返回