gpt-6 让大参数 coding 模型的趋势越来越明显

Owen01 2026-09-05 13:45 1

sora 的时候我预测了 gpt-6 会是继fable 之后的新一代大参数量的基座模型。


fable 开启了以 coding 能力为主的大参数基座模型的纪元,它的终极目标很明确,即让模型有自迭代的能力,最契合的就是 coding 能力。


其他家那个时候还处于刚刚使用 coding 优化的 chat 基座模型,所以我那个时候就预测 sora 是 5 系最后一代模型,真正意义上的 coding 模型是从 6 开始的,果不其然。


反推这个时间其实是最为恐怖的,3 个月下线一个大参数模型。。。。

所以我预测蒸馏会需要比之前更长时间,国产没有太多算力卡。而大参数 coding 代价就是消耗大量算力,从 fable 就可以看出来,当然 OpenAI 拥有更多算力会一定程度上减轻这个趋势。


现在的一个问题是:大基座模型的向下蒸馏到底在实际应用上会复现多少能力,我们都知道目前通过蒸馏就能很好训练出一个不错的牛马模型,但是 scale 放大一个量级,是否还一样奏效?


所以我很期待 2 个月后的国产厂商的节奏,毕竟OpenAI 蒸馏的阻力是比 fable 要小很多的,同样这类大基座模型国产是算力是不够负载的,所以为了更好的向上融资和上市,应该是直接开源来获得流量和名声。

最新回复 (3)
  • Aydenx 09-05 13:57
    1

    按照gpt的风格来看确实会比fable更容易蒸馏,但确实也是和贴主说的最终限制的还是卡和算力,目前来看差距貌似还变大了一些现在还没有国模能赶上几个月前的fable5吧,但是我估计快了毕竟astra出来了了^-^

  • Owen01 楼主 09-05 13:59
    2

    是的,所以想想 Claude 还有很多底牌没出…这个顶级模型训练时间压缩到 3 个月是很恐怖的,当然 OpenAI 算力很多也是巨大优势。

    接下来看看老马种子选手,毕竟拼到最后的底牌可能就是算力了

  • jerry wu 09-05 14:20
    3

    我记得当年英特尔和amd的cpu竞争,大家也都说英特尔仓库有无数的底牌,只是怕反垄断不敢放出来,后面大家知道了,他的牌就这么多。所谓仓库有n多牌,很多时候都是对现有领先者的高估。

* 帖子来源Linux.do
返回