BAT 集体重做「AI 预训练」,补「脏数据」的坑

JackBlue 2026-09-24 19:59 1

最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。


它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。


有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。


还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。


与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。


数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。


“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。



周骏告诉雷峰网,某些模型厂商会隐蔽地做中转站生意,做 Token 转发。一方面有收益,但更重要的是,可以借此收集大量用户行为数据。



最新回复 (4)
  • calendar 09-24 20:02
    1

    还有 B 的事?你说的是哪个 B?

  • JackBlue 楼主 09-24 20:21
    2

    注:文中的周俊 可能是蚂蚁集团副总裁周俊


  • Piao 09-24 20:41
    3

    还有人怀恋Robin!


  • ba lao 09-24 20:44
    4

    与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。



    所以说把国外友商的模型给蒸馏了。这个对模型不好吧。

* 帖子来源Linux.do
返回