seedance ai 的强大在一定程度上證明了 “數據質量” 在訓練llm 中的重要性。

老王 2026-10-05 21:23 1

seedance 视频ai 唯一真神,而且是国产的。 为什么会这样。


1) 高质量的视频,电影基本都是公开的, 这种数据国外国内基本是相同的,不存在说某些高质量的电影,电视剧只有国外有,国内没有。 (这里面有个隐藏的数字化的问题,就是很久以前的美国胶片电影,基本都做了数字化,也是可以看的。如果没有数字化,是胶片,那么seedance 拿不到。)


2) 抖音\tiktok 是视频社交软件唯一真神。 大量的视频都直接放在抖音服务器上。 抖音还有一个剪辑视频的 剪印,及大概率人类剪辑过程的是数据,抖音也有。


前面一个是经典\高质量视频数据 ,后面一个是当前最流行的视频社交软件上的视频\剪辑数据。 抖音有了这两个数据,尤其是后者的海量数据 (其中后者还包含好多年前视频ai 没有出现的时候, 一些真人创作者做的经典视频20分钟精华讲解,把最精彩最能抓人的部分给人工抓到) ,抖音就作出了当前最强的视频AI 。


GPT , anthopic 之类的强大, 其中一个原因就是数据质量高。 尤其是英文经典书,很多都没有扫描版, 他们自己做书的数字化。 中国本来就是中文书的质量不如英文的,然后大概率很多经典英文书,国内都没有,你除非去国外找机构扫描取得。我估计国外会 禁止。 你只能拿欧美ai 的 数据做二手学习。


再加上现在codex 和claude 编程无比强大, 顶级的编程难题,肯定给codex 和claude 试试。 尤其中国程序员,也是一样,codex 之类的做的不好,程序员还会反馈哪里做错了。 这些行为就是强者越强的一个强化飞轮。 如果仅仅是在后期加强, 包括但是不限于 : 更强大的 学习 openai 和anthropic 的数据,叫什么筛选?(专业的那个词我突然忘了,就是anthropic经常指责中国ai 的) , 还有更加厉害 或者更加创新的 ai公司对LLM 进行编程进化,比如deepseek发明的,被openai 认可的那个。 这些都不足以弥补数据源头的差距。


就类似于百度 ,garbage in garbage out 。 你不尝试在源头数据上 加强, 很可能到头来,尽头就是 无限缩小和 openai ,anthropic 的差距。 而不是超过。

最新回复 (7)
  • 114yiyis 10-05 21:29
    1楼

    那我就要说说google了,坐拥youtube和Google爬虫,到现在还拉不出一坨大的


    meta坐拥facebook和ins,这些都是海量的图片,它家的生图ai还没怎么听说

  • (๑;ᴗ ;)ﻭ 10-05 21:48
    2楼

    它家的生图ai



    在想会不会自家工程师其实已经做出来,天天生成Ins美图自己观赏忘记发布了

  • ArcherFD 10-05 21:51
    3楼

    他们组织架构什么的可能有问题吧,,之前llama都烂尾了。字节的Seed本身人才就很强的,人才算力数据三个都齐了。而且生图好像大家都不是很重视,怀疑不盈利

  • jemychen 10-05 22:04
    4楼

    傻傻的我还分辨不出来

  • Light 10-05 22:13
    5楼

    可是…seedance应该不是llm

  • neteroster 10-05 22:18
    6楼

    老生常谈的问题了,机器学习深度学习数据就是很重要,甚至可以说是决定性因素,当然不只原始数据,还有数据增强和合成数据管线之类的东西

  • Qukiaa 10-05 22:20
    7楼

    本来就是数据最重要 ^-^但是说出来没品味,所以科研上大家都用别的地方改进包装一下

* 帖子来源Linux.do
返回