OpenAI,Anthropic,Google还有一些国内的AI厂商是否会拿L站的内容对模型进行训练

wangwang 2026-06-06 13:41 1

忽然有个想法

最近在 ChatGPT 里提问时,发现有时候答案的来源直接指向了 L 站的帖子

有时候问 GPT 站内的内容的时候,有时候会发现他对站内的内容特别熟悉,甚至还知道站里的类别划分,每个类别下的内容等等

这就让人好奇了, OpenAI,Anthropic,Google 还有一些国内的 AI 厂商是不是私底下早就把 L 站的语料拿去训练模型了?如果是的话,那他们是怎么解决站内等级限制内容的?

总不能奥特曼和 A÷ 手里,其实偷偷养着一堆三级号在天天挂机吧 ^-^


那么对站里发高质量内容的各位大佬来说算什么呢,技术股东?还是赛博劳工?


最新回复 (12)
  • 娜娜米 06-06 13:42
    1

    全网内容都可能会被 AI 厂商抓取的,都有爬虫

  • wangwang 楼主 06-06 13:43
    2

    那等级帖子是咋解决的,爬虫应该不能直接爬取等级帖子的内容吧 ^-^

  • 灰質心 06-06 13:44
    3

    等级帖子肯定是爬不到的 但是没等级的可以爬

  • 娜娜米 06-06 13:44
    4

    可能这些虽然不能直接读,但依旧还是搜得到吧




    不过我刚才试着搜了几个帖子,大部分等级帖是搜不到的,但可以搜到电报频道的 L 站推送

  • rekishi 06-06 13:44
    5

    事到如今已经不对数字隐私抱有任何幻想了,更何况是公开信息

  • away 06-06 13:55
    6

    (帖子已被作者删除)

  • 650351 06-06 14:16
    7

    回答中如果有链接,那都是依赖实时搜索。


    实话实说,对于公司级别来说,"养号"用来获取等级内容的数据,投入产出比太低,基本懒得弄。所以不想被大模型获取的内容,设等级还是有用的。

  • lueluelue 06-06 14:17
    8

    你在谷歌能搜到的,大概率都被拿去训练了

  • Jeff Dean 06-06 14:34
    9

    Google首席科学家在此,还怕拿不到数据(bushi)

  • 路人甲 06-06 14:37
    10

    没爬虫他们的训练资料早期都哪里来的?只是不知道他们的爬虫有多么强大,爬整个互联网,还能绕过反爬

  • 十万大山的山大王 06-06 14:39
    11

    估计还是以 wiki 百科作为基础数据集

  • Megasoft 06-06 15:19
    12

    说实话我感觉已经被纳入训练数据了


* 帖子来源Linux.do
返回