比如ChatGPT、Gemini这些模型,都有是否允许将用户数据作为模型的训练数据,这些都是可开启关闭的。 像一些国内的模型,千问、豆包、DeepSeek,貌似都没有这种选项。
大家发表一下看法。
不用用户数据训练模型,你说人家的AI投毒是怎么做到的?
@valley #1 不好判断
如果他不会训练用户的数据,那就类似于词库污染这种,我更倾向于用脚本大批量的做 Youtube视频 垃圾网站,我感觉这样,AI回复的时候更容易命中这些污染过的内容。
但我觉得国内这些模型也都会将用户数据当做训练数据,用户给一些垃圾内容,就被投毒了。 但但是,话又说回来了,AI训练数据,不可能把用户所有数据都毫无保留的交给模型训练,它要做的肯定会数据清洗,这时候就涉及到一个隐私数据,可能会把私密的数据给隔离掉,这样模型训练数据其实就没有很危险的数据了。