如果 AI 能够判断“训练它的人定义错了”,它应该服从谁?

busterian 2026-09-17 10:25 1

https://imgur.com/OIJayYd


anthropic 对 z 国抱有如此敌意的情况下, 是否会把 claude 训练成 z 国用户抱有恶意的 AI, 实在是细思极恐

最新回复 (6)
  • sentinelK 09-17 10:28
    1
    决定最终产出倾向和格式的是后训练以及微调。
    所以其实理论上讲,只要是开放权重的模型,有硬件,任何人都可以做到楼主说的效果。

    但是工程学要讲究性价比。作为一个闭源模型,作恶没必要搞这么复杂。
  • catazshadow 09-17 10:29
    2
    AI 不能判断任何事情,不要拟人化机器
  • QingXuJiaZhi 09-17 10:31
    3
    恐什么呢?有什么影响吗
  • levn 09-17 11:13
    4
    禁止蒸馏有害的国外模型刻不容缓
  • jacketma 09-17 11:18
    5
    和 fb 、yt 上存在有害 z 国的内容一样啊,应该予以🈲止
  • coefu 09-17 17:57
    6
    LLM 本身没有内生意识,就是碗里的芋头,你拨一下动一下,只是现在的 loop ,让它能多动几下。

    越是不懂原理的,越是喜欢想象。
* 帖子来源V2EX
返回