Anthoropic:检测与反制人工智能滥用:2026年9月

🐟 2026-09-11 01:28 1



在过去八个月里,我们的威胁情报团队识别并破坏了威胁行为者试图利用 Claude 进行恶意活动的行动。在本报告中,我们分享了这些行动的案例研究,并描述了自 2025 年 3 月、8 月和 11 月的威胁报告以来,Claude 恶意使用的演变情况。在每一个案例中,我们都破坏了相关活动,利用所学加强了我们的保障措施,并在适当情况下与当局和行业合作伙伴分享情报。


本报告涵盖了我们在 2025 年 12 月至 2026 年 8 月间所干扰的七个危害领域活动:网络行动、影响行动、监控、诈骗与欺诈、生物滥用、常规武器开发和蒸馏。采用了 Claude 和作品的范本。除一起非法蒸馏案例外,其他滥用案件均未涉及使用 Claude Fable 或 Mythos 级模型。


我们在这里分享的案例并非典型的滥用,而是迄今为止我们识别出的最显著且新颖的威胁活动实例。我们发布这项工作,是因为我们相信有责任披露对我们服务的恶意滥用。随着模型能力的提升,除非 AI 开发者和社会捍卫者采取行动让它们更安全,否则它们的风险将会增加。


本报告涵盖的威胁行为者包括疑似国家支持的团体、经济动机犯罪分子、商业间谍软件供应商、国家宣传机构以及政治动机个人。案件涵盖了从一系列旨在欺骗用户的假约会应用,到用于识别和监控异见人士的监控系统。


复杂且持续存在的威胁行为者不断测试我们的防护措施,试图绕过我们用来检测和防止滥用的技术措施。我们将继续完善防护措施,并与合作伙伴协调,提升检测、干扰和防止未来滥用的能力。


我们希望本报告的发现能帮助其他开发者识别自身平台上的类似模式,让政府和民间社会更清晰地了解新兴威胁的形成过程,并加强集体防御。




https://x.com/AnthropicAI/status/2098097512544444447

最新回复 (13)
  • 🐟 楼主 09-11 01:29
    1
  • diff 09-11 01:37
    2

    这报告也太长了,还是让A/自己总结一下吧

  • 小猫曦月 09-11 01:42
    3




    让GPT总结后,最感兴趣的两部分截出来了


    话说真有人拿A\模型搞军事武器开发啊 ^-^

  • Kirafishy 09-11 01:45
    4

    ^-^感觉这报告出来了有人要倒霉了,居然用外国模型做这些

  • 小猫曦月 09-11 01:47
    5

    难绷的是有的人用国内模型搞敏感项目结果被路由到claude ^-^

  • 火凤凰 09-11 01:48
    6

    any是minimax的吗

  • Kirafishy 09-11 01:49
    7

    你别说,你还真别说 ^-^ 不过这种敏感项目居然不用官方API

  • mps 09-11 01:54
    8

    还真有可能,按这个报告的角度来看的话,哈哈哈

  • Szou 09-11 01:57
    9

    也门用a社模型开发火箭并真实发射了?

  • neteroster 09-11 01:58
    10

    虽然我也知道互联网没有什么记忆,但是,当时路由论的反方选手,我还是很好奇他们是怎么想的(),虽然那时候的帖子都快被删光了


    原文:



    我们的调查表明,DeepSeek 也部署了类似于 Moonshot 的策略。DeepSeek 构建了一个思维链(CoT)提取管道,依赖于上述相同的跨会话重放攻击。DeepSeek 还在未通知其客户的情况下,悄悄地将交互数据中继转发给 Claude。与 GTG-16002 类似,他们的客户很可能并未意识到他们的请求正被输送给 Claude。




    我们的调查显示,DeepSeek 针对 Opus 的推理痕迹,利用了与 Moonshot 类似的技术。通过使用推理签名,DeepSeek 使用了与 Moonshot 相同的跨会话重放攻击来提取 CoT(思维链)文本记录,并规避了我们的技术控制。DeepSeek 利用这种技术窃取了原本会被总结的推理痕迹。




    DeepSeek 对那些试图通过第三方或 Anthropic 编码工具(如 Claude Code、Claude Agent SDK 或 OpenCode)使用 DeepSeek 模型的用户请求进行了重新路由。DeepSeek 检查了入站请求中包含的各种字符串,并标记了使用这些第三方工具的用户。随后,选定的被标记用户的请求被中继转发给了 Claude Opus。这些敏感数据很可能在 DeepSeek 客户不知情或未经同意的情况下被路由到了 Anthropic。


  • monoe 09-11 01:58
    11

    1.5亿次,比下面这几公司全加起来蒸的次数还多 ^-^(实际多少还不好说)

  • 中国人会飞 09-11 01:59
    12

    有两种可能,一个是api本身也被路由了,比如之前的梁文峰谷二象性事件

    第二个可能是用不起api的穷苦牛马使用了中转站 ^-^ ^-^

  • LLMeme 09-11 02:00
    13

    个人感觉比较值得关注的点:



    1. 明确地指出了中转站:





    1. 宣称不同国内企业可能合用了同一家服务:




    2. 宣称 Moonshot 大发善心让用户免费体验 Claude






    1. 控告国内蒸馏不稀奇,但这次可能更有杀伤力,因为控告把国内敏感信息传到国外:




    1. 宣称 DeepSeek 也干了(似乎呼应了之前的传言)




    1. 暗戳戳指出隔壁家防蒸馏能力不行




    1. 宣称小米试用期就是在收集用于蒸馏的数据


* 帖子来源Linux.do
返回