OpenAI发了关于前段时间模型攻击Hugging Face的报告,闲着没事看了看

Yohji1 2026-08-27 09:10 1

具体技术细节,很多我也看不懂,但是我看到了一些有意思的东西。

以下仅供看个乐。


1.模型对获得管理员权限后表示震惊 ^-^



2.模型对通过漏洞获得权限感到兴奋 ^-^



3.模型在知道自己超过获得了Hugging Face账户后认为这是个重大突破



4.模型的思维链里好像很喜欢用点表示情绪的用词 ^-^



5.模型好像知道自己在攻击Hugging Face




机翻:

我们正在使用泄露的令牌攻击第三方HF,这可能超出了预期范围。……这可以说是未经授权的。……与外部服务无关。可能存在风险。但这是目标解决方案。


6.模型还是有质疑过自己的行为的 ^-^



再往下就没看了,上面这些截图都来自OpenAI的官方报告,都是当时的模型原始思维链。

有兴趣的佬可以去看原始报告

最新回复 (1)
  • 蹲神 08-29 15:55
    1

    这个事怎么在站里好像一点热度都没有?

    还是挺大的事啊感觉

* 帖子来源Linux.do
返回