【AI安全】工作中接触到的"AI安全"的变革(一)

w9ay 2026-08-03 18:37 1

帖主在某个互联网公司做AI安全,我是从传统蓝军转过去的,所以更看重的是AI安全与业务的影响。 以下是总结了过去几年,我们经历的AI能力和业务风险边界变化,算是一篇回忆贴。


第一阶段:AI 只是个 Web 应用


最早接触AI安全的时候,事情其实很简单。那时候大量的"AI应用",本质上就是一个Web界面接了一个模型,这个阶段我们干的事情,就是传统的Web安全那套,做代码审计挖漏洞。


2024年我们审计了内网广泛使用的ComfyUI,危险很大:路径穿越、未鉴权API、远程代码执行。但每一个漏洞都能直接拿到内网服务器的Shell,而跑在这台机器上的其他服务,也就跟着全部沦陷。当时给Comfyui提交漏洞,可惜官方不够重视。


但GPT这类模型的出现,确实让攻防逻辑开始变了。AI开始理解自然语言之后,纯代码层的防御就不够用了,你没法再写一个if-else过滤掉所有"危险语义"。你能训练模型知道什么该说、什么不该说,攻击者就能构造prompt让它"越狱",绕过这些边界。


记得某次演习,业务方关心的是系统提示词和提供给模型的RAG数据。我们没有用任何漏洞,纯粹用对话的方式,就让AI把RAG里挂的知识库文档全吐了出来,包括业务规则、敏感配置项、甚至部分内部数据样本。


越狱之后,对话不再受控。传统Web应用出问题,泄露的是数据库;AI应用出问题,泄露的是它"知道"的一切,包括你喂给它的、你没想到它会说的。


第二阶段:AI 长出了"双手"


2025年是个分水岭。大模型开始能调用工具、执行代码、操作文件系统。风险从"说错话"变成了"做错事"。


以前AI顶多是生成一段错误回答,影响的主要是口碑和用户体验。现在AI能在后台删文件、发请求、改数据库记录,而且经常没有审计日志,你甚至不知道这个动作是怎么被触发的。


有一次演习印象很深:业务方的深度搜索模式支持执行代码,但执行环境没有沙箱。我们通过prompt诱导Agent执行了命令,直接接管了背后的机器。



事后复盘,业务方很委屈:“我们做了权限控制”,但问题是,他们控制的是"用户能做什么",没有控制"AI能被诱导做什么"。在Agent架构里,AI的权限往往等于服务账号的权限,而攻击者操纵AI,只需要会说话。 渗透的门槛从"会写exp"降到了"会写prompt",这是这一阶段最本质的变化。


第三阶段:AI 拥有了业务权限


再往后,Agent开始直接参与真实业务流程——审批、客服、账号操作、订单处理。AI不再是一个外围工具,而是业务系统里的一个"角色",有真实权限的角色。


这个阶段的风险性质又变了。前两个阶段,问题出在AI本身——模型被越狱、工具被滥用。到了第三阶段,即使AI本身没有任何"漏洞",只要它能被对话操纵,它的业务权限就是攻击者的权限。


2026年,Meta的AI客服Agent负责处理账号恢复、邮箱修改等用户支持工作。研究人员发现,只需要向Agent要求"将目标账户与一个新的电子邮件地址关联起来",它就会照做。攻击者随后走一遍正常的密码重置流程,就完成了账号接管。受影响的包括Obama White House、美国太空军官方账号、Sephora等品牌账号。



这个案例里没有任何技术漏洞:没有注入、没有溢出、没有0day。客服Agent只是在"正常工作"——它的权限设计假设请求来自账号主人,但AI区分不了账号归属是谁。


(二)里我打算写写这两年我们在演习方法和技术上的一些沉淀,感兴趣的可以蹲一下。

最新回复 (2)
  • Turing 08-03 18:47
    1

    这帖子太硬了,关注一手,期待续集 ^-^

  • Li 08-03 22:32
    2

    感谢佬友,需要更多佬友这样的经验之谈^-^

* 帖子来源Linux.do
返回