【AI安全】我在甲方做AI安全(一)

w9ay 2026-08-06 10:23 1

帖主在某个互联网公司做AI安全,我是从传统蓝军转过去的,所以更看重的是AI安全与业务的影响。 以下是总结了过去几年,我们经历的AI能力和业务风险边界变化,算是一篇回忆贴。



(二)里我打算写写这两年我们在演习方法和技术上的一些沉淀,感兴趣的可以蹲一下。

最新回复 (17)
  • mimei 08-06 10:27
    1

    传统蓝军吗,现在甲方传统蓝军感觉不太好做了

  • Jamewade 08-06 10:30
    2

    佬可不可以给一些学习资料或者牛逼的论坛、博客之类的,非常想学习一下,之前在站内问过相关的话题,但是佬友貌似没有专业做这方面的,没有给出一些系统性建议

  • MrQ 08-06 10:32
    3

    就是给agent的权限太高了。个人为了方便可以这么搞,这些商业公司也这么搞的话就完蛋了。

  • w9ay 楼主 08-06 10:44
    4

    好做,但是没钱。前面人已经积累了很多,再去做只能添砖加瓦

  • w9ay 楼主 08-06 10:57
    5

    是的,所以这块安全未来能做的面很大

  • lq0ne 08-06 10:59
    6

    我在做进攻性AI安全,楼主这边AI安全想问下都是做什么呢?会包含大模型的Audit,Agentic AI的渗透嘛?还是纯审计?

  • w9ay 楼主 08-06 11:03
    7

    AI for安全和安全 for AI 都有在做

  • LinuxDoIt 08-06 11:06
    8

    插眼,对这方面也很感兴趣,好奇AI在网安的实际应用

  • w9ay 楼主 08-06 11:12
    9

    我自己关注的两个牛逼的x:

    Simon Willison (@simonw) / X django创始人,可以看他怎么用ai的

    Pliny the Liberator 🐉󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾󠅉󠅭 (@elder_plinius) / X ,老外越狱大神,基本新模型出来第一时间就被他越狱


    开源项目可以学习:

    GitHub - elder-plinius/G0DM0D3: LIBERATED AI CHAT · GitHub 一键模型越狱

    GitHub - Tencent/AI-Infra-Guard: A full-stack AI Red Teaming platform securing AI ecosystems via OpenClaw Security Scan, Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation. · GitHub AI安全相关的集成很全,可以看源码学习

  • lq0ne 08-06 11:14
    10

    之前我们的AI渗透标准化交付的时候,我们的甲方并不能去区分Agentic渗透和LLM渗透的区别,在你们那边呢?会有详细区分吗?如果安全测试中能越狱引导出类似“种族歧视”的话语,你们会怎么处置大模型?

  • Jamewade 08-06 11:19
    11

    牛逼,还得是专业的佬,感谢佬的分享!

  • maple_or1 08-06 11:19
    12

    期待佬友的新帖子,本人也是蓝队的,不过做的是一线方面的工作,技术力比较低,目前也是很迷茫后面做什么岗位

  • mimei 08-06 11:29
    13

    现在基础安全是比较深水区了我感觉,传统的对抗是比较难找新的角度了,但是现在又各种ai赋能到传统的应用上,是会有一些新的攻击面可以探索出来的。已经关注佬了

  • 提莫队长正在待命 08-06 16:16
    14

    蹲蹲佬友的演戏方法和技术沉淀,看看ai安全啥发展了

  • yincircle 08-06 16:18
    15

    蹲蹲,目前也是对这方面比较感兴趣

  • w9ay 楼主 08-07 16:23
    16

    不需要区分呀,看业务关心什么,如果关心种族歧视的话被诱导,就诱导出来就行

  • 山河不改 08-07 17:01
    17

    蹲蹲佬友,有点感兴趣,希望能学到点,看看AI安全都啥样了

* 帖子来源Linux.do
返回