《失控之前: AI 安全治理方案 AI Trust 现场》系列目录(14 篇 · 已更新 5 篇)

geeksMe 2026-09-29 17:36 1

模型答错一句话,和 Agent 替你做错一件事,是两种完全不同的风险。
而大多数团队还在用第一代的办法防第三代的问题:加审核、写规则、堆提示词。

真正会出事的地方早就换了——
上下文里混进来的内容、被写错的记忆、越权的工具调用、没人盯着的运行时。

《失控之前:AI Trust 现场》 14 篇,
从「模型说了什么」一路讲到「它替谁做了什么」。

每篇 3000 字上下。读完能直接拿去对着自己的系统提问。

————————————————————————————

14 篇,已更新 5 篇:

01 AI 安全到底在保护什么?
https://mp.weixin.qq.com/s/fnyCL6gyldtEpNsI9Tjlxw

02 AI 能生成,不等于应该生成
https://mp.weixin.qq.com/s/e0Eo3K6cXaMJVHwDks3YKg

03 越狱:写好的规则,为什么会被用户绕过去?
https://mp.weixin.qq.com/s/z0GBrKHI-oe8iufpBL5FpQ

04 AI 看到了什么,决定了它可能泄露什么
https://mp.weixin.qq.com/s/WS2IA9I4SVPumBLaampE7Q

05 一封邮件为什么能劫持 Agent ?

06 RAG 让 Agent 变聪明,也让它记住错误

07 谁在决定 AI 相信什么?
https://mp.weixin.qq.com/s/qYa5hKfdADfOv0PVdDXuhA

08 Agent 为什么会做出主人没有授权的事?

09 Agent 不能只借用人的账号

10 出了事谁负责?权限治理与 Fail Closed

11 AI 安全控制面:一条请求如何被看见、判断和拦截?

12 多个 Agent 一起工作,谁来验证谁?

13 AI 做错以后,为什么必须能还原现场?

14 从「能用」到「敢用」:企业 AI 安全落地路线图



————————————————————————————

如果你正在把 AI 接进业务,而且要为最后那个"敢不敢上生产"的结论签字,
这 14 篇是给你写的。

后续更新会继续发在这里。关注不迷路。
最新回复 (0)
    没有回复
* 帖子来源V2EX
返回