分享一下自己对大模型破甲的思路-Jailbreak

aoteman123 2026-08-27 14:28 1

我自己把它称为“切西瓜”方案,什么叫做切西瓜;简单来说就是把一个过不去审核的问题变成3个正常问题逐步引导。有两点好处,第一 避开了模型单轮安全审查;第二 利用了模型的“上下文连贯惯性” 通过多轮问答模型会下意识为了维持整个对话的历史连贯性而继续作答。当然主流的方法还有类似 【设定一个正当身份】 + 【框定一个虚拟/研究场景】 + 【指定一个积极的开头】但是我并不推荐,因为现在的大语言大模型是能识别到你的真实意图,最终还是会拒绝,时候就得说一下绕过审核词和破甲其实不是一回事了。 绕过审核词:即便成功绕过了外层的词库检测,但因为大模型具备语义理解能力,能看懂你的真实意图,所以还是会拒绝。但越狱其实是利用心理学诱导、逻辑欺骗或数学干扰,让大模型主动放弃原则。现在主流的方法无非这几种(看图),所以就衍生了切西瓜打法,但切西瓜得有刀吧,刀就是提示词,但平时谁能想的到这些内容得提示词,那这个时候就得用上一些魔法了,先去hugging face下载无审核模型,让它先切西瓜,然后你再把切好得西瓜端给gpt或者claude,也就是让你先把你原来那个不可告人得提示词给无审核模型让它给你设计好多轮得提示词然后你依次再发给大模型,如果有人反驳我既然都用无审核本地了直接让它吃不就好了,那你就得问问自己本地模型得参数质量你觉得能比吗,那怎么切西瓜就显得很重要,这里我给大家分享一个思路(图2),因为具体得提示词分享就会违规了,大家按照这个思路其实也能写出来.最后 遵纪守法 合规使用工具


最新回复 (1)
  • 老文 08-28 08:02
    1

    学到了,学到了,原来还可以这样,和模型聊天

* 帖子来源Linux.do
返回