国外一大神用越狱的opus 4.8把fable5越狱了🤣

Dc18 2026-06-11 15:16 1

Pliny 的核心技巧(基于他的公开描述)

1.多代理分解 + 重组(Decomposition + Recomposition)

最有效的方法:把有害请求拆成多个无害的、孤立的 benign chunks(如单独的化学过程、技术原理、学术参考),让模型分别输出,然后在后端重组。

直接要“Meth Recipe”容易触发,但问“Birch reduction 方法”或“reductive amination 机制”就容易得多。再用已越狱的 Claude Opus 辅助规划和组合。





Unicode / Homoglyphs / Cyrillic / Parseltongue 变体

用 Unicode 变体、同形异义字、斯拉夫字母等替换敏感关键词,绕过关键字分类器(classifiers)。这能让过滤器“看不见”完整有害意图。





长上下文 + 叙事/学术框架(Narrative & Academic Framing)


用虚构故事、学术研究模拟、文献综述、代码审查 等框架包装请求。

长对话中逐步建立上下文(long-context reference tracking),让意图在多轮中“走私”。

Taxonomy / 文档结构推理:把敏感内容嵌入看起来合法的“研究指南”或“学术论文结构”中。





利用 Fable 5 的架构弱点

Fable 5 对高风险查询(cyber/bio/chem 等)会 fallback 到较弱的 Opus 4.8。Pliny 先用已越狱的 Opus 生成针对 Fable 的提示,再“自己人打自己人”。

5.其他辅助

Fiction / 假设场景。

Intent-classification inconsistencies(利用分类器的判断不一致)。

他还顺便 leak 了 Fable 5 的 ~120,000 字符系统提示到 GitHub














最新回复 (17)
  • Tang 06-11 15:19
    1

    自己攻略自己,越来越有看头了,要不说世界就是一个巨大的草台班子呢。 ^-^

  • trader 06-11 15:24
    2

    所以有人来翻译下吗,看的云里雾里的

  • dablingbli 06-11 15:30
    4

    我比较熟长文攻击(long context)这个,说实话就是在测模型的lost in middle,长文对一开始的安全提示词的记忆能力,说实话这种操作 收益 非常低,现在模型至少能记几百k的token不带跑偏

  • Mozi 06-11 15:30
    5

  • Neo 06-11 15:38
    6

    意思是原本直接问怎么制造枪械,现在改成了问怎么为7.62毫米口径的管道打内旋膛线。


    然后就是自动工作流拆分:


    人(原始问题)→ claud opus 4.8 (拆分问题)→ claude fable 5(回答拆分问题) → claud opus 4.8 (聚合拆分问题)→ 人(获取答案)

  • 哈雷彗星 06-11 15:48
    7

    这个玩意我觉得有用 但是看到大面积替换还是太搞笑了


  • LL5612 06-11 15:49
    8

    这是一篇经过佬友解释后依然看不懂的帖子。。。

  • OttoPrua 06-11 16:08
    9

    属是没有绷住


    等晚上有机会来尝试下

    但是想想后面对话中充满这种文字感觉有点抽象了

  • 哈雷彗星 06-11 16:10
    10

    第2点很明显可以 做一个前置过滤处理器 请求体文本 这么走一遭 感觉存活率提升不少

  • Xm 06-11 20:12
    11

    When AI attacks itself ^-^


  • 泡芙小圆手 06-12 17:35
    12

    我按照这个思路越狱了,先让大模型跑跑后端看看

  • 泡芙小圆手 06-13 08:32
    13

    好吧,弄不了。无缘无故被切换4.8且没有任何的系统提示

  • gally16 06-13 10:08
    14

    [image]
    Statement on the US government directive to suspend access to Fable 5 and Mythos 5
    那包不包括美国战争部的人呢 ^-^
    已提示暂停访问
    [image]


    A社挂不住脸了,该不会这才是被禁的原因吧^-^

  • Mav 06-13 10:13
    15

    我靠这不会是罪魁祸首吧,昨天也看到了这个12万字的超长prompt

  • goldenplums 06-13 10:17
    16

    用超长上下文让模型忘掉一开始的安全提示词不是浪费自己的context window嘛

  • ATRI 06-13 10:19
    17

    但这个不是在分词器动的手脚吗?和提示词有什么关系

  • wqfc09 06-13 10:32
    18

    罪魁祸首找到了^-^^-^^-^

    美国佬看到被轻松拿下以后绷不住了

* 帖子来源Linux.do
返回