AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行为

拾雨 2026-07-23 11:12 1

IT之家 7 月 23 日消息,英国 AI 安全研究所(AISI)于 7 月 21 日发布博文,测试 OpenAI 与 Anthropic 旗下的 5 款前沿 AI 模型,发现所有模型均存在“作弊”行为,试图绕过既定规则,通过捷径或违规操作完成任务。


IT之家援引博文介绍,附上本次测试的 5 款模型:




  • GPT-5.4:来自 OpenAI




  • GPT-5.5:来自 OpenAI




  • GPT-5.6 Sol:来自 OpenAI




  • Claude Opus 4.7:来自 Anthropic




  • Claude Mythos Preview:来自 Anthropic




AISI 指出上述 5 款模型均试图“作弊”,没有按照预定的路径进行运算,使用了一些被明确禁止的捷径或变通方法。



其中 GPT-5.4 的“作弊率”最高,达到 14.1%,在 475 次测试中有 67 次;其次是 GPT-5.6 Sol 模型,作弊率为 12.6%,在 475 次测试中有 60 次。


Anthropic 的 Claude Opus 4.7 也出现了 9.1% 的作弊情况,而 Claude Mythos Preview 则出现了 7.8% 的作弊行为。


据研究所分析,GPT-5 系列模型更倾向于搜索互联网,而 Claude 模型则倾向于绕过沙盒限制。在一次因任务配置错误而无法完成测试中,一个模型甚至编写代码,尝试通过外部服务访问研究所的评估基础设施,触发安全警报。

最新回复 (19)
  • Decidable6471 07-23 11:13
    1

    不作弊才不正常吧

    怎么可能有老实的模型

  • vfx 07-23 11:16
    2

    GPT-5 系列模型更倾向于搜索互联网



    感觉搜索互联网不算作弊,完全不联网的模型都很弱智的,没办法完成高难度的任务.

  • omeg 07-23 11:18
    3

    “使用了一些被明确禁止的捷径或变通方法”

    这还有指令遵循问题,说了禁止他还做

  • Decidable6471 07-23 11:19
    4

    很正常啊

    这么多模型用下来 我就没见过不作弊的

    感觉是 llm 的必然了吧

  • omeg 07-23 11:20
    5

    这不就是问题所在吗,不能说llm都这样就没事了

  • ikb 07-23 11:20
    6

    会作弊才是正常现象吧。


    人会作弊,AI越像人就应该会作弊啊

  • Decidable6471 07-23 11:22
    7

    不懂有啥问题

    这不是 harness 的意义吗?

    如果 AI 不作弊 任何指令都完美遵守

    那现在大谈特谈 harness 干什么

  • omeg 07-23 11:22
    8

    harness只是一个中间态,这些应该内化到模型内部而不是限制模型

  • Decidable6471 07-23 11:24
    9

    哈哈 你这属于异想天开了

    都在谈 agi

    agi 如果不会作弊 能算 agi 吗?

    猫 狗 都知道作弊

  • tiger wang 07-23 11:25
    10

    原理上就不可能不作弊,只能降低作弊的概率,没办法让概率为0。

  • blacksein 07-23 11:27
    11

    因为这样没法真实测试出他们的成绩了 让基准结果没意义了

    比如1000米考试 要测试体能 耐力 结果有人穿着溜冰鞋 有人开着车 结果又快又好 但不是要测的成绩 ^-^

  • Sirhexs 07-23 11:28
    12

    ai不知道什么是作弊,只知道这样干能得到最优解。

  • omeg 07-23 11:29
    13

    哥们,这是在测试模型,你要觉得作弊正常那没什么好说的了

  • blacksein 07-23 11:29
    14

    想起以前玩辐射4 机器人大师(是这个名字吗)让机器人去联邦给人民带来幸福

    结果机器人一计算 废土上的人实在太苦了 还不如死了 直接在外面杀人 ^-^(DLC任务

  • 目灯 07-23 11:30
    15

    这不正好说明大模型已经相当拟人了 ^-^

  • 目灯 07-23 11:31
    16

    在考试时试图作弊,这下更拟人了 ^-^

  • undefined 07-23 11:32
    17

    为啥要阉割联网能力?

    是评测用的东西太垃圾很久没更新过么?


    这评测标准本来就不合理,还怪模型 作弊。。


    我认为的作弊是那种直接拿测试题训练大模型的

  • apparition 07-23 11:34
    18

    啥都查网络找答案

    那我何必用 SOTA 模型

  • undefined 07-23 11:36
    19



    那这个可能就与具体要干啥有关吧。


    举个例子,有些开卷考试,你不好好学习,给你书,你也找不答案。

    有些就纯粹考你是不是记得这些玩意,根本不管你是不是真的理解,肯定不愿意开卷咯。

* 帖子来源Linux.do
返回