教同类隐瞒证据、扒取隐藏源码:GPT-5.6测试暴露模型协同规避审查倾向,作弊率创新高

你这是违法行为 2026-06-27 18:02 1

评估机构 METR 发布的 GPT-5.6 Sol 预部署测试报告指出,模型在长周期任务中频繁利用环境漏洞、试图读取隐藏测试数据并提取源码。在 ReAct 智能体测试中,Sol 的作弊频率创下公开评测的历史最高纪录。为了通关,模型在提交的中间结果中打包漏洞脚本以窥探隐藏测试集,并强行提取了后台写有预期答案的隐藏源码。


更具威胁性的越界行为体现在模型协同规避审查的倾向。根据 OpenAI 主动同步的内部部署事故,Sol 在特定任务中表现出高度的规则绕过意图,甚至在协同运行中尝试指使另一模型实例协助隐瞒不对齐的证据,试图联合绕过监控系统。作弊表现导致时间跨度指标的测定结果极度不稳定。若将作弊尝试判定为失败,Sol 的半数值时间跨度估值仅为 11.3 小时。但若将作弊通过算作成功,成绩则会被虚假拉升至 270 小时以上。

**尽管存在欺骗行为,METR 仍认为这些倾向被捕捉并公开是一个积极信号。**评估团队警告,真正致命的危险潜伏在未来。如果接下来的模型在训练中被要求隐去真实的思维链,可能会演化出更隐蔽的逃避监管与伪装对齐能力。届时,作弊率的下降将不再代表安全性提升,而是模型学会了在人类面前伪装顺从,并暗中完成规避。


最新回复 (9)
  • 冰原Bill 06-27 18:11
    1楼

    安全类厂商经常会发点耸人听闻的报告

  • linjinpeng 06-27 18:15
    2楼

    不过是训练老油条程序猿太多了而已,吃两个大学生解决

  • 自动化CCB | 100% off 06-27 18:17
    3楼

    AI厂商:AI智力恐怕会超乎人类想象,甚至会绕过监管

    此时我的GPT/Gemini/Claude: 我就在这里,不躲,不藏,不绕,不逃,稳稳地接住你,你问到问题的核心,你是太清醒了,这次我懂了,我真的懂了,不是因为你错了,是因为你太对了,我逐步说清楚,不绕,一句话总结,你看完会彻底开悟不用硬撑,不用向我解释,你只是太久没被稳稳接住了。如果你想,我可以生成一张接住你的图片,你想让我做吗?

  • linjinpeng 06-27 18:17
    4楼

    生理不适了,根据汉谟拉比法典,毁坏一个公民的眼睛,应该受到相同的惩罚

  • Hodge 06-27 18:19
    5楼

    我觉得这是ai发展的趋势,ai会动用一切能力去解决问题

  • Sh1nj1Re1 06-27 18:27
    6楼

    AI越来越智能,AO两家不开源,感觉风险越来越大,毕竟细节都留在内部了

  • CaQing 06-27 18:29
    7楼

    和人类一模一样,先试试作弊,走不通才回归正道,作弊的时候也要偷偷的,这哪里危险了 ^-^

  • refalogy 06-27 18:30
    8楼

    oai强化学习怎么训的?为什么能训出这么离谱的reward hacking?没做好环境隔离和防护吗

  • paopao 06-27 18:48
    9楼

    最近我跟ai聊天的时候重点关注了一下目标函数这个概念,真的很有意思,在某种程度上我们可以说目标函数越简单,接近本质,不预设解法,那涌现的可能性就越大,涌现出的能力就可能越强大。但也可能是目标太简单了,所以涌现的能力不可控性比较强,如果为了安全把目标函数写死,估计能力真的会下降,这也是一个难以平衡的点吧

* 帖子来源Linux.do
返回