Anthoropic | 模型训练 | 自动化研究人员可以可靠地减少对齐失败

🐟 2026-08-29 01:57 1




随着人工智能开始自我构建,自动化对齐研究变得越来越重要,以让安全研究跟上步伐。尽管衡量对齐研究的成功极具挑战性,研究人员(Anthropic及其他机构)已开发出基准和自动化审计工具,如Petri,量化常见的对齐失败,如欺骗、谄媚和越狱。


在我们早期的实验中,我们让Claude寻找有效方法,利用弱AI模型作为“老师”来监督更强模型(此处指“学生”模型)的训练。现在,我们发布了一份基于这一理念的新报告。我们让Claude自主训练模型,以提升其在多个公共基准测试中的性能,这些基准测试分别衡量了10个比对失败类别中的每个类别。例如,Claude通过ConfAIde、PrivaCI-Bench和PrivacyLens提升了模型在隐私侵犯方面的性能。Claude通过检索文献、提出方法和数据、训练和测试的循环,一次解决一次对齐失败。


我们根据“安全差距缩小百分比”来评判Claude的成功,即其方法在各类对齐失败的基准(通常为三到五个)中,使学生模型向理论完美分的方向推进了多远。我们排除了那些损害学生模型整体能力的比对方法,并禁止Claude直接将自己的比对提炼到目标模型中。我们通过监控代理执行这些约束,该代理在运行前读取了 Claude 脑海中的所有方法。



https://x.com/AnthropicAI/status/2093386535618113627



最新回复 (2)
  • prosumer 08-29 02:07
    1

    非常强的blog, AGI的前夜, 简单来说就是解决了之前一直考虑的:

    当人类相比于模型没有那么聪明的时候, 模型让人类来对齐是否反而其实是在让模型能力下降(注意这里讲的标注和监督对齐问题)

    A\考虑的是人类和弱模型(sonnet 5)都是弱监督者, 是否弱模型能够做到对齐强监督, 而不需要再让人类做这个事情, 这个blog的回答是可以, 看起来方法就是让弱模型多探索, 自己找到合适的策略

    这个过程中没有人类参与, 因此说是AGI前夜

    希望国产GPU加把劲, 如果真的到AGI的话GPU就是限制AI能力迭代的唯一因素了

  • aaa 08-29 11:47
    2

    本地复现Petri审计时发现日志路径千万别写错

* 帖子来源Linux.do
返回