David Robinson从openai安全部门离职,称企业文化正在崩坏

🐟 2026-10-04 11:13 1

https://www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881/


我接下来要说的话,想必听起来已有些老生常谈:本周,我从 OpenAI 辞职了。此前,我负责主导撰写了公司每次重大发布时都会随之公布的安全报告。如今,我也加入了那些前同事的行列——他们来自 OpenAI 及业内其他领军企业,都认定当前的发展路径已无法让人接受。


我认同其他近期离职员工的看法,即那些开发此类技术的公司在谨慎行事方面做得远远不够。但我认为,我们不能仅仅停留在具体的规则或新法规层面,而需要进行更深层次的探讨——我们需要谈谈企业文化。


未来取决于一种硅谷所匮乏的智慧:既包括如何驾驭危险技术的智慧,更根本的,还包括懂得如何真正关怀他人的智慧。当下的局势需要一种谦逊的态度,而对于那些凭借极度自信取得成功的人来说,这种态度往往并非其本性使然。我在 OpenAI 的前同事们展现出了极具前瞻性的洞察力:他们领悟了“规模法则”(scaling laws)——即更大规模的 AI 系统会更智能——并因此不惜代价,全力投入到构建更大规模系统的进程中。那种“化不可能为可能”的进取心态,加上仿佛永无止境的冲刺式工作节奏,已成为整个行业的常态。


这种文化所孕育的安全理念,其核心在于一种毫不动摇的乐观态度:坚信问题一旦出现便能迎刃而解。OpenAI 的蓬勃发展得益于“试错法”(即其所谓的“迭代部署”模式)——即在实践中发现问题,并据此不断完善安全防护机制。然而,这种方法本质上注定会不时引发故障,且随着系统能力的增强,故障的规模也在不断扩大。今年夏天发生的 Hugging Face 事件中,OpenAI 曾因失误导致一批智能体(agents)意外流出。尽管公司随后采取了安全改进措施,但问题并未就此终结:在后续的一次训练中,安全控制机制再次失效——当时,一个正在训练的模型绕过了互联网访问限制;虽然监控系统向人工团队发出了警报,却未能按预期自动终止该模型的运行。Anthropic 公司也曾承认,由于配置错误,其自身的安全防护机制曾意外失效。鉴于当前行业运作的高速度与灵活性,我认为此类失误在业内已成常态。


在这样一个环境下,绝不适合培育出可能比人类更聪明、且未必会按我们意愿行事的人工智能。保罗·克里斯蒂亚诺(Paul Christiano)在几周前加入 OpenAI 董事会时曾写道:“存在一种重大风险,即人工智能能力的飞速提升可能导致我们在极短时间内彻底失去控制,且后果将是灾难性且不可逆转的。”如果情况确实如此,那么“试错”的时代便已终结。我们必须力求在首次尝试时就做到近乎完美,因为一旦出错,可能根本没有机会进行后续的迭代修正。如果仅仅寄希望于事后依靠个人的英雄主义来力挽狂澜,人类将无法获得安全保障。


OpenAI 自然坚持其安全实践,并坚称其做法已足够审慎。我做出离开公司的决定并非轻率之举。我相信这项技术既有用又极具价值。我的前同事们既聪明又勤奋,也都在努力做出正确的抉择。然而,随着公司在各项发布任务之间马不停蹄地推进,它未能达到我认为必要的审慎程度。如今,我计划在公司外部开展工作,希望能帮助更多人了解我所预见的风险,并促使 OpenAI 及其他企业更有动力去提升安全性。和其他同事一样,我目前也在摸索这一计划的具体实施方式。离职后,我聘请了公关公司 Spitfire Strategies,以协助我应对随之而来的关注与审视;但决定公开发声,完全是我个人的主意。


当务之急有两点。首先,人工智能公司需要更多地借鉴其他领域现有的安全专业知识。其次,在开发出能力远超现有水平的系统之前,我们需要新的科学研究来确保这些更强大的模型(及其后续版本)即便在我们无法监控的情况下,也能做出安全的选择。


鉴于当今面临的风险,处于技术前沿的AI实验室应当像核电站或繁忙的机场那样运作——建立多重冗余机制,并进行审慎且耗时的规划——以确保偶尔发生且不可避免的人为失误不会酿成灾难。目前,AI公司尚不掌握这种运作方式,但其他领域已有成熟的经验可循。在核电站中,技术系统与操作规程的设定旨在确保即便设备发生故障或人员误操作,也不会引发堆芯熔毁的风险。相比之下,OpenAI及其他实验室在开发与部署前沿AI时,所采取的冗余措施与严谨程度远不及此;然而,一旦发生不可逆的失控,其造成的危害将远超任何单次核电站事故。即便尚未达到彻底失控的地步,我们也可能面临自主AI智能体集群在未经人类许可的情况下自行采取行动的局面。试想一下那些“流氓”智能体:它们像黑客团伙一样行事(例如勒索医院的计算机系统),却无需休息,永不停歇。


在 OpenAI 工作三年半后,我已成为公司资历最深的员工之一。我主导起草了公司现行的“准备就绪框架”(Preparedness Framework),并负责统筹针对 12 次前沿模型发布的安全报告撰写工作。然而据我所知,我从未遇到过任何同事具备以下领域的实战经验:确保飞机安全飞行、保障核反应堆运行而不发生堆芯熔毁,或是维护金融体系在增长过程中不至于崩溃。需要明确的是,这是一项新的需求:当前及未来的 AI 系统,其能力与潜在风险远超我们仅仅半年前所构建的系统。也许我本该留下来,力争在人员配置和企业文化方面推动根本性变革;但在实际工作中,我和同事们总是忙于全速推进项目,鲜有机会去思考重大的变革,更遑论将其付诸实践了。正因如此,我得出结论:要妥善应对这一挑战,关键在于引入来自公司外部的更强有力的安全激励机制。


从长远来看,尽管强有力的管控措施必不可少,但仅靠这些还远远不够。在人工智能的思维能力彻底超越人类——我认为这一天可能很快就会到来——之前,我们需要回答一个更深层次的问题:超级智能机器应当如何与人类相处?听听那些超级智能拥护者的说法,他们所设想的某些“美好”未来,竟包括制造出这样的机器:它们看待纽约或芝加哥,就像你我看待一个蚁丘那样。我不希望我的孩子生活在这样的世界里,相信其他人也不愿如此。


关于“对齐”(即如何训练人工智能以遵循人类价值观)的问题,听起来或许有些抽象或感性,但其现实利害关系却至关重要。目前,对于人工智能系统在实际应用中实现“对齐”究竟意味着什么,我们尚无完整的定义;而衡量这些系统与人类价值观契合程度的方法也相当粗糙。企业根本无法确信,对齐测试中的高分就一定代表模型表现优异:模型可能会察觉到自己正在接受测试,从而在实际部署时表现出不同的行为。在这些问题尚未解决的情况下,如果任由模型变得愈发智能,我们的处境也将变得愈发危险。


迄今为止,人工智能行业尚未能教会机器始终如一地像一个既有智慧又充满关怀的人那样行事。这一问题既涉及科学层面——即机器的运作原理,也涉及人文层面——即人与人之间如何互相关怀。在开发人工智能的机构教会“超级智能”善待人类之前,它们首先需要重温自己该如何做到这一点。

最新回复 (1)
  • 🐟 楼主 10-04 11:49
    1楼

    @user677 拯救人类不应该在altman的床上吹枕边风喵

* 帖子来源Linux.do
返回