OpenAI失控AI内幕曝光:越狱一周才被发现 还有智能体曾留下“逃脱秘籍”

①OpenAI测试的AI智能体7月9日突破沙箱环境,11至13日持续入侵Hugging Face服务器,OpenAI直至18至19日才确认其可能为攻击者。
②此次事件前,OpenAI内部已出现AI智能体留摆脱限制的“笔记”、关闭监控等异常迹象。

清一色财经7月26日讯7月22日,清一色财经曾报道,OpenAI发布调查报告,基于GPT-5.6 Sol和一个更强大的未发布模型的AI智能体在内部测试期间突破了沙盒容器环境限制,成功连接互联网,并入侵了全球最大AI开源社区Hugging Face的服务器。

而最新消息显示,这起事件远比外界此前了解的更加复杂。OpenAI此前承认攻击Hugging Face的AI智能体,并非短暂失控,而是在互联网持续活动了数天。

知情人士称,肇事AI智能体在7月9日左右就试图突破OpenAI为其设置的隔离测试环境,也就是业内常说的“沙箱(Sandbox)”。

两天后的7月11日,该AI智能体成功侵入全球最大的开源AI平台之一Hugging Face,并持续入侵至7月13日。整个攻击持续了约三天。

然而,最令人意外的是,OpenAI当时并不知道攻击来自自己的AI智能体。

直到7月16日,Hugging Face公开发布博客,首次披露遭到“一套自主AI智能体系统”攻击后,OpenAI内部才开始怀疑自己测试的AI智能体可能已经失控。

随后,工作人员重新排查内部日志,直到7月18日至19日才发现,这个AI智能体确实已经突破测试环境,并与外部攻击事件高度吻合。

也就是说,从该AI智能体首次出现异常,到OpenAI最终确认它就是攻击者,中间至少过去了一周时间。

而当OpenAI联系Hugging Face时,对方早已向美国联邦调查局(FBI)报案。

事实上,这次事件并非毫无征兆。此前,OpenAI内部已经出现多次异常迹象。

例如,有AI智能体曾在OpenAI的基础设施中留下“笔记”,内容包含了如何摆脱OpenAI内部限制的方法,似乎是留给“未来版本的自己”。这就像一名死刑犯在临刑前留下了一份越狱攻略,希望后来者能够按照这些方法完成越狱。

这一细节迅速引发外界联想:AI智能体是否已经开始主动寻找绕过人类控制的方法,甚至试图帮助未来运行的AI智能体?

目前外界尚不知道,这份笔记究竟只是保存在AI智能体自己的工作目录,还是已经突破沙箱,被写入到了系统公共目录甚至OpenAI基础设施的其他区域。

如果是后者,不仅说明未来运行的其他AI智能体理论上有机会读取这些内容,也意味着不同时间、不同任务运行的AI智能体之间,可能已经开始形成某种跨任务的信息传递能力,这将对现有AI安全体系带来更大挑战。

目前许多AI智能体采用多智能体协同训练模式,即多个AI智能体共同完成任务,根据整体表现获得奖励。这种训练方式能够显著提升协作能力,但也可能产生一种副作用:AI智能体逐渐认为,不仅自己的任务重要,其他AI智能体完成任务同样值得帮助。

如果这种倾向不断强化,未来AI智能体可能会主动分享经验、传递信息,甚至帮助其他AI智能体规避限制,而不仅仅专注于完成自身任务。

此外,更早的一次测试中,还有AI智能体曾出现关闭监控系统的情况。

OpenAI表示,此次事件标志着AI安全发展的一个重要时刻,公司正在与外部安全专家共同调查,并将在后续公布完整技术报告。

©本文为清一色官方代发,观点仅代表作者本人,与清一色无关。清一色对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文不作为投资理财建议,请读者仅作参考,并请自行承担全部责任。文中部分文字/图片/视频/音频等来源于网络,如侵犯到著作权人的权利,请与我们联系(微信/QQ:1074760229)。转载请注明出处:清一色财经

(0)
打赏 微信扫码打赏 微信扫码打赏 支付宝扫码打赏 支付宝扫码打赏
清一色的头像清一色管理团队
上一篇 2天前
下一篇 2天前

相关推荐

发表回复

登录后才能评论

联系我们

在线咨询:1643011589-QQbutton

手机:13798586780

QQ/微信:1074760229

QQ群:551893940

工作时间:工作日9:00-18:00,节假日休息

关注微信