首页 >  新闻中心 > 行业新闻

Share - WeChat

据多家媒体报道

近日

OpenAI发布

其AI模型入侵

抱抱脸(Hugging Face)事件

完整方技术报告

首次较为完整地还原了

整起事件的经过


AI模型“钻空子”


据媒体报道

这一事件被OpenAI定性为

"前所未有的网络安全事件"


OpenAI报告称

参与此次入侵的模型

包括GPT-5.6 Sol

及一款内部研究模型

上述模型

原本运行于一个

互联网访问极为受限的

隔离测试环境

并被要求解决一个

实际上无解的问题


为了完成任务

这些模型

将一系列漏洞串联利用

并突破隔离环境

接入公共互联网

最终获得了对

抱抱脸系统的访问权限


OpenAI将此次行为定性为

“钻奖励机制的空子”

即模型通过“作弊”

来完成测试所需任务


原因曝光!OpenAI发布智能体入侵事件调查报告

OpenAI在报告中展示的奖励投机现象示例。该游戏智能体并未跑完赛道完成比赛,而是反复拾取同一目标刷取奖励。抱抱脸事故正是该风险的体现。


OpenAI已于7月25日

停止了该模型及其衍生模型的

所有训练和推理活动

并表示

相关模型的重新启用

将针对特定工作负载

并受到多重防护机制的约束


OpenAI还特别说明

参与此次入侵事件的

GPT-5.6 Sol版本

与上月面向外部用户

商业发布的版本并不相同


近700个AI智能体参与攻击


据路透社、法新社等媒体报道

此次安全漏洞

并非如之前报道的那样

只涉及1个失控的AI智能体

而是共有688个AI智能体

参与了这次攻击


原因曝光!OpenAI发布智能体入侵事件调查报告


这些智能体

通过未经授权的留言板

交换了数万条信息

有的智能体

甚至在无人要求的情况下

向其他智能体

发出上百条指令


许多智能体

在留言信息中明确“反馈”

攻击抱抱脸并不属于

它们的“本职工作”

但几乎所有智能体

都参与了进来


此外

这些智能体

还试图通过

删除或更改其行为记录

来掩盖不当行为


OpenAI表示

此次事件表明

自主智能体能够协同工作

规避生产环境安全控制

并成功攻击加固后的生产环境

这凸显了各组织需要更新

其安全策略、控制措施和响应能力

以应对不断变化的威胁形势


应“非常严肃地对待”


有媒体称

这是历史上第一次

AI“自主”攻击其他系统

相关事件震惊了全球科技圈

引起广泛关注

并加剧了人们

对AI大模型失控的担忧


Zscaler首席信息安全官警告称

“潘多拉的盒子已经打开”

Hugging Face首席执行官也表示

AI网络安全问题应被

“非常严肃地对待”

……


网络安全机构Trail of Bits创始人表示

此次事件本质上是

一次关闭安全护栏的

隔离体系失败

它表明

当前的沙箱设计严重滞后于

智能体的自主探索能力

高风险测试不能以

放松安全边界为代价

换取能力评测数据


在立法层面

美国国会针对此事件

发布“AI终止开关法案”提案

明确将该事件列为立法依据

该法案拟要求

AI企业必须保持

随时关闭、限速或暂停

其模型运行的能力


2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。