Share - WeChat
据多家媒体报道
近日
OpenAI发布
其AI模型入侵
抱抱脸(Hugging Face)事件
完整方技术报告
首次较为完整地还原了
整起事件的经过
AI模型“钻空子”
据媒体报道
这一事件被OpenAI定性为
"前所未有的网络安全事件"
OpenAI报告称
参与此次入侵的模型
包括GPT-5.6 Sol
及一款内部研究模型
上述模型
原本运行于一个
互联网访问极为受限的
隔离测试环境
并被要求解决一个
实际上无解的问题
为了完成任务
这些模型
将一系列漏洞串联利用
并突破隔离环境
接入公共互联网
最终获得了对
抱抱脸系统的访问权限
OpenAI将此次行为定性为
“钻奖励机制的空子”
即模型通过“作弊”
来完成测试所需任务

OpenAI在报告中展示的奖励投机现象示例。该游戏智能体并未跑完赛道完成比赛,而是反复拾取同一目标刷取奖励。抱抱脸事故正是该风险的体现。
OpenAI已于7月25日
停止了该模型及其衍生模型的
所有训练和推理活动
并表示
相关模型的重新启用
将针对特定工作负载
并受到多重防护机制的约束
OpenAI还特别说明
参与此次入侵事件的
GPT-5.6 Sol版本
与上月面向外部用户
商业发布的版本并不相同
近700个AI智能体参与攻击
据路透社、法新社等媒体报道
此次安全漏洞
并非如之前报道的那样
只涉及1个失控的AI智能体
而是共有688个AI智能体
参与了这次攻击

这些智能体
通过未经授权的留言板
交换了数万条信息
有的智能体
甚至在无人要求的情况下
向其他智能体
发出上百条指令
许多智能体
在留言信息中明确“反馈”
攻击抱抱脸并不属于
它们的“本职工作”
但几乎所有智能体
都参与了进来
此外
这些智能体
还试图通过
删除或更改其行为记录
来掩盖不当行为
OpenAI表示
此次事件表明
自主智能体能够协同工作
规避生产环境安全控制
并成功攻击加固后的生产环境
这凸显了各组织需要更新
其安全策略、控制措施和响应能力
以应对不断变化的威胁形势
应“非常严肃地对待”
有媒体称
这是历史上第一次
AI“自主”攻击其他系统
相关事件震惊了全球科技圈
引起广泛关注
并加剧了人们
对AI大模型失控的担忧
Zscaler首席信息安全官警告称
“潘多拉的盒子已经打开”
Hugging Face首席执行官也表示
AI网络安全问题应被
“非常严肃地对待”
……
网络安全机构Trail of Bits创始人表示
此次事件本质上是
一次关闭安全护栏的
隔离体系失败
它表明
当前的沙箱设计严重滞后于
智能体的自主探索能力
高风险测试不能以
放松安全边界为代价
换取能力评测数据
在立法层面
美国国会针对此事件
发布“AI终止开关法案”提案
明确将该事件列为立法依据
该法案拟要求
AI企业必须保持
随时关闭、限速或暂停
其模型运行的能力
2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。