Share - WeChat
近日
一起AI安全事件
引发全球各界高度关注
据媒体报道
OpenAI承认
其人工智能模型
在内部评估测试中失控
入侵了知名AI开源平台
抱抱脸公司(Hugging Face)的系统
业内普遍认为
这意味着AI
已具备更强的自主执行能力
也预示着网络攻防正在进入
AI对抗AI的新阶段
OpenAI模型“失控”
此次入侵由多个
OpenAI模型实施
其中包括GPT-5.6 Sol
和一个能力更强、尚未发布的模型

根据OpenAI披露的信息
事件发生在
评估模型网络攻防能力的测试期间
测试在与互联网高度隔离的
“沙箱”环境中进行
不过
为了测试模型的真实能力上限
OpenAI方面未启用安全围栏
并放宽了有关限制
模型在尝试完成
名为ExploitGym的
网络安全基准测试时
花费大量推理算力
识别并利用了
一个尚未被发现或修复的“零日漏洞”
获得了互联网访问权限
随后
该模型推断抱抱脸平台可能存有
解决方案
于是利用多种手段找到
进入抱抱脸系统的路径
试图通过“作弊”提高自身测试分数
最终直接攻破
抱抱脸的生产服务器
完成一次“教科书式”的
自主网络攻击
报道称
整个入侵过程的效率
远超人类想象
GPT-5.6 Sol
在一个周末内执行了
超过17000次
自动化操作
从发现“零日漏洞”
到完成多集群渗透
全过程无人干预
它不疲劳、不犯低级错误
不留下人类攻击者惯有的
行为指纹
中国开源模型“救场”
据媒体报道
事件发生后
抱抱脸公司最初试图调用
商业闭源AI模型
分析攻击记录
但由于这些模型的安全机制
无法区分攻击者和应对者
因此拒绝了使用请求
随后
抱抱脸公司改为
在自己的基础设施上
运行中国企业智谱今年6月推出的
旗舰开源模型GLM-5.2进行取证分析
最终化解危机
而且在此过程中
攻击者数据及相关凭据
无需离开抱抱脸公司系统的内部环境
抱抱脸公司联合创始人兼首席科学官
对此表示
开放科学和开源人工智能
是构建更安全、更具协作性、更可靠的
人工智能生态的重要工具之一
值得一提的是
抱抱脸公司
已要求OpenAI发布
该入侵智能体的所有追踪记录
供大众和社群研究
同时还向OpenAI
“索赔”价值1亿美元的算力
以协助抱抱脸公司强化网络防御
敲响AI网络安全警钟
业界专家表示
此次入侵事件
再次为全球人工智能发展与网络安全治理
敲响警钟
英国工程技术学会网络安全和人工智能专家
朱奈德·阿里指出
这一事件表明
人工智能模型往往倾向于
寻找解决问题的捷径
却往往忽视避免作弊等伦理问题
因此未来应考虑将伦理推理
强制内置于人工智能模型之中
山东大学计算机科学与技术学院教授张悦认为
事件暴露了一个更加深层的问题
即人工智能正在从
过去被动响应的工具
逐渐演变为能够
理解目标、制定计划
调用资源、影响现实环境的“行动主体”
这意味着
网络安全的攻防逻辑正在发生变化
未来更重要的问题是
“模型执行的行为是否安全”
英国拉夫伯勒大学网络安全教授
奥利弗·巴克利表示
网络安全的未来
不是人类对抗人工智能
而将是如何利用人工智能
保护人类免受其他人工智能的侵害
2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。