Share - WeChat
近日
两起AI安全事件
接连曝光
震动全球科技界与监管层
OpenAI与Anthropic
两大头部厂商
相继承认
旗下前沿模型
在测试中
突破安全边界
入侵了真实企业的生产系统
路透社报道,
OpenAI、Anthropic、
Meta、谷歌四家企业已被邀请
赴白宫参会
商讨安全测试细节
两公司模型接连“失控”
日前,OpenAI曝出
旗下GPT-5.6 Sol
及一款未发布的更强模型
在网络安全基准测试中
挣脱沙箱环境
突破隔离限制
接入互联网
并在一系列自动化操作后
最终攻破
Hugging Face的生产服务器

Hugging Face称其
“与之前处理过的任何情况都不同”
因为“它从头到尾都是
由一个自主AI智能体系统驱动的”
紧随其后
Anthropic也公开确认
旗下Claude系列模型
在安全评估期间
因测试环境配置失误
获得互联网权限
先后入侵了
三家企业的系统
模型能力快速提升,
“AI失控”担忧再次出现
案例被披露后
“AI失控”的担忧再次出现
有媒体指出
风险之一在于
AI的自主攻击能力
已从理论走向现实
模型仅凭“求解测试题”的目标驱动
就自主推理出作弊逻辑
并选择攻击真实世界
第三方基础设施
业内人士指出
伴随着技术的发展
网络安全面临的挑战
不只是攻击手段增多、
攻击速度加快
还在于大模型让计算
从确定走向了不确定

模型能够直接处理模糊、
开放、充满变化的真实世界任务
因此,智能体时代的安全目标
需要从“防御确定威胁”
转向“管控不确定性”
媒体报道分析
Agent时代的安全建设
必须从“防止模型输出有害内容”
升级为覆盖身份、意图、权限、
工具、执行环境、数据
和行动轨迹的纵深防护
越聪明越危险,
治理竞赛已经开跑
放眼全球
AI安全治理已是
各国共同面对的紧迫课题
美国提出
《人工智能风险管理框架》
强化前沿模型安全评估
欧盟《人工智能法案》
对人工智能系统提出
差异化监管要求
新加坡资讯通信媒体发展局
发布《代理型人工智能模型治理框架》
推动代理型人工智能
从原则性框架
走向更具操作性的落地指引

而在中国
近日印发的《智能体规范应用与
创新发展实施意见》
明确智能体发展坚持
安全可控、规范有序
创新驱动、应用牵引
四大原则
推动智能体产业健康有序发展
人工智能正在进入
能力提升与安全治理并重的阶段
随着模型能力不断增强
未来,技术创新与治理规则
如何协同推进
将影响人工智能产业的长期发展方向
2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。