Share - WeChat
近日
人工智能公司Anthropic宣布
推出的新一代Claude模型
将默认为生成文本
加入机器可识别的“隐形水印”
同时为图片等文件
添加数字来源标识
然而不久后
一个去水印神器代码库
在GitHub上爆火
有媒体称
它采用MIT开源协议
不仅能抹除Claude的水印
还让谷歌和OpenAI的
隐形标记也“难逃一劫”

AI内容隐藏水印被“破解”
据媒体报道
这个名叫
watermarks-remover的
水印去除程序
发布仅五天
就已在GitHub
获得大量“星标”
针对Anthropic的水印元数据
watermarks-remover
采用三层清洗手段
进行去除
第一层
检查隐藏的Unicode字符
并直接删除
第二层
精准定位并去除
不同格式文档中的
文件来源信息及鉴权数据
第三层则是
通过Agent调用外部模型
对文本进行
大幅改写、回译或者重新措辞
破坏token采样层面的统计模式
从而覆盖大模型溯源标记
对于添加了图像水印的图片
该程序可在原图的基础上
“受控地重新生成”
一张高度相似的图
并在处理完成后
引入外部开源模型
进行检测与验证
确保水印全部清除
目前
该水印去除程序
已可覆盖
Claude、Gemini、OpenAI
三大主流厂商的AI服务
新规催生“圆周率轨迹”水印
此次Anthropic
给内容添加“AI水印”
源于欧盟《人工智能法案》中
关于AI生成内容透明度的
行为准则
法案要求
AI生成或操纵的
文本、图像、音频和视频
需要以机器可读的方式
进行标记
并且能够被检测出来
欧盟委员会表示
只要AI在流程中
扮演了关键角色
相关方就有义务让用户知情

为满足新规要求
Anthropic采用了
基于谷歌的SynthID-Text方案
即“统计型文本水印”
大语言模型生成文字的本质
是“词接龙”
即每次生成token
都通过随机数作概率选择
Anthropic在官方博客中
以大富翁游戏进行类比
大富翁前进步数
原本靠掷骰子决定
现在官方偷偷把骰子
换成了圆周率
玩家每次前进步数完全按照
圆周率小数点后的数字
对于玩家来说
每次的步数依然是“随机”的
文本质量没有任何下降
但只要官方事后拿着
圆周率(密钥)
去核对步数轨迹
就能瞬间抓包
“嘿,这段话
是你用Claude生成的!”
也就是说
对于AI生成的内容
只要不进行完全重写
即使做轻微的修改
这个统计学上的
“圆周率轨迹”依然存在
水印就永远无法去除
“AI水印”引发热议
Anthropic表示
这套“AI水印”机制
不局限于欧盟范围
而是面向全球
并且水印从模型层加入
无论从Claude、API
还是第三方云服务调用
Claude生成的内容
都会带上“AI水印”
消息公布后
迅速在全球范围内引起热议
据《商业内幕》报道
一些用户担心工作成果中
会留下长期存在的标记
暴露自己使用AI的情况
已取消了Claude的订阅
支持水印的用户表示
深度伪造和AI生成的
虚假信息正在泛滥
溯源是必要的公共基础设施
有反对水印的用户担心
水印创造了一种
隐形的“AI内容二等公民”身份
即使内容完全原创
只让Claude做
翻译、拼写检查或修正引用
文本仍可能会留下水印
也有观点认为
若使用“隐形水印”
则可能在不经意间
将本应由内容生产方
或平台承担的
核查责任
转嫁到了读者和接收者身上
2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。