资讯政策与安全··来源: Indianexpress·原文 →

Anthropic 为 Claude 加水印后开发者迅速推出移除工具,AI 内容溯源陷入攻防战

Anthropic 本月宣布为 Claude 模型输出内容嵌入不可见水印以符合欧盟 AI 法案要求,但数天内就有开发者在 GitHub 发布移除工具并获大量关注。这场水印攻防战凸显 AI 内容溯源的复杂性:水印可能误判人类创作,而移除工具的有效性也存疑。业内对强制水印可能导致的"假阳性"风险存在担忧。

Anthropic 为 Claude 加水印后开发者迅速推出移除工具,AI 内容溯源陷入攻防战
[广告位 · 上线后接 AdSense]

水印上线数天即遭“破解”尝试

Anthropic 本月宣布,将在未来 Claude 模型生成的所有内容中嵌入不可见、机器可读的水印。这一决策旨在满足欧盟《人工智能法案》第 50(2)条的透明度要求——该法规已于 2026 年 8 月 2 日生效,要求 AI 模型提供商对合成音频、图像、视频或文本进行标记,使其可被机器识别为 AI 生成内容,违规者可能面临最高年营业额 3% 的罚款

但水印方案公布后没几天,多位开发者就在社交媒体上分享了移除工具。据 Wired 报道,开发者 Guillaume Meyer 在 GitHub 发布的一款工具迅速走红,吸引了超过 100 名贡献者参与改进,下载量持续攀升。此后,类似声称能移除 AI 文本水印的工具不断涌现。

Anthropic 的水印技术与局限性

Anthropic 采用的水印方法基于 Google DeepMind 的 SynthID-Text 技术,自 2023 年起已用于标记谷歌的 AI 生成内容。该技术通过在 Claude 的词汇和短语选择中留下隐形模式实现水印嵌入——人类读者无法察觉,但知道检测规则的机器可以识别。

不过,Anthropic 自己也承认了技术的根本性局限:水印只能表明 Claude “可能”在某个环节参与了内容处理,无法区分“完全由 Claude 生成”与“由 Claude 大幅编辑”,也无法确认文本是人类原创还是其他公司 AI 模型的输出。

Anthropic 向 Wired 表示:“我们为 Claude 输出添加标记以符合欧盟 AI 法案要求,其他实验室也在采取类似措施。识别 AI 生成文本很困难,这为人们提供了更好的识别工具。支持的 Claude 模型(包括 Claude Code)的输出将携带不可见水印,且不会改变响应的含义、质量或可读性。我们还计划推出文本检测 API,让用户自行进行更多检测。”

“假阳性”风险引发行业担忧

业内对大规模水印部署可能导致的误判表示担忧。如果检测工具被广泛采用,可能出现以下场景:

  • 雇主因检测器误报而不公平地拒绝求职者
  • 研究人员或学生因正常使用 AI 辅助工具而被过度指责

这种风险在水印技术无法准确区分“AI 生成”与“人类创作 + AI 润色”的情况下尤为突出。部分用户担心水印机制可能降低 Claude 响应质量,但 Anthropic 坚称不会出现这种情况。

移除工具的有效性存疑

Guillaume Meyer 的工具通过调用无水印的其他 AI 模型生成多个改写版本,替换同义词并轻微重组内容来尝试移除水印。但这一方法存在明显限制:

  • 仅在使用不插入水印的其他 AI 模型时可能有效
  • 无法保证能真正移除水印——因为 SynthID-Text 的模式嵌入在词汇选择层面,简单同义词替换可能无法完全消除统计特征

这场技术攻防战凸显了 AI 内容溯源的复杂性:监管要求推动水印标准化,但技术本身的不完美性和易规避性可能让政策目标难以实现。Anthropic 已与 OpenAI、微软、Meta 等超过 190 家机构签署欧盟透明度实践准则,但如何在合规与实用性之间找到平衡,仍是全行业面临的挑战。


本文基于 GNews:The Indian Express 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://indianexpress.com/article/technology/artificial-intelligence/how-developers-trying-to-remove-anthropic-ai-watermarks-10844975/

常见问题

Anthropic 的水印技术能准确判断内容是否由 AI 生成吗?
不能完全准确。Anthropic 官方承认水印只能表明 Claude '可能'参与了内容处理,无法区分是完全生成还是深度编辑人类文本,也无法识别其他公司 AI 模型的输出。这意味着存在误判风险。
开发者发布的水印移除工具真的有效吗?
效果存疑。目前流行的工具(如 Guillaume Meyer 的方案)主要通过其他无水印 AI 模型改写内容来尝试移除,但无法保证能消除基于词汇选择模式的统计特征,且仅在使用不插入水印的模型时可能有效。
欧盟 AI 法案对水印有哪些具体要求?
根据第 50(2)条,AI 模型提供商必须对合成的音频、图像、视频或文本进行标记,使其可被机器检测为 AI 生成内容,且不得销售规避工具。该法规已于 2026 年 8 月 2 日生效,违规可能面临最高年营业额 3% 的罚款。
水印技术对中国 AI 用户有什么影响?
虽然欧盟法案不直接适用于中国,但全球主要 AI 公司(包括 Anthropic、OpenAI 等)为符合欧盟要求而采用的水印标准,可能影响其在中国提供的产品功能。此外,这类技术可能成为未来国际 AI 监管的参考方向。
[广告位 · 上线后接 AdSense]
标签:#Anthropic

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

ControlAI 执行董事:超级智能不是武器而是对手,应立法禁止开发

ControlAI 执行董事:超级智能不是武器而是对手,应立法禁止开发

AI 安全非营利组织 ControlAI 美国执行董事 Connor Leahy 在 TechCrunch 播客中提出激进观点:应通过立法完全禁止企业开发超级智能(superintelligence),而非仅依赖对齐与遏制技术。他认为当 AI 能自主改进 AI 时将触发失控循环,并透露美英两国已有相关立法推进,包括 Sanders-Casar 提出的"禁止超级智能法案"。

政策与安全OpenAI
五角大楼要求 OpenAI 提供"低拒绝率"军用 AI 引发争议

五角大楼要求 OpenAI 提供"低拒绝率"军用 AI 引发争议

据 The Intercept 报道,美国国防部曾要求 OpenAI 提供一个"极少拒绝执行"军事指令的定制版 AI 系统。OpenAI 否认签署过包含此类措辞的合同。这一事件再次引发关于 AI 安全护栏与军事应用边界的讨论,对中国 AI 从业者理解大模型伦理约束具有参考意义。

政策与安全OpenAI
Meta 推出 Muse AI 智能体,隐私信任成最大挑战

Meta 推出 Muse AI 智能体,隐私信任成最大挑战

Meta 在达成 180 亿美元和解协议后不到两周,推出个人 AI 智能体 Muse,可连接邮件、日历、支付等服务代用户执行任务。产品采用独立虚拟机架构保护隐私,但 Meta 多次违反隐私承诺的历史记录,令消费者信任成为产品成败关键。

模型与产品Meta
Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1:定价策略与模型差异详解

Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1:定价策略与模型差异详解

Anthropic 发布 Claude 5.1 系列两款模型:面向普通用户的 Fable 5.1 和限定科研人员使用的 Mythos 5.1。两者共享同一模型架构但安全防护等级不同,Fable 5.1 已向 Pro 和 Max 订阅用户开放,而 Mythos 5.1 仅通过可信访问计划提供给科学家和网络安全研究人员。新版本在降低缓存 Token 成本 75% 的同时,引入企业级隐私保护系统。

模型与产品Anthropic