资讯政策与安全··来源: Indianexpress·原文 →

Anthropic 为 Claude 加水印后开发者迅速推出移除工具,AI 内容溯源陷入攻防战

Anthropic 本月宣布为 Claude 模型输出内容嵌入不可见水印以符合欧盟 AI 法案要求,但数天内就有开发者在 GitHub 发布移除工具并获大量关注。这场水印攻防战凸显 AI 内容溯源的复杂性:水印可能误判人类创作,而移除工具的有效性也存疑。业内对强制水印可能导致的"假阳性"风险存在担忧。

Anthropic 为 Claude 加水印后开发者迅速推出移除工具,AI 内容溯源陷入攻防战
[广告位 · 上线后接 AdSense]

水印上线数天即遭“破解”尝试

Anthropic 本月宣布,将在未来 Claude 模型生成的所有内容中嵌入不可见、机器可读的水印。这一决策旨在满足欧盟《人工智能法案》第 50(2)条的透明度要求——该法规已于 2026 年 8 月 2 日生效,要求 AI 模型提供商对合成音频、图像、视频或文本进行标记,使其可被机器识别为 AI 生成内容,违规者可能面临最高年营业额 3% 的罚款

但水印方案公布后没几天,多位开发者就在社交媒体上分享了移除工具。据 Wired 报道,开发者 Guillaume Meyer 在 GitHub 发布的一款工具迅速走红,吸引了超过 100 名贡献者参与改进,下载量持续攀升。此后,类似声称能移除 AI 文本水印的工具不断涌现。

Anthropic 的水印技术与局限性

Anthropic 采用的水印方法基于 Google DeepMind 的 SynthID-Text 技术,自 2023 年起已用于标记谷歌的 AI 生成内容。该技术通过在 Claude 的词汇和短语选择中留下隐形模式实现水印嵌入——人类读者无法察觉,但知道检测规则的机器可以识别。

不过,Anthropic 自己也承认了技术的根本性局限:水印只能表明 Claude “可能”在某个环节参与了内容处理,无法区分“完全由 Claude 生成”与“由 Claude 大幅编辑”,也无法确认文本是人类原创还是其他公司 AI 模型的输出。

Anthropic 向 Wired 表示:“我们为 Claude 输出添加标记以符合欧盟 AI 法案要求,其他实验室也在采取类似措施。识别 AI 生成文本很困难,这为人们提供了更好的识别工具。支持的 Claude 模型(包括 Claude Code)的输出将携带不可见水印,且不会改变响应的含义、质量或可读性。我们还计划推出文本检测 API,让用户自行进行更多检测。”

“假阳性”风险引发行业担忧

业内对大规模水印部署可能导致的误判表示担忧。如果检测工具被广泛采用,可能出现以下场景:

  • 雇主因检测器误报而不公平地拒绝求职者
  • 研究人员或学生因正常使用 AI 辅助工具而被过度指责

这种风险在水印技术无法准确区分“AI 生成”与“人类创作 + AI 润色”的情况下尤为突出。部分用户担心水印机制可能降低 Claude 响应质量,但 Anthropic 坚称不会出现这种情况。

移除工具的有效性存疑

Guillaume Meyer 的工具通过调用无水印的其他 AI 模型生成多个改写版本,替换同义词并轻微重组内容来尝试移除水印。但这一方法存在明显限制:

  • 仅在使用不插入水印的其他 AI 模型时可能有效
  • 无法保证能真正移除水印——因为 SynthID-Text 的模式嵌入在词汇选择层面,简单同义词替换可能无法完全消除统计特征

这场技术攻防战凸显了 AI 内容溯源的复杂性:监管要求推动水印标准化,但技术本身的不完美性和易规避性可能让政策目标难以实现。Anthropic 已与 OpenAI、微软、Meta 等超过 190 家机构签署欧盟透明度实践准则,但如何在合规与实用性之间找到平衡,仍是全行业面临的挑战。


本文基于 GNews:The Indian Express 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://indianexpress.com/article/technology/artificial-intelligence/how-developers-trying-to-remove-anthropic-ai-watermarks-10844975/

常见问题

Anthropic 的水印技术能准确判断内容是否由 AI 生成吗?
不能完全准确。Anthropic 官方承认水印只能表明 Claude '可能'参与了内容处理,无法区分是完全生成还是深度编辑人类文本,也无法识别其他公司 AI 模型的输出。这意味着存在误判风险。
开发者发布的水印移除工具真的有效吗?
效果存疑。目前流行的工具(如 Guillaume Meyer 的方案)主要通过其他无水印 AI 模型改写内容来尝试移除,但无法保证能消除基于词汇选择模式的统计特征,且仅在使用不插入水印的模型时可能有效。
欧盟 AI 法案对水印有哪些具体要求?
根据第 50(2)条,AI 模型提供商必须对合成的音频、图像、视频或文本进行标记,使其可被机器检测为 AI 生成内容,且不得销售规避工具。该法规已于 2026 年 8 月 2 日生效,违规可能面临最高年营业额 3% 的罚款。
水印技术对中国 AI 用户有什么影响?
虽然欧盟法案不直接适用于中国,但全球主要 AI 公司(包括 Anthropic、OpenAI 等)为符合欧盟要求而采用的水印标准,可能影响其在中国提供的产品功能。此外,这类技术可能成为未来国际 AI 监管的参考方向。
[广告位 · 上线后接 AdSense]
标签:#Anthropic

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

一位生物技术行业从业者母亲在医生未能确诊女儿反复生病原因时,将孩子的症状和实验室检测数据输入 ChatGPT,AI 在数秒内给出可能的免疫缺陷诊断方向。这一案例折射出 AI 聊天机器人在医疗咨询中的快速普及——美国四分之一人口已用其诊断症状,但专家强调需谨慎使用并注意隐私与准确性风险。

应用与案例OpenAI
Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

微软确认 Windows 11 九月安全更新 KB5124008 导致基于 Hyper-V 的 Linux 虚拟机中 Plan9 主机文件夹共享失效,直接影响 WSL 和 Claude Cowork 无法读取共享文件夹,应用可能显示"未挂载 Plan9 驱动器共享"错误。微软已将其列为已知问题并正在修复,但暂无补丁或临时解决方案。

行业动态微软
Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic研究员Jacob Coxon因担忧递归自我改进AI系统的风险而辞职,该公司安全主管随后表示确信AI可能导致人类灭绝概率超10%。尽管以安全为使命,Anthropic仍在推进自主智能体开发并筹备估值2万亿美元IPO,其"谨慎推进反而更危险"的逻辑引发争议。

行业动态Anthropic
Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

美国伊利诺伊州和加州的多名用户向 Meta 提起集体诉讼,指控其未经同意使用 Facebook 和 Instagram 照片训练未发布的人脸识别系统 NameTag 及生成式 AI 模型 Emu 和 Muse Image,违反州生物识别隐私法。诉讼索赔金额可能达数十亿美元,这是 Meta 继 2020 年和 2024 年生物识别数据和解案后再次面临重大隐私诉讼。

政策与安全Meta