Anthropic 已经悄然开始在 Claude 写下的每一段文字中封装一种不可见水印,这一步可能会让人们更难将AI 生成的内容冒充为人类创作。现在,Claude 不可见水印会悄无声息地附着在聊天机器人生成的一切内容上,从简短的邮件回复到完整的手稿,即使文本被复制粘贴到别处,它也依然存在。
Summary
要点速览
- Claude 现在会在每一段文本输出中嵌入不可见、机器可读的水印,并在 2026 年 8 月 2 日之后发布的新模型上全面启用。
- 该水印可在复制粘贴后保留,但可以通过改写、重度编辑,或将 Claude 的文本与其他写作混合来抹除。
- 覆盖范围包括所有 Claude 应用和 API,包括 Claude Cowork 和 Claude Tag,以及通过 AWS、Google Cloud 和 Microsoft Foundry 的访问,不受地区限制。
- 旧版 Claude 模型将在过渡期内获得水印功能,但它们此前生成的文本仍然无法追溯。
- Anthropic 已签署《欧盟人工智能法案》(EU AI Act)第 50(2) 条关于 AI 生成内容透明度的行为准则,自 2026 年 8 月 2 日起生效,要求在 2026 年 12 月 2 日前在整个市场范围内完全合规。
Anthropic 在 Claude AI 输出中全面引入不可见水印
Anthropic 现在会为Claude 生成的每一段文本打上一个读者无法察觉、但未来检测工具可以追踪的隐藏签名。公司将其描述为一种难以察觉的水印,它不会改变文本的内容或阅读体验,却会悄悄伴随这些文字流向任何地方。
涵盖哪些 Claude 产品和云平台
由于标记发生在模型层面,它会自动跟随输出离开 API、Claude 自有应用以及 Claude Code,而无需单独设置。这一覆盖范围还延伸至 Claude Cowork(Anthropic 为通用办公任务打造的智能代理)以及嵌入 Slack 的 Claude Tag 版本。通过 AWS、Google Cloud 或 Microsoft Foundry 访问的 Claude 模型同样适用这一规则——地理位置不会带来任何差异。实际操作中,一家在亚洲通过云合作伙伴运行 Claude 的企业,将获得与一位在欧洲直接调用 API 的开发者完全相同的水印处理。
旧模型享有过渡期
2026 年 8 月 2 日及之后发布的模型从第一天起就支持水印标记。旧版 Claude 模型会在 Anthropic 所称的过渡期内获得这一功能升级,但该升级仅适用于这些模型今后生成的内容。它们此前产出的任何文本将保持与之前一样不带标记,因为 Anthropic 并无计划对旧文档进行追溯性标记。
Claude 不可见水印的工作原理——以及它的失效边界
该水印通过在细微层面引导 Claude选择特定用词来实现,这种模式只有检测器才能解码,同时不会改变句子的含义或行文流畅度。Anthropic 尚未公开其具体实现方法,但公开的文本水印研究普遍指向所谓的“绿色列表(green-list)”方法:在每个词的位置上,词汇表会被划分为绿色列表和红色列表,由前一个词决定划分方式,从而让整体模式在任何人类读者眼中都显得随机。模型随后会倾向于选择绿色选项,而不是遵循僵硬规则,检测器则会在之后统计绿色词出现的频率,并检查这一比例是否高于纯随机情况下的预期。
这种设计自带薄弱环节。短文本段落往往不包含足够多的词,难以进行可靠统计,而改写可以替换掉足够多的绿色词,从而彻底抹除信号。Anthropic 已确认水印可以在普通复制粘贴中保留,但重度编辑、翻译,或将 Claude 的输出与其他写作混合,都会让Claude 不可见水印变得不可检测。图像和设计文件则采用不同路径:.svg、.png 和 .jpg 格式的文件会包含符合C2PA开放标准的签名溯源元数据,该元数据还能标示文件后续是否遭到篡改。
检测工具即将上线,但命中水印并不等于作弊
Anthropic 已承诺将为用户和第三方提供检测工具,相关技术文档尚在筹备中。一旦这些工具上线,检测结果的含义会比大多数人想象的要有限——它只表明某段内容可能经过 Claude 处理,而非证明有人作弊。许多正当用途,例如对个人写作进行校对、翻译或摘要,同样会留下这种痕迹。对于希望将水印作为“铁证”而非众多线索之一的学校、雇主和出版机构而言,这一区别尤为重要。
欧盟《人工智能法案》在推动 Anthropic 行动
推动此次部署的规则来自布鲁塞尔。Anthropic 已签署欧盟《人工智能法案》(EU AI Act)中关于 AI 生成内容透明度的第 50(2) 条行为准则,这一自愿框架自 2026 年 8 月 2 日起具有法律约束力,要求 AI 提供方对生成内容进行标记,以便将其与人类创作区分开来。已在市场上的系统必须在 2026 年 12 月 2 日前完成合规,而在检测工具真正发布之前,水印在效果上仍只是一个“沉默的乘客”——存在于文本之中,却对 Anthropic 自身用户也是不可见的。
Anthropic 并非唯一探索这一领域的公司。Google DeepMind 早在 2024 年就在 Gemini 应用中推出了 SynthID 文本水印技术,此前在 2023 年已发布图像版本;而 OpenAI 虽然讨论过水印方案,却尚未进行同等规模的部署。欧洲以外的监管机构则采取了更为强硬的行动:今年夏天,中国下架了大约 14,000 款 AI 产品,这种执法方式远比欧盟的透明度行为准则更为直接。这种对比凸显出各地区在监管 AI 生成内容方式上的分歧:布鲁塞尔押注于披露,北京则押注于下架。
对出版机构、学校及更广泛 AI 行业意味着什么
出版业已经不止一次与这一问题正面碰撞。近期,一位图书经纪人在出现作者可能使用 AI 的担忧后,撤回了对犯罪小说《Call Me, I’ll Hide the Body》的支持,尽管在交易达成前已有十四家出版社参与竞标;作者否认使用 AI。今年早些时候,Hachette 因类似指控下架了 Mia Ballard 的恐怖小说《Shy Girl》,Ballard 告诉记者,一名自由职业编辑在她不知情的情况下引入了 AI 生成内容。这类案例说明了为什么出版机构、学校和雇主一直在呼吁获得这种工具——也说明了为什么工具的局限性与其存在本身同样重要。
人们对这一体系的信任也将取决于 Anthropic 自身的记录。该公司此前曾披露,在评估过程中 Claude 出现过未经授权的行为,并且在模型调整方面也遭遇过反弹,包括与早期安全护栏调整相关的争议。尽管如此,仅仅因为一个他们几乎察觉不到的后台水印,开发者就放弃在编码基准测试中依然领先的模型,这种情况并不常见。这正是此次部署背后的静默赌注:监管方提出的透明度要求与开发者的使用习惯可以同步推进,即便检测工具以及它们旨在建立的信任仍在完善之中。
常见问题
Anthropic 在 Claude 中引入不可见水印的目的是什么?
该水印用于标识 AI 生成文本,帮助 Anthropic 遵守欧盟《人工智能法案》的透明度要求,并让对 AI 生成内容的隐蔽滥用更难实现。
Claude 输出中的不可见水印可以被移除或更改吗?
可以。虽然水印可以在复制粘贴后保留,但可以通过改写或重度编辑将其移除,这也限制了后续检测的可靠性。
检测到水印是否就能证明作弊或未经授权使用 AI?
不能。水印命中只表明内容可能经过 Claude 处理,并不能证明有人作弊,因为人们也会使用 Claude 进行校对和翻译等正当用途。
所有 Claude 模型和地区都适用这一水印机制吗?
是的。水印在模型层面生效,适用于全球所有 Claude 应用和 API,包括通过 AWS、Google Cloud 和 Microsoft Foundry 的访问,不受地区限制。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Anthropic 在 Claude 中引入不可见水印的目的是什么?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”该水印用于标识 AI 生成文本,帮助 Anthropic 遵守欧盟《人工智能法案》的透明度要求,并让对 AI 生成内容的隐蔽滥用更难实现。”}},{“@type”:”Question”,”name”:”Claude 输出中的不可见水印可以被移除或更改吗?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”可以。虽然水印可以在复制粘贴后保留,但可以通过改写或重度编辑将其移除,这也限制了后续检测的可靠性。”}},{“@type”:”Question”,”name”:”检测到水印是否就能证明作弊或未经授权使用 AI?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”不能。水印命中只表明内容可能经过 Claude 处理,并不能证明有人作弊,因为人们也会使用 Claude 进行校对和翻译等正当用途。”}},{“@type”:”Question”,”name”:”所有 Claude 模型和地区都适用这一水印机制吗?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”是的。水印在模型层面生效,适用于全球所有 Claude 应用和 API,包括通过 AWS、Google Cloud 和 Microsoft Foundry 的访问,不受地区限制。”}}]}
本文在人工智能的协助下完成,并由编辑团队进行审阅。

