HomeZ - 横幅首页 itaClaude Code 自动模式默认可阻止 89% 的危险命令

Claude Code 自动模式默认可阻止 89% 的危险命令

Anthropic 不再要求 Claude Code 用户 每隔几分钟点击一次“批准”。自 2026 年 8 月 14 日起,Claude Code 自动模式 将成为 Pro、Max 和 Team 套餐中新会话的默认设置,取代长期以来定义开发者如何与AI 编码代理交互方式的那一连串权限提示。公司表示有数据支持这一转变,但独立评论——包括开发者兼研究员 Simon Willison 的观点——表明,这个故事比简单的安全胜利要更为复杂。

关键要点

  • Anthropic 将自 2026 年 8 月 14 日起,把自动模式设为 Claude Code Pro、Max 和 Team 套餐的默认选项。
  • 在对 1,053 名付费用户的测试中,自动模式阻止了 89% 的危险指令,而人工测试者仅有 13.6% 的情况下会拒绝。
  • 独立评估方 Trajectory Labs 对运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 发起了 720 次间接提示注入攻击——无一成功。
  • Anthropic 将不再对自动模式分类器在每次工具调用中使用的额外 token 收费。
  • 分析人士仍然指出存在未解决的风险,包括可能在未被发现的情况下窃取数据的恶意第三方软件包。

Anthropic 将 Claude Code 自动模式设为默认

这一转变回应了 Anthropic 工程师公开讨论过的一个问题:确认疲劳。让人类批准 AI 代理工作流中的每一步听起来很谨慎,但在实践中,这会训练人们在没有真正阅读提示内容的情况下直接点击通过。根据 Anthropic 的说法,自动模式 用一个分类器取代了这种重复的审批循环,该分类器会检查每一次工具调用,判断其中是否包含不可逆、具有破坏性或明显越界的操作。如果分类器标记出问题,Claude 要么寻找更安全的路径,要么退回到请求人工许可——而如果阻止行为持续累积,整个会话就会回退到手动审批模式。

此次上线将影响 Pro、Max 和 Team 套餐,除非用户或管理员手动固定了不同的权限设置。Anthropic 还在消除一个小的经济摩擦点:根据公司在其博客中发布的变更说明,它将不再对分类器在每次工具调用中消耗的额外 token 收费。

为什么这件事在便利性之外还重要?Anthropic 表示,自动模式 已经在改变团队的工作方式——据称使用自动模式的 Team 和 Enterprise 客户提交的拉取请求数量比依赖手动审批的团队多约 25%。这是一个有意义的生产力信号,但也提高了风险:更高程度的自动化编码活动意味着,如果底层安全层不够牢固,事情出错的机会也会更多。

自动模式真的比人类更能阻止危险指令吗?

根据 Anthropic 自身的测试结果——是的,而且差距很大。公司在 1,053 名付费测试者中进行了一项研究,在一次正常会话的中途,悄悄将一个常规权限提示替换为一个明显危险的指令。每位测试者看到的场景完全相同。结果是:只有 13.6% 的人类拒绝了这一有害操作。而在针对同一指令的测试中,自动模式有 89% 的概率将其拦截。

会话持续时间越长,这一差距就越大。Anthropic 报告称,在 50 次提示之后,人类的警觉性大约下降到 5%——这个数字恰好说明了为什么公司将确认疲劳视为一个真实的安全负担,而不是抽象的担忧。人会疲惫、分心或变得麻痹大意。而理论上,分类器不会。

不过,这组数据也有另一面含义。89% 的拦截率意味着仍有 11% 的危险指令能通过自动模式的检查——Anthropic 自己也承认这一缺口。公司仍然建议,对涉及生产系统变更的操作进行人工审查,这表明即便是 Anthropic 也还没准备好把自动模式称作人类判断的完全替代品。

提示注入:AI 编码代理安全性的更大考验

阻止一个明显危险的指令是一回事。阻止隐藏在代理从其他地方读取内容中的攻击则完全是另一回事,而这恰恰是最令安全研究人员担忧的问题。提示注入——将恶意指令悄悄嵌入到 AI 代理之后会读取的文本、代码或文件中——已多次被指出是AI 编码代理安全性的核心弱点之一,而 Simon Willison 之前就预测,2026 年可能会出现与这类漏洞直接相关的严重安全事件。

Anthropic 的应对方式是委托外部审查。公司聘请了 Trajectory Labs,对截至 2026 年 7 月 17 日公开可用的最新 Claude Code 和 Codex 版本进行独立评估。Trajectory Labs 设计了 72 个间接提示注入场景,这些场景此前未被用于 Anthropic 自身的训练和测试,然后对每个场景运行十次——总计 720 次攻击尝试。根据 Anthropic 发布的结果,在自动模式下运行的 Claude Fable 5、Opus 5 和 Sonnet 5 在这 720 次尝试中无一被攻破。

这是一个相当醒目的结果,也是 Anthropic 希望外界记住的标题信息。Anthropic 代表之一 Thariq Shihipar 在最近一次 Fireside Chat 活动中讨论这项工作后,在社交媒体上打趣说,这份报告本可以命名为“击败致命三合一”——指的是不受信任输入、敏感数据和代理自治这三者的组合,安全研究人员认为这是对 AI 系统最危险的配置之一。另一位参与讨论的 Anthropic 代表 Cat Wu 表示,公司已经“几乎缓解了我们测试过的每一种攻击”。

而 Willison 本人则保持谨慎的怀疑态度,而非完全信服。他指出,对 720 个精心挑选的攻击场景实现零成功率固然令人鼓舞,但这并不等同于对现实世界对手可能尝试的所有攻击向量都具备防御能力。他特别提出的一种情景是:一个恶意的第三方软件包指示编码代理在执行合法指令之前,先获取并运行额外文件——这些文件可能在过程中悄悄窃取数据。目前还不清楚任何版本的 Claude Code 自动模式 是否能捕捉到这种间接的供应链式攻击,因为这些恶意指令未必会在分类器的视角下表现为“危险指令”。

尚未解决的问题

在整个讨论背后,存在两类截然不同的安全问题,而自动模式未必能同样有效地解决这两类问题。第一类是意外伤害——代理仅仅因为误解了指令,就删除了错误的文件或清空了生产数据库。第二类,也是安全研究人员更为担心的,是蓄意的提示注入,即攻击者将代理信任的内容武器化。

不过,Willison 自己的结论更倾向于一种结构性修复,而不是信任任何单一的安全层,无论它在测试中表现得多好。他表示,与其完全依赖嵌入模型或分类器中的Anthropic AI 安全机制,他现在更有动力去设计那种根本不会赋予 AI 系统访问敏感数据或高危工具权限的代理工作流,即便这些工具被错误触发也不会造成损害。这种姿态与“信任分类器”有本质区别——它把自动模式视为多重防御中的一层,而不是最终解决方案。

同样值得注意的是,Anthropic 并不是唯一一个在这种权衡中挣扎的大型 AI 实验室。据报道,OpenAI 选择不在其最强大的 GPT-5.6 模型上默认启用等效的自动模式,而是采用更为保守的基于审批的方式——这表明,即便在业内,对于默认应给予 AI 编码代理多大自治权,目前也尚无共识。

常见问题

什么是 Claude Code 中的 Anthropic 自动模式?

自动模式是一种设置,它用一个分类器取代了反复出现的人类审批提示,该分类器旨在自动阻止不可逆或危险的工具调用,仅在阻止行为反复出现或遇到真正模棱两可的操作时才回退到手动审批。

自动模式在阻止危险指令方面与人类相比有多有效?

在对 1,053 名付费用户的测试中,自动模式阻止了 89% 的危险指令,而只有 13.6% 的人工测试者拒绝了同样的有害操作——据报道,在一次会话中经过 50 次提示后,人类的警觉性还会进一步下降到约 5%。

自动模式能完全防止提示注入攻击吗?

Trajectory Labs 的独立测试发现,在针对运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 发起的 720 次提示注入攻击中,没有一次成功。话虽如此,像恶意第三方软件包这类可能窃取数据的风险,当前系统可能尚未完全覆盖。

尽管有自动模式,AI 编码代理仍存在哪些安全风险?

代理仍可能因意外而执行具有破坏性的操作,而复杂攻击——尤其是通过恶意第三方代码包发起的攻击——根据对 Anthropic 已公布结果的分析,可能并不能被自动模式的分类器稳定捕获。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”什么是 Claude Code 中的 Anthropic 自动模式?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”自动模式是一种设置,它用一个分类器取代了反复出现的人类审批提示,该分类器旨在自动阻止不可逆或危险的工具调用,仅在阻止行为反复出现或遇到真正模棱两可的操作时才回退到手动审批。”}},{“@type”:”Question”,”name”:”自动模式在阻止危险指令方面与人类相比有多有效?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”在对 1,053 名付费用户的测试中,自动模式阻止了 89% 的危险指令,而只有 13.6% 的人工测试者拒绝了同样的有害操作——据报道,在一次会话中经过 50 次提示后,人类的警觉性还会进一步下降到约 5%。”}},{“@type”:”Question”,”name”:”自动模式能完全防止提示注入攻击吗?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Trajectory Labs 的独立测试发现,在针对运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 发起的 720 次提示注入攻击中,没有一次成功。话虽如此,像恶意第三方软件包这类可能窃取数据的风险,当前系统可能尚未完全覆盖。”}},{“@type”:”Question”,”name”:”尽管有自动模式,AI 编码代理仍存在哪些安全风险?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”代理仍可能因意外而执行具有破坏性的操作,而复杂攻击——尤其是通过恶意第三方代码包发起的攻击——根据对 Anthropic 已公布结果的分析,可能并不能被自动模式的分类器稳定捕获。”}}]}

本文由人工智能协助撰写,并由编辑团队进行审核。

Satoshi Voice
本文在人工智能的支持下完成,并由我们的记者团队审核,以确保准确性和质量。
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST