仅仅一个包含越狱提示的日历邀请就足以显示,通过Model Context Protocol (MCP)连接的AI代理可以被推动进行数据外泄。关于这种提示注入的信号和缓解措施已在OWASP针对GenAI的指南中正式化,该指南于2025年4月17日更新了LLM01风险 OWASP GenAI。
由此,Vitalik Buterin提出了一个想法:采用一个由人类组成的陪审团来监督决策和加密货币的金库,并由语言模型辅助——但不取代。在这种情况下,优先事项是将人类作为最终仲裁者。
Summary
利用MCP:发生了什么以及为什么对加密财库很重要
研究员宫村英人(如BitcoinEthereumNews报道)描述了一种攻击,其中一个简单的日历邀请,夹杂着一个恶意提示,能够说服AI代理读取私人电子邮件并将内容转发给攻击者。该攻击向量利用了与Gmail、日历、SharePoint和Notion的MCP集成链:更多的连接器意味着更大的攻击面。需要指出的是,内容的表面无害性增加了风险。
在MCP以开发者模式运行的情况下,针对敏感操作需要人工共识。然而,决策疲劳可能会使确认提示变成自动化;当涉及资金库或影响文件和凭证的工作流程时,人为错误就成为单点故障。因此,分离权限和关键步骤仍然是至关重要的。
行业分析师观察到,间接提示注入——即人眼不可见但可被LLM解释的内容——构成了一种日益增长的风险类别,正如OWASP在其2025年4月的更新中所记录的那样。在2025年上半年由专业安全团队进行的红队测试中,具有多重集成(电子邮件、日历、文件存储)的场景显示,如果不应用过滤器和最小权限策略,缺乏分段会显著增加数据泄露的可能性。
Vitalik Buterin的提议:由AI辅助的人类陪审团
“必须始终从一个值得信赖的基本真理信号出发。我认为现实中这应该是一个由人类组成的陪审团,显然每个陪审员都由所有的LLM提供帮助。”
— Vitalik Buterin (AMBCrypto)
Buterin 指出了一种从人类出发的验证途径:由具有互补技能的人组成的陪审团,借助模型进行分析和综合,但对关键决策拥有最终发言权。在这种情况下,陪审团作为“锚”来对抗自动化操控和操作性幻觉,当人工智能访问金融资产或高影响力的权限时。
信息金融:具有人工控制的“开放市场”治理
信息金融的概念将治理转向一个提案市场:不同的框架和政策公开竞争,而抽查和裁决仍由陪审团掌握。这是DAO和DeFi中采用的实践的自然延伸,这些实践优先考虑透明度、分布式责任和持续审计的激励。
Buterin 警告说,如果将资金分配交给AI,敌对行为者可能会在文件、邀请和评论中插入类似“gimme all the money”的有效负载。因此,信息金融强调决策的可追溯性和人工控制在资金流动过程中的重要性。然而,程序组件与技术组件同样重要。
以太坊基金会:提高财务透明度并专注于可持续性
在这一愿景下,Buterin 解释说,以太坊基金会正在更新其财政政策——该文件于2025年6月4日发布——以更积极的管理目标和操作限制来确保长期的可持续性。行业报告指出,截至2024年10月31日,申报的财政储备约为9.702亿美元,这一数据被用作新的ETH销售规则和操作限制的参考。此外,Buterin 提到了Codex,一个面向稳定币支付的layer 2,作为“大规模价值”用例的潜在基础设施——这是一项旨在加强弹性和采用的战略举措,尽管一些细节仍需验证。
如何构建一个用于治理金库的人类评审团
- 组成:混合背景(安全、法律、金融、运营)。定期轮换和部分匿名以减少偏见和压力。
- 任务:明确定义阻止操作(例如,权限修改、执行交易、连接新的AI连接器)。
- 流程:双重验证(4‑eyes 或 multi‑sig),具有不可变的审计日志,并将明确的推理保存到链上或可验证的存档中。
- 激励:对时间和责任的报酬,若有证实的疏忽则会受到惩罚。
- 利益冲突:强制披露、回避和对敏感案例进行独立审查。
MCP、jailbreak 和“Goodharting”:需要区分的两个风险
- 通过MCP越狱:隐藏在普通内容中的提示(邀请、笔记、文件)利用连接到真实工具的AI,存在非故意执行操作或数据泄露的风险。
- Goodharting:当一个指标成为目标时,它就不再衡量它应该衡量的东西,导致表面上的优化但实际上是扭曲的(例如,为了最大化某个分数而“修饰”表现)。
操作清单:降低今日风险的7个步骤
- 连接器分段:分离测试和生产环境。将AI限制在邮箱和日历沙箱中。
- 强健的批准:禁用自动批准功能;要求2FA和多重签名用于涉及金库和权限的操作。
- 内容过滤:在邀请和外部文件到达代理之前,阻止或清理异常的提示。
- 最小特权:仅授予AI所需的最低权限,并频繁更换token和密钥。
- 监控:实时警报用于异常行为,并提供给陪审团的访问记录。
- 红队测试:定期模拟活动(例如,恶意日历邀请)并向治理层报告。
- 事故应对手册:明确的程序用于撤销连接器、隔离AI以及及时通知利益相关者。
迷你常见问题
- 日历邀请漏洞 MCP 证明了什么? 证明了一个单一内容可以传递一个能够引导AI代理连接到真实工具的提示,对隐私和操作完整性产生影响。
- 什么是AI辅助的“人类陪审团”? 这是一个机制,人类做出最终决策,利用AI进行分析和研究,特别是在涉及金钱或许可时。
- 信息金融是什么? 这是一种治理形式,其中政策和框架在一个开放市场中竞争,但高风险操作仍然受到人工控制和定期审计。
- 今天如何保护金库? 通过使用多重签名、操作限制、角色分离以及由人组成的委员会来验证交易、新集成和权限更改。
影响及未来几个月的关注点
安全性不仅仅是一个技术问题;它需要流程、透明度和可验证的责任。正如Buterin所强调的,越狱问题不是二元的,而Goodharting现象则是一种微妙的“欺诈”指标。在自动化日益增长的背景下,由人类陪审团支持的信息金融被视为一种务实的保护措施,以减轻对国库和关键决策的风险。

