HomeAI比特翻转攻击VLA模型:5次翻转将机器人成功率降至0%

比特翻转攻击VLA模型:5次翻转将机器人成功率降至0%

依赖视觉-语言-动作(VLA)模型在物理世界中进行感知、推理和行动的机器人,可能存在一个隐藏的薄弱环节:它们自身的内存芯片。新的研究表明,比特翻转攻击 VLA 模型所面临的威胁并非只是理论上的好奇心产物——在量化模型权重中精确选取并篡改少量比特,就能让机器人的任务成功率直接跌到零,即使在此之前模型看起来一切正常。

这一发现来自一项题为《Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability》(《针对视觉-语言-动作模型的比特翻转攻击:动作解码架构塑造脆弱性》)的研究,作者包括 Yudong Gao、Linghan Chen、Wenhan Wu、Mia Zhou、Jiyao Wang、Kaiyan Ji、Mingyu Guo 和 Honglong Chen。这是首个专门针对 VLA 系统的已公开比特翻转攻击研究,并且出现在具身智能(将语言理解与物理行动结合的模型)正快速从研究实验室走向真实机器人部署的关键时刻。

量化 VLA 模型对 Rowhammer 比特翻转攻击的关键脆弱性

量化后的 VLA 模型暴露在一种特定的硬件层威胁之下:Rowhammer 风格的故障会破坏模型在压缩部署后所依赖的 INT8 权重。量化是让大型 AI 模型在机器人硬件上高效运行的常见做法,但研究人员发现,正是这一步压缩操作打开了一条狭窄却危险的故障攻击面。

Rowhammer 是一种已知的硬件攻击类型,通过反复访问内存行来诱发相邻行中非预期的比特翻转,实质上在无需突破软件层防御的情况下,将 0 翻转为 1 或反之。一旦将其应用到 VLA 模型的存储权重上,意味着攻击者无需入侵 AI 的训练流水线或窃取其代码——他们只需要在已部署的内存中,在正确的位置翻转正确的比特即可。

这一发现之所以格外引人注目,在于刻意破坏与偶然破坏之间的鲜明对比。随机比特翻转即便数量巨大,对模型性能的影响也相对有限。数百个随机分布的翻转几乎没怎么削弱系统。但当研究人员利用梯度信息来选择要翻转的比特时,结果发生了剧烈变化——少量精心挑选的翻转就能将闭环任务成功率降到0%

攻击效果与架构相关的脆弱性

比特翻转攻击对 VLA 模型造成的严重程度,很大程度上取决于模型如何将内部推理转化为物理动作。这类攻击造成的损伤并不会在模型参数中均匀扩散——而是集中在少数几个动作生成层中,而这些层的脆弱程度又与底层动作头(action-head)架构密切相关。

梯度选择比特翻转 vs 随机比特翻转

随机翻转与定向翻转之间的差距,是整项研究中最清晰的信号。随机破坏即便规模很大,也让模型基本保持接近正常的功能。相比之下,基于梯度选择的破坏只需少量翻转就具有毁灭性。这并不是一个关于通用硬件脆弱性的故事——而是关于精度的故事。一个了解模型决策最敏感位置的攻击者,可以用远少于随机噪声所需的努力造成灾难性失败,而随机噪声即便数量大得多,也难以产生同等效果。

按动作解码头类型划分的脆弱性

在跨越三种不同动作头家族的四个模型变体中,研究人员发现,要击垮一个系统所需的比特翻转数量,会随着架构的不同而出现巨大差异。直接回归(direct regression)和基于 token 的策略表现得非常脆弱,只需 1 到 5 次翻转就会崩溃。相比之下,流匹配(flow-matching)策略则需要大得多的预算——大约 100 到 300 次翻转——才能达到同样的崩溃效果。

这种差异对评估机器人 AI 安全性的任何人都很重要,因为它表明架构选择不仅仅是性能或精度上的决策——也是安全决策。一个基于直接回归头构建的模型,也许在效率和响应性上表现出色,但同时也可能为攻击者提供了一个更容易命中的目标。

研究团队还提出了一种固定方向的流形逃逸损失(fixed-direction manifold-escape loss)攻击,这是一种精细化技术,能显著减少击垮更具抗性的模型所需的翻转次数。应用于名为 π0 的流匹配策略时,这种方法将所需预算从大约 1,000 次翻转削减到约 100 次。配套的五方向扫描进一步证实,该攻击的有效性并不限于“全部为正”的比特翻转方向,这意味着这种脆弱性并非狭窄的边缘案例——它在不同方向策略下都成立,从而强化了这一缺陷在广泛场景中可被利用的程度。

缓解策略与现实世界影响

只保护模型权重中一小部分,就能在实质上削弱这类攻击。在直接头架构上,仅屏蔽3.1%的权重,即便模型遭受 100 次翻转,仍能保持 60% 的任务成功率。保护稍大一些的比例——5.3% 的权重——则将模型开环性能崩溃的临界点,从仅 3 次翻转推高到 100 次,在相对有限的保护范围内带来了显著的韧性提升。

一旦研究人员从仿真转向真实机器人,现实世界的风险就变得具体可感。在一台实体机器人上,使用 100 次比特翻转的任务校准模拟攻击,导致 20 次任务尝试中 0 次成功。相比之下,干净、未受攻击的模型在 20 次尝试中成功了 14 次,而遭受随机(非定向)比特翻转的模型仍然完成了 20 次中的 16 次。随机干扰与有意、梯度引导攻击之间的差别并非渐进式的——而是一个能正常工作的机器人与一次都无法成功的机器人之间的差别。

重要性何在:随着具身 AI 系统从实验室走进仓库、家庭和工业环境,被攻陷模型的物理后果不再是抽象概念。一个被破坏的 VLA 模型不仅仅会输出错误文本——它还可能导致机械臂在现实世界中错位、掉落或错误处理某个物理任务。研究人员的表述相当直接:权重完整性是具身基础模型的安全边界,其重要性与更为人熟知的数据投毒或对抗样本输入相当,但运行在更底层、贴近硬件的层面上,用传统软件监控手段要难以察觉得多。

该研究的作者已将配套代码作为补充材料发布,为其他研究人员提供了复现和拓展这些发现的途径——这一步既可能加速攻击研究,更重要的是,也能加速开发相应的防御技术。

常见问题(FAQ)

VLA 模型容易受到哪种类型的比特翻转攻击?

VLA 模型容易受到针对量化 INT8 权重的 Rowhammer 风格比特翻转攻击,这类攻击会严重削弱模型性能。

梯度选择的比特翻转与随机比特翻转在影响上有何不同?

梯度选择的比特翻转会将闭环成功率大幅压低至零,而数百次随机比特翻转的影响则微乎其微。

VLA 模型的哪些部分最容易受到比特翻转攻击?

比特翻转造成的损伤集中在少数几个动作生成层中,其脆弱性强烈受动作头架构影响。

保护一部分模型权重能否提升对比特翻转攻击的鲁棒性?

可以,保护3.1%到 5.3% 的权重就能显著提升鲁棒性,即便在遭受攻击时也能保留相当比例的任务成功率。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”VLA 模型容易受到哪种类型的比特翻转攻击?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”VLA 模型容易受到针对量化 INT8 权重的 Rowhammer 风格比特翻转攻击,这类攻击会严重削弱模型性能。”}},{“@type”:”Question”,”name”:”梯度选择的比特翻转与随机比特翻转在影响上有何不同?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”梯度选择的比特翻转会将闭环成功率大幅压低至零,而数百次随机比特翻转的影响则微乎其微。”}},{“@type”:”Question”,”name”:”VLA 模型的哪些部分最容易受到比特翻转攻击?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”比特翻转造成的损伤集中在少数几个动作生成层中,其脆弱性强烈受动作头架构影响。”}},{“@type”:”Question”,”name”:”保护一部分模型权重能否提升对比特翻转攻击的鲁棒性?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”可以,保护 3.1% 到 5.3% 的权重就能显著提升鲁棒性,即便在遭受攻击时也能保留相当比例的任务成功率。”}}]}

本文在人工智能协助下完成,并由编辑团队进行审核。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST