一项新研究表明,人工智能模型在你的屏幕上“点击”的方式本身,可能会被反过来利用。研究人员发现,在GUI 可视化定位模型(将屏幕上的指令转换为实际点击的 AI 系统)生成坐标的方式中,存在一个此前被忽视的弱点,并构建了一个名为 MissClick 的可行攻击来加以验证。研究结果由研究员 Yu Ran 发布,揭示了随着这些模型越来越多地嵌入到桌面、网页和移动端平台任务自动化中,它们所面临的一类新的针对 GUI 模型的对抗性攻击。
Summary
要点速览
- GUI 可视化定位模型生成屏幕点击坐标时,是以数字 token 序列的形式输出,而不是原始数字。
- 在高位(如百位)上改变一位数字,就可能让点击在屏幕上偏移 100 个单位。
- MissClick 是一种白盒攻击,包含两个变体:用于非定向干扰的 MissClick-U 和用于定向劫持的 MissClick-T。
- MissClick-U 在 OS-Atlas 上实现了 75.07% 的非定向成功率,在 UGround 上为 72.93%。
- MissClick-T 在 OS-Atlas 上实现了 44.86% 的定向成功率,在 UGround 上为 62.67%。
GUI 可视化定位模型如何生成坐标
GUI 可视化定位模型通过逐位输出数字来预测点击位置,而不是输出直接的数值坐标,而这一看似细微的设计选择,实际上带来了真实的安全后果。根据研究,这些模型在设计时从未考虑过对数字级别操纵的对抗性防护,而这正是 MissClick 所利用的空隙。
数字序列化的坐标预测
这些模型并不是将 X-Y 坐标作为一个整体数字输出,而是将其生成为一串单个数字 token,随后再解析为可用的数值,并映射到屏幕上的实际点位。每个数字 token 在模型中本质上被当作一个类别选择来处理,类似于从词表中选一个词,而不是被视为连续数字的一部分。
数字位权对坐标偏移的影响
一旦这些数字被重新解析为数值,这种区别就变得极其重要。研究发现,只需将百位数字改变 1,就能在坐标转换为屏幕位置后,让对应的坐标分量偏移 100 个单位。实际而言,对单个 token 做出极小、几乎不可见的调整,就能让点击大幅偏离其原本目标——这反映了模型“理解”数字的方式与这些数字在变成真实像素后实际行为之间的不一致。
MissClick:针对 GUI 定位模型的对抗性攻击
在这一发现的基础上,研究者提出了 MissClick,这是一种白盒对抗性攻击,专门用来利用“类别化数字预测”与“数值坐标输出”之间的不匹配。与以往 GUI 模型遭遇的通用对抗性攻击不同,MissClick 是围绕数字序列化坐标的位权结构专门设计的,而不是将输出当作普通文本来处理。
攻击变体:MissClick-U 和 MissClick-T
MissClick 根据攻击者的目标分为两种截然不同的形式。MissClick-U 是非定向版本,其目的只是让模型点错位置——只要点击落在正确区域之外就算成功。MissClick-T 则是定向版本,旨在将点击引导到攻击者指定的特定区域,而不是仅仅随机偏离。
不同的攻击目标与优化策略
这两个变体依赖不同的数学目标函数,因为非定向和定向干扰的成功条件不同。MissClick-U 通过最大化研究中称为软坐标位移的量来工作,本质上是尽可能把预测点击推离其正确位置。MissClick-T 则最小化“位权重目标数字损失”,这一技术会优先操纵高位数字,因为在坐标被解析时,这些高位会带来最大的跳变。这种“定向 vs 非定向”的划分反映了GUI 可视化定位安全研究中的一个更广泛观点:攻击者会根据自己是追求混乱还是精确控制,采用不同的优化方式。
实验评估与攻击成功率
两个 MissClick 变体在两个既有基准数据集 OS-Atlas 和 UGround 上,与现有攻击方法进行了对比测试,这两个数据集涵盖桌面、网页和移动端的定位任务。结果表明,这种数字序列化坐标漏洞并不是边缘案例——它可以在大规模上被利用,两种攻击类型的表现都显著优于以往方法。
OS-Atlas 与 UGround 上的非定向攻击表现
MissClick-U 在 OS-Atlas 上取得了75.07% 的非定向成功率,在 UGround 上为 72.93%,分别比现有攻击基线高出 16.62 和 30.72 个百分点。这是所有用于非定向干扰的目标函数中最高的分数,研究将这一优势归因于软坐标位移方法。
OS-Atlas 与 UGround 上的定向攻击表现
MissClick-T 在定向攻击方面的数据同样引人注目:在 OS-Atlas 上的成功率为44.86%,在 UGround 上为 62.67%,分别比先前方法高出 31.73 和 47.06 个百分点。这里报告的MissClick 攻击成功率证实,当攻击者追求精确而非单纯破坏时,“位权重目标数字优化”是当前最强的策略,因为它在研究中持续优于其他被测试的定向目标函数。
综合来看,非定向与定向表现之间的差距凸显了一种现实矛盾:将点击劫持到某个特定点本身就比单纯让模型点错更难,因为这需要同时控制多个数字位,而不是只把某一位往外推。这种不对称性可能会影响未来防御措施的优先级:一个能抵御随机误点的模型,并不一定能抵御精确重定向——对于任何依赖自动点击来完成真实任务的系统而言,这一差别都至关重要。
常见问题
MissClick 在 GUI 定位模型中利用的主要漏洞是什么?
MissClick 利用了数字序列化坐标生成过程:每一位数字都是一个类别 token,而高位数字的变化在这些 token 被解析为数字后,会导致坐标产生大幅偏移。
MissClick 攻击有哪两个变体?它们的目标是什么?
MissClick-U 是一种非定向攻击,通过最大化坐标位移来普遍干扰点击;而 MissClick-T 是一种定向攻击,通过最小化位权重目标数字损失,将坐标劫持到攻击者指定的区域。
MissClick 在不同数据集上的效果如何?
MissClick-U 在 OS-Atlas 上实现了约 75% 的非定向成功率,在 UGround 上约为 73%;而 MissClick-T 在 OS-Atlas 上实现了约 45% 的定向成功率,在 UGround 上约为 63%。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”MissClick 在 GUI 定位模型中利用的主要漏洞是什么?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”MissClick 利用了数字序列化坐标生成过程:每一位数字都是一个类别 token,而高位数字的变化在这些 token 被解析为数字后,会导致坐标产生大幅偏移。”}},{“@type”:”Question”,”name”:”MissClick 攻击有哪两个变体?它们的目标是什么?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”MissClick-U 是一种非定向攻击,通过最大化坐标位移来普遍干扰点击;而 MissClick-T 是一种定向攻击,通过最小化位权重目标数字损失,将坐标劫持到攻击者指定的区域。”}},{“@type”:”Question”,”name”:”MissClick 在不同数据集上的效果如何?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”MissClick-U 在 OS-Atlas 上实现了约 75% 的非定向成功率,在 UGround 上约为 73%;而 MissClick-T 在 OS-Atlas 上实现了约 45% 的定向成功率,在 UGround 上约为 63%。”}}]}
本文在人工智能协助下完成,并由编辑团队进行审核。

