HomeZ - 横幅首页 itaAgenticRepair 在自动化漏洞修复测试中达到了 73% 的成功率

AgenticRepair 在自动化漏洞修复测试中达到了 73% 的成功率

一个新的研究框架正在解决网络安全领域最持久的瓶颈之一:在漏洞被分级报告标记出来之后,对软件漏洞进行补丁修复这一缓慢且依赖人工的过程。由研究员 Michael Fu 开发的这一系统名为 AgenticRepair,旨在推动自动化漏洞修复更接近安全团队真正可以信任的水平,通过为 AI 代理提供类似人类工程师所依赖、而大多数自动化工具从未能获取的上下文理解能力来实现这一点。

要点总结

  • AgenticRepair 是一个通过其创建者称之为多层面程序上下文工程来实现漏洞修复自动化的框架。
  • 它瞄准了现有工具忽略的三类上下文缺口:代码结构上下文、运行时执行上下文以及提交历史上下文。
  • 在由 300 个真实世界漏洞实例组成的基准 SEC-Bench 上测试时,AgenticRepair 达到了 73% 的成功率。
  • 研究指出,这一结果比测试中最强的基线高出 29%。
  • 消融测试发现这三种上下文类型是互补的,多代理设计和基础模型的容量都会影响性能。

AgenticRepair 为自动化漏洞修复引入多层面上下文工程

AgenticRepair 专门为弥合通用型自动修 bug AI 工具往往忽视的一个缺口而构建:安全漏洞比普通软件缺陷需要更丰富的上下文细节。尽管近期的代理式 AI 方法在广义的自动化程序修复方面展现出真正的潜力,但 AgenticRepair 背后的研究认为,漏洞修复需要更深层、更专业化的理解层次——这类上下文是安全工程师日常手工收集的,而自动化系统很少能自行重建。

弥补关键程序上下文缺口

该框架聚焦于三类被认定为对正确修复安全缺陷至关重要的上下文缺口。第一类是代码结构上下文,它捕获跨文件数据流以及补丁必须遵循的内存操作模式。第二类是运行时执行上下文,它揭示崩溃语义并追踪问题内存行为的实际起源。第三类是提交历史上下文,它有助于还原脆弱或存在漏洞的代码模式最初是如何被引入的。这三层共同构成了研究所描述的、专门为安全工作定制的程序上下文工程的骨干,使 AgenticRepair 有别于为通用 bug 修复而构建的工具。

专门化多代理架构

为了自动收集所有这些上下文,AgenticRepair 依赖三个专门的大型语言模型子代理,每个子代理负责一种已识别的上下文类型。当这些子代理汇总完各自的发现后,这些信息会被直接写入一个独立的专用修复子代理的记忆中,由其据此合成一个受上下文约束的补丁。这种分工方式——每种上下文一个代理,再加上一个修复专家——是该系统处理代理式漏洞修复的核心,也是研究人员认为对框架性能贡献巨大的结构性选择。

性能评估显示在 SEC-Bench 上具有显著优势

AgenticRepair 的真正考验来自 SEC-Bench,这一基准由300 个真实世界漏洞实例组成,补丁有效性通过基于 sanitizer 的验证而非人工审查来检查。在该基准上,该框架取得了 73% 的成功率——研究将这一数字描述为在与最强基线对比时有显著优势,高出 29%。

这一差距意义重大。从实际角度看,这表明向 AI 修复代理提供安全工程师日常使用的那种分层上下文——而不是把漏洞当作普通 bug 来处理——能够产生实质上更好的补丁,而不仅仅是略有改进。对于一个未打补丁的漏洞可能在工程师手动追踪崩溃来源和代码历史的数周时间里暴露在外的行业来说,在一个包含 300 个案例的基准上取得如此幅度的提升,预示着自动化工具在可现实承担的任务范围上出现了真正的转变。

研究人员还进行了消融研究,以检验这三种上下文类型是否都真正必要,或者系统性能是否主要依赖其中一两种。结果证实,代码结构、运行时执行和提交历史上下文是相互补充的——移除其中任何一种都会削弱结果,这进一步强化了这样一个结论:框架的优势来自三者的组合,而不是依赖单一信号。

关键设计洞见与验证方法

除了上下文收集设计之外,研究发现还有两个因素在 AgenticRepair 的有效性中发挥着关键作用:多代理脚手架本身,以及驱动每个子代理的基础语言模型的原始容量。单独看这两个要素都无法解释结果——正是结构化、专门化代理与强大底层模型的结合,推动了在此类大型语言模型安全任务上的性能。

AgenticRepair 生成的每一个补丁在被计为成功之前,都会通过基于 sanitizer 的补丁验证进行检查,使得报告的 73% 这一数字具有具体、可测试的基础,而不是依赖主观审查。综合来看,该框架的设计及其结果使研究得出一个更广泛的结论:多层面程序上下文工程如今已被确立为代理式漏洞修复的一个有前景方向,其他从事自动化漏洞修复的研究团队很可能会在这一方向上继续构建,随着这一领域的成熟不断推进。

常见问题

AgenticRepair 与通用自动化 bug 修复方法有何不同?

AgenticRepair 专注于更丰富的程序上下文——包括代码结构、运行时执行和提交历史上下文——这些对修复安全漏洞至关重要,但通常不会被通用 bug 修复工具系统性地构建出来。

AgenticRepair 如何收集修复漏洞所需的程序上下文?

它协同调度三个专门的大型语言模型子代理来构建代码结构、运行时执行和提交历史上下文,然后将这些上下文交给一个专用修复子代理进行补丁合成。

与以往的漏洞修复方法相比,AgenticRepair 的效果如何?

AgenticRepair 在 SEC-Bench 基准中的 300 个真实世界漏洞上取得了 73% 的成功率,比测试中最强的基线高出 29%。

AgenticRepair 使用何种验证方法来确认补丁的有效性?

AgenticRepair 使用基于 sanitizer 的补丁验证方法,在将补丁计为成功之前确认生成的补丁确实解决了底层漏洞。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”AgenticRepair 与通用自动化 bug 修复方法有何不同?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”AgenticRepair 专注于更丰富的程序上下文——包括代码结构、运行时执行和提交历史上下文——这些对修复安全漏洞至关重要,但通常不会被通用 bug 修复工具系统性地构建出来。”}},{“@type”:”Question”,”name”:”AgenticRepair 如何收集修复漏洞所需的程序上下文?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”它协同调度三个专门的大型语言模型子代理来构建代码结构、运行时执行和提交历史上下文,然后将这些上下文交给一个专用修复子代理进行补丁合成。”}},{“@type”:”Question”,”name”:”与以往的漏洞修复方法相比,AgenticRepair 的效果如何?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”AgenticRepair 在 SEC-Bench 基准中的 300 个真实世界漏洞上取得了 73% 的成功率,比测试中最强的基线高出 29%。”}},{“@type”:”Question”,”name”:”AgenticRepair 使用何种验证方法来确认补丁的有效性?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”AgenticRepair 使用基于 sanitizer 的补丁验证方法,在将补丁计为成功之前确认生成的补丁确实解决了底层漏洞。”}}]}

本文由人工智能协助生成,并由编辑团队审核。

Satoshi Voice
本文在人工智能的支持下完成,并由我们的记者团队审核,以确保准确性和质量。
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST