安全研究人员长期以来一直希望,大型语言模型代理能够加速事件响应中最繁琐的部分之一:利用分散的日志和遥测数据,一步步拼凑出攻击者是如何在系统中移动的。一个名为DiagChain的新诊断基准将这一期望置于检验之下,而结果表明,这项技术在能够可靠地独立处理攻击链重建之前,还有很长的路要走。
DiagChain 由包括刘旭阳、韩一斌、张振伟、常凯、徐志伟、邱天、邓伟贤、高佳宝、彭小林、万海和赵锡斌在内的研究团队开发,它不仅仅是另一个准确率排行榜。它专门用于展示当 LLM 代理尝试基于系统遥测中提取的证据,重建攻击者采取的有序行动序列时,在何处以及为何会失败。
Summary
关键要点
- DiagChain 是一个诊断基准,用于评估 LLM 代理在基于证据的攻击链重建上的表现,超越了简单的通过/失败式准确率评估。
- 该基准的 MAIN-69 套件包含 69 个场景,涵盖多种操作系统、不同的证据噪声水平以及不同的链路长度。
- 一种名为 ECRAG 的新方法,将证据检索与正在被重建的链的不断演化的结构化表示配对。
- 在测试的 6 个不同 LLM 中,最佳配置在 849 个参考步骤中仅有 39.6% 成功。
- 较小的模型几乎无法利用检索到的证据,而较大的模型主要在将这些证据按正确顺序排列方面遇到困难。
DiagChain 简介:一个用于攻击链重建的新基准
DiagChain 的存在,是因为大多数现有基准只关注最终输出或整体准确率分数,对错误在代理推理过程中是如何形成的几乎没有洞察。对于试图判断某个 AI 代理是否足够可信、可以帮助分流真实入侵事件的网络安全团队来说,这是一个重要的缺口。
DiagChain 的目的与范围
从本质上讲,DiagChain 是为基于证据的网络安全任务构建的诊断基准。它并非只是评判代理最终的攻击叙事是对是错,而是分别评估重建过程的每一个阶段。这种分阶段的方法让研究人员能够精确定位 LLM 代理推理崩溃的具体环节——无论是证据收集阶段、证据解读阶段,还是将事件排序为连贯链条的阶段。
MAIN-69 场景套件的构成
该基准的核心是 MAIN-69,一个包含 69 个场景的套件,旨在在一系列真实条件下对代理进行压力测试。这些场景跨越多种操作系统,在证据中混入的噪声程度各不相同,链路长度也有差异——意味着有些攻击序列较短,而另一些则需要跟踪更长的一串攻击者行为。这种多样性旨在暴露一个问题:当条件变得更混乱时,而不是在一切都干净、简单时,代理的表现是否依然可靠。
方法创新与评估指标
除了场景套件之外,DiagChain 还引入了自己的检索方法和一个由五部分组成的评分体系,二者都旨在让失败诊断变得系统化,而不是凭感觉猜测。
以证据为中心的检索增强生成(ECRAG)
论文的关键贡献之一是ECRAG,即 Evidence-Centric Retrieval-Augmented Generation(以证据为中心的检索增强生成)。与标准的检索增强生成设置不同,ECRAG 将证据检索与代理试图重建的链的不断演化的结构化表示相结合。实际上,这意味着系统不会只是一次性拉取相关证据然后继续往下走;它会在新证据到来时持续更新其内部的攻击链图景,理论上应当有助于代理更连贯地跟踪复杂的多步入侵。
用于诊断评估的五个互补指标
为了弄清问题出在哪里,DiagChain 依赖五个互补指标,每个指标都针对重建过程中的一个特定阶段。综合来看,这些指标允许研究人员隔离具体的失败点,而不是把所有错误都归入一个笼统的准确率数字。这正是该基准的价值所在:一种诊断式评估,能够区分“代理没有找到正确的证据”和“代理找到了证据但把事件顺序搞错了”,比单一的通过/失败分数更有助于改进这些系统。
大型语言模型的性能评估
那么当今的模型表现如何?根据该基准的结果来看,并不算理想。
使用六个 LLM 的实验设置
研究团队使用六个不同的 LLM 在 MAIN-69 场景上进行了评估。这样的设置让他们能够比较不同能力水平的模型,在相同的基于证据的重建任务、相同的噪声条件和链路长度挑战下的表现,从而为横向性能比较提供一致的基础。
关键性能结果与成功率
最醒目的数字是:在研究中表现最好的配置,在 MAIN-69 中包含的 849 个参考步骤中,仅有 39.6% 获得成功。换句话说,在与基准的真实步骤进行对比时,测试中最强的配置在攻击者行为序列上仍有超过 60% 的时间是错误的。对于任何希望现在就把攻击链重建完全交给 AI 代理的人来说,这是一个相当现实的警示。
关于模型规模与重建挑战的洞察
这为什么在原始数字之外还重要?因为失败模式会随模型规模而变化,而这种差异指向了两类截然不同、需要解决的工程问题。
小模型的局限性
根据研究人员的分析,较小的模型在一个比正确排序事件更基础的问题上挣扎:它们难以在输出中真正融入检索到的证据。这表明,小模型的瓶颈更早地出现在流程中——在证据需要真正影响代理推理的阶段,而不是被忽略或被错误使用的地方。
大模型在证据排序上的挑战
较大的模型更成功地跨过了第一道门槛,能够在重建过程中走得更远。但它们遇到了另一堵墙:如何正确地对已收集的证据进行排序,成为主要瓶颈。这是一种更微妙的失败模式,因为模型已经拥有正确的“拼图块”,却难以将其排列成准确的攻击者行为序列——而这恰恰是对真实安全调查最重要的输出。
这种分化对于任何在安全运营中构建或部署LLM 评估基准工具的人来说都很重要。它意味着,仅仅扩大模型规模并不会自动解决攻击链重建问题。这两种失败模式需要不同的修复路径:小模型需要更好的证据整合能力,而大模型则需要更好的排序或推理策略,而不是一条通用的改进路线。
研究人员将这些发现视为对诊断式评估优于简单端到端准确率分数的一种验证。一个单一的汇总数字或许能告诉安全团队,一个模型“有 40% 的时间是对的”,但它不会告诉他们,这种失败是源于证据遗漏、证据误读,还是顺序混乱。DiagChain 的分阶段指标旨在弥补这一缺口,为今后改进基于证据的网络安全代理提供作者所称的“可操作洞察”。
常见问题
DiagChain 旨在评估什么?
DiagChain 旨在通过诊断式、分阶段评估,考察大型语言模型代理在基于证据的攻击链重建任务中的表现。
MAIN-69 场景套件涵盖哪些内容?
MAIN-69 包含 69 个场景,覆盖多种操作系统、不同的证据噪声水平以及不同的攻击链长度。
ECRAG 方法如何改进攻击链重建?
ECRAG 将证据检索与重建链的不断演化的结构化表示相结合,以辅助链路分析。
该基准中为 LLM 识别出的主要性能挑战是什么?
较小的模型难以整合检索到的证据,而较大的模型则在重建中正确排序证据方面面临挑战。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”DiagChain 旨在评估什么?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”DiagChain 旨在通过诊断式、分阶段评估,考察大型语言模型代理在基于证据的攻击链重建任务中的表现。”}},{“@type”:”Question”,”name”:”MAIN-69 场景套件涵盖哪些内容?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”MAIN-69 包含 69 个场景,覆盖多种操作系统、不同的证据噪声水平以及不同的攻击链长度。”}},{“@type”:”Question”,”name”:”ECRAG 方法如何改进攻击链重建?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”ECRAG 将证据检索与重建链的不断演化的结构化表示相结合,以辅助链路分析。”}},{“@type”:”Question”,”name”:”该基准中为 LLM 识别出的主要性能挑战是什么?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”较小的模型难以整合检索到的证据,而较大的模型则在重建中正确排序证据方面面临挑战。”}}]}
本文在人工智能协助下完成,并由编辑团队进行审核。

