长期以来,安全团队一直面临一个顽固难题:最能刻画攻击者作案方式的情报——那些细节丰富、叙事性强的网络威胁情报(Cyber Threat Intelligence,CTI)报告——以一种计算机难以进行推理的形式存在。一项发表在 arXiv 上的研究论文提出了一个新的自动化框架,正面瞄准这一鸿沟:将非结构化的威胁叙事转化为机器可读的网络威胁攻击链,从而让逻辑推理引擎可以真正对其进行遍历。
Summary
关键要点
- CTI 报告以叙事形式描述真实世界攻击,但无法直接用于自动化的攻击路径推理。
- 该框架将每个攻击步骤建模为一个攻击单元——由前置条件、攻击行为和后置条件组成的结构化三元组。
- 一个由大型语言模型驱动的多阶段流水线,从原始 CTI 文本中抽取、规范化并修复这些攻击单元。
- 在包含 334 个经人工验证步骤的 20 份 CTI 报告上,Datalog 推理在20 份报告中的 19 份中成功到达指定攻击目标,并通过反向搜索发现了34 条攻击路径。
- 在覆盖率、完整性和一致性方面,该框架优于具有代表性的 CTI 抽取系统和端到端 LLM 基线方法。
从 CTI 报告中抽取结构化知识的挑战
威胁情报报告是网络安全领域信息密度最高的文档之一。它们记录了攻击者的工具链、横向移动技术、权限提升序列以及最终目标——通常由亲历入侵全过程的分析师撰写。但这种丰富性也带来了代价:知识被埋在自由形式的散文中,而不是结构化数据里。
这种非结构化特性使得自动化 CTI 抽取变得真正困难。人类分析师阅读报告时,会在脑海中构建一条时间线来理解发生了什么。自动化系统没有这种等价的捷径。它无法轻易推断出:第三步之所以成为可能,是因为第二步建立了某种特定的系统状态。
现有抽取工具遗漏了什么
大多数现有 CTI 抽取方法侧重于提取入侵指标(IOC)——IP 地址、文件哈希、域名——或是将战术、技术与程序(TTP)标注到 MITRE ATT&CK 等框架上。这些输出固然有用,但本质上是“扁平”的。它们告诉你发生了什么,却没有编码出为什么某个动作会使下一个动作成为可能。
核心限制在于缺乏执行条件。若不知道攻击者在运行某条命令之前系统处于什么状态,以及之后系统变成了什么状态,就无法把各个步骤串联成一条连贯的攻击路径。状态匹配和可达性分析——也就是让防御者能够询问“攻击者是否真的可以从这个起点到达那个目标?”的操作——在仅有标签级抽取的前提下根本无法实现。
提出的攻击链自动化抽取框架
这项研究提出了一个围绕更丰富分析单元来重构抽取问题的框架。它不再只抽取单个入侵指标或 TTP 标签,而是将攻击的每一步建模为一个攻击单元:一个由前置条件、攻击行为和后置条件组成的结构化对象。前置条件刻画在该步骤执行前,环境中必须满足的事实;后置条件刻画执行后会变成真的事实。二者结合,使得我们可以推理某一步是否能够衔接到下一步。
由大型语言模型辅助的多阶段抽取流水线
从原始文本中构建这些攻击单元,正是大型语言模型发挥作用的地方——但它们并非作为单一的端到端生成器,而是作为多阶段攻击分析流水线中的组件。该流水线按顺序工作:首先从 CTI 叙事中抽取攻击行为骨架,然后为每个行为恢复前置条件和后置条件,接着将所有组件规范化为预定义谓词集合,最后修复任何会导致攻击链断裂的依赖关系。
最后这一步修复在分析上尤为重要。真实的 CTI 报告并不是按工程规范来写的。作者会省略他们认为显而易见的假设,跳过中间步骤,或者只描述结果而不点明原因。如果系统不主动填补这些空白,就会生成充满逻辑漏洞的攻击链——表面上看似完整,实际上却无法真正被遍历。修复阶段正面解决了这一问题。
完整流水线的输出是一组已经规范化且内部一致的攻击单元——它们不再只是被编目,而是可以直接交给推理引擎使用。
逻辑推理与评估结果
一旦抽取完成,这些攻击单元会被编译为Datalog 风格规则。Datalog 是一种非常适合可达性查询的逻辑编程语言:给定一组事实和规则,系统能否推导出某个指定目标状态是可达的?以这种方式来刻画攻击链,将一个知识抽取问题转化为一个形式化推理问题——而且有清晰的成功判据。
编译为 Datalog 风格规则以进行可达性分析
每个攻击单元都会变成一条规则:如果前置条件成立,则后置条件随之成立。将这些规则串联起来,推理引擎就可以询问:在 CTI 报告所描述的行为下,从一个初始立足点出发,某个特定攻击目标——例如完全攻陷域控——是否可达。这与仅仅知道某个 TTP 被观测到是截然不同的能力,差别就像只拿到一份食材清单,和拿到一份已经验证过结果的菜谱之间的差异。
在标注 CTI 报告上的表现
评估数据集由20 份 CTI 报告组成,包含334 个经人工验证的标注步骤。在该数据集上,该框架在标注步骤覆盖率方面优于具有代表性的 CTI 抽取系统——也就是说,它恢复了更多被人类分析师认定为重要的攻击行为。
Datalog 推理引擎在20 份报告中的 19 份中到达了指定攻击目标。对生成规则集进行反向搜索,共得到 34 条不同的攻击路径。这个数字很关键:找到通往同一目标的多条路径,揭示了攻击者策略中的冗余性,也让防御者更全面地了解需要在哪些地方堵住漏洞。
相较端到端 LLM 基线的优势
与端到端大型语言模型基线方法相比——后者通过一次提示让单个模型直接生成完整攻击单元——该结构化流水线生成的攻击单元在完整性和一致性上都有可量化的提升。端到端生成往往会产生看起来合理、但实际上遗漏前置条件或生成与先前步骤相矛盾后置条件的输出。相比之下,分阶段方法强制要求分别抽取并规范化每个组件,然后再进行组装,从而减少了漂移和遗漏。
这正是该研究中更深层的方法论洞见。大型语言模型在从非结构化文本中抽取语义方面非常强大,但若任其自由发挥,它们并不是可靠的逻辑结构设计者。将其封装进一个有纪律的流水线中——让每个阶段承担具体且边界清晰的任务——似乎可以重新找回在无约束生成中丢失的一致性。
这对威胁情报与防御意味着什么
在实践层面,这意味着防御者原则上可以将一份新发布的 CTI 报告输入类似的系统中,得到的不仅是一份攻击者行为摘要,还包括一个机器验证的答案:在给定的入口点下,基于报告中描述的技术序列,对手是否能够到达我们的关键资产?这种攻击目标可达性分析,历史上一直需要经验丰富的分析师手工完成——既缓慢又昂贵,难以适应组织所接收威胁情报的规模。
这里还传递出一个关于结构化推理在 AI 辅助安全中的角色的更广泛信号。随着组织将大型语言模型整合进安全运营,人们很容易倾向于把它们当作“万能解题器”。而这项研究的结果则勾勒出一个更细腻的图景:与形式化推理引擎配合使用的 LLM,可能比二者单独使用更强大,正是因为它们可以互补彼此的弱点。源代码和实验工件已在一个匿名仓库中开放,为独立验证和扩展留出了空间。
常见问题
为什么从 CTI 报告中抽取攻击链很困难?
CTI 报告是描述真实世界攻击的非结构化叙事,这使得自动化攻击路径推理变得困难。报告中的文字会省略假设、跳过中间步骤,也不会编码那些决定一个攻击步骤能否衔接到下一步的系统状态。
该框架相较现有 CTI 抽取方法有哪些改进?
它用前置条件、行为和后置条件来建模每个攻击步骤,并通过多阶段语言模型流水线来抽取和规范化这些组件——其中包括一个修复阶段,用于修补断裂的依赖关系。这使得状态匹配和可达性推理成为可能,而这些是仅有标签级抽取方法无法支持的。
Datalog 推理在该框架中扮演什么角色?
抽取出的攻击单元会被编译为 Datalog 风格规则,使系统能够执行可达性推理,并识别通往指定目标的攻击路径。这将抽取到的知识转化为关于攻击者能实现什么的、可形式化验证的结论。
该框架的性能是如何评估的?
在包含 334 个经人工验证标注步骤的 20 份 CTI 报告上,该框架在覆盖率方面优于具有代表性的 CTI 抽取系统,并生成了比端到端 LLM 基线更完整的攻击单元。基于 Datalog 的可达性分析在 20 份报告中的 19 份上取得成功,反向搜索共识别出 34 条不同的攻击路径。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”为什么从 CTI 报告中抽取攻击链很困难?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”CTI 报告是描述真实世界攻击的非结构化叙事,这使得自动化攻击路径推理变得困难。报告中的文字会省略假设、跳过中间步骤,也不会编码那些决定一个攻击步骤能否衔接到下一步的系统状态。”}},{“@type”:”Question”,”name”:”该框架相较现有 CTI 抽取方法有哪些改进?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”它用前置条件、行为和后置条件来建模每个攻击步骤,并通过多阶段语言模型流水线来抽取和规范化这些组件——其中包括一个修复阶段,用于修补断裂的依赖关系。这使得状态匹配和可达性推理成为可能,而这些是仅有标签级抽取方法无法支持的。”}},{“@type”:”Question”,”name”:”Datalog 推理在该框架中扮演什么角色?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”抽取出的攻击单元会被编译为 Datalog 风格规则,使系统能够执行可达性推理,并识别通往指定目标的攻击路径。这将抽取到的知识转化为关于攻击者能实现什么的、可形式化验证的结论。”}},{“@type”:”Question”,”name”:”该框架的性能是如何评估的?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”在包含 334 个经人工验证标注步骤的 20 份 CTI 报告上,该框架在覆盖率方面优于具有代表性的 CTI 抽取系统,并生成了比端到端 LLM 基线更完整的攻击单元。基于 Datalog 的可达性分析在 20 份报告中的 19 份上取得成功,反向搜索共识别出 34 条不同的攻击路径。”}}]}
本文在人工智能协助下完成,由编辑团队进行审核。

