HomeAI概念推理指数:最佳人工智能模型得分为73.6,上限为91

概念推理指数:最佳人工智能模型得分为73.6,上限为91

Anthropic 和独立研究人员引入了一种新方法,用来衡量一类 AI 模型历来难以证明自己擅长的能力:在没有干净、可验证答案的问题上进行推理。本周发布的概念推理指数(Conceptual Reasoning Index,CRI)结合了三个独立基准,用于评估大型语言模型在哲学论证、逻辑一致性以及决策理论难题上的表现——许多研究人员认为,随着 AI 系统在管理自身风险方面承担更大角色,这类思维方式将变得尤为重要。

要点总结

  • 概念推理指数将三个基准——LMCA、ACCoRD 和 DTBench 能力——整合为一个 0 到 100 的 AI 概念推理得分。
  • 表现最好的模型 Opus 5 在 CRI 上得分为 73.6,明显低于约 91 的估计上限。
  • LMCA 数据集包含 560 篇立场文本和 1,461 条由专家评分的论证,涵盖哲学、决策理论和 AI 风险。
  • 自 2024 年末以来,得分大致呈线性上升,没有出现趋于平缓的迹象。
  • 该项目由 Anthropic 与研究人员 Emery Cooper 和 Caspar Oesterheld 合作构建。

概念推理指数(CRI)简介

CRI 的存在,是因为 AI 系统未来可能执行的一些最重要工作——帮助人类理解并规划高级 AI 风险——无法像数学或编程问题那样,对照明确的正确答案进行检验。其创建者认为,许多与AI 风险缓解相关的任务,更依赖哲学和 AI 未来学中使用的论证方式,而非经验验证;而当前的训练方法高度依赖具有可靠反馈的数据,往往恰恰在这种推理类型上让模型显得较为薄弱。

为弥补这一测量缺口,研究人员构建了三个独立的AI 风险基准,并将它们汇总为一个综合得分。概念推理指数(CRI)将 LMCA、ACCoRD 和 DTBench 三个基准整合为一个数字,用于刻画模型整体的概念推理能力。该指数已在 conceptualreasoning.ai 上公开,团队表示会随着新模型和新基准的出现,持续更新得分和方法论。

CRI 在 AI 风险管理中的用途

为什么要构建这一指数?项目背后的研究人员表示,一旦 AI 模型能够以人类专家水平开展风险降低工作,那么在这一领域中,AI 辅助产出可能会远超人类单独完成的成果。这意味着,模型在多大程度上、以及多快能够被训练到善于推理 AI 治理、对齐以及涉及 AI 的协作失败等问题,可能会成为风险能否及时得到应对的关键因素。提升 AI 模型的概念推理能力之所以被视为重要,正是因为它瞄准了这一缺口——那些缺乏经验反馈回路、因此往往被标准训练忽视的任务。

基准的聚合方式与可用性

CRI 并不是单一测试,而是加权组合。目前,LMCA 占总分的 60%,ACCoRD 和 DTBench 能力各占 20%。团队表示,计划随着时间推移加入新的基准,淘汰已趋于饱和的基准,并可能在模型能力提升后重新调整这些权重。

CRI 组成基准的详细拆解

三个组成部分各自针对不同类型的推理,这些推理难以通过经验方式验证,但仍可通过专家判断或逻辑规则进行测量。

LMCA 数据集:范围与专家评分

LMCA 是“语言模型概念论证”(Language Model Conceptual Argumentation)的缩写,围绕经过筛选并由专家评分的论证构建,涵盖决策理论、哲学以及高级 AI 带来的风险。LMCA 数据集包含 560 篇立场文本,以及针对这些立场撰写的 1,461 条由专家评分的反对论证。几乎所有论证都由概念研究员 Emery Cooper 评分,其中一部分还由至少另一位研究人员独立评分,总计产生 2,140 条评分记录。一个约 50 条论证的验证集由 4 至 6 人独立评分,随后又进行了合计 7 至 8 小时的讨论,以此来确定在人类之间比较模型输出之前,人类彼此之间的一致程度。

目前,LMCA 只评估模型对现有论证的判断能力,而非生成新论证的能力,不过团队表示,希望未来能加入论证生成方面的测量。

ACCoRD:衡量模型信念的逻辑一致性

ACCoRD 检查的是另一类问题:模型自己陈述的信念和偏好在逻辑上是否自洽。如果一个模型给出事件 A 的概率,又单独给出 A 与 B 同时发生的概率,它是否遵守诸如 P(A) 大于等于 P(A&B) 这样的基本规则?完整的 ACCoRD 数据集包含近 14,000 条模型生成的一致性约束,覆盖 18 种约束类型,并通过自动检查器进行验证。其中,经过人工审查后,有 567 条通过验证的约束被纳入 CRI——这是一个刻意保守的筛选过程,旨在仅保留研究人员有信心的检查项。

DTBench:决策理论推理评估

DTBench 通过 407 道多项选择题测试决策理论推理,其中大部分由在决策理论领域发表过学术成果的 Caspar Oesterheld 手工编写,并由 Emery Cooper 独立验证。这些问题考察涉及自我预测以及与代理体近似拷贝互动的情景——这类思想实验长期以来一直是决策理论学者争论的焦点。完整 DTBench 套件中还有额外 130 道用于衡量决策理论态度的问题,但未被纳入 CRI 得分。

CRI 表现结果与趋势

即便是目前测试中表现最好的模型,与基准所认为的近乎完美得分之间仍存在不小差距,不过这一差距正在稳步缩小。

当前表现得分与上限对比

CRI 得分范围为 0 到 100,0 代表完全随机猜测。研究人员估计,现实可达到的上限约为 91,而非满分 100,因为人类评分本身就存在噪声——即便是专家评分者之间也无法做到 100% 一致。目前记录到的最高得分来自Opus 5,为 73.6,95% 置信区间为正负 2.1。这意味着当前最佳表现与估计上限之间仍存在显著差距,表明在基准本身成为限制因素之前,模型在概念推理方面仍有相当大的提升空间。

模型表现随时间变化的趋势

数据中引人注目的不仅是模型当前所处的位置,还有其前进速度。自 2024 年末以来,模型表现大致呈线性提升,研究人员报告称尚未看到这一趋势出现放缓迹象。对于试图预测 AI 系统何时能在高度依赖论证的工作中成为真正有用合作者的人来说,这种稳定的攀升尤为重要,而 AI 安全研究正是高度依赖此类工作的领域。

各基准的饱和度预估

并非所有组成部分的进展速度都相同。根据当前趋势外推,研究人员粗略估计 LMCA 将在大约一年后开始趋于饱和。另一方面,DTBench 已经接近其上限——某个被评估的模型 Fable 5 在 DTBench 问题上的正确率达到了 98%。ACCoRD 则是一个未知数:团队表示,目前尚无法确定该基准何时会趋于饱和,因为即便原始推理能力提升,一致性错误仍可能持续存在。

CRI 的重要性与协作开发

这一切之所以重要,不仅仅是因为排行榜。构建概念推理指数的人认为,概念推理是专门针对 AI 风险工作的瓶颈能力——这类工作涉及对治理、对齐以及灾难性协作失败进行推理,而在这些问题上并不存在可供训练的历史结果数据集。提升 AI 模型的概念推理能力被视为降低高级 AI 风险的重要途径,正是因为大量风险缓解工作依赖论证而非经验测试。

该项目由 Anthropic 与概念研究人员 Emery Cooper 和 Caspar Oesterheld 合作完成,他们既参与了数据集设计,也参与了支撑 LMCA 和 DTBench 组件的专家评分。机构支持与领域专家输入的结合,是 CRI 有别于更传统 AI 基准(如数学、编程或常识知识等领域基准)的部分原因——在那些领域,正确性通常可以自动检验。

实时得分和方法说明托管在 conceptualreasoning.ai 上,对底层 LMCA 数据集的访问则通过申请表提供。这种结构表明,团队希望外部研究人员对该基准进行测试和挑战,而不是将其视为封闭的内部指标。

常见问题

什么是概念推理指数(CRI)?

CRI 将 LMCA、ACCoRD 和 DTBench 三个基准整合起来,用于衡量 AI 模型的概念推理能力,并给出一个 0 到 100 的单一得分。

LMCA 数据集评估哪些类型的推理?

LMCA 评估模型对与哲学、决策理论和 AI 风险相关的概念性论证的判断能力,并将模型评分与人类专家评分进行比较。

ACCoRD 如何测试 AI 模型的逻辑一致性?

ACCoRD 通过 567 条纳入 CRI 的已验证约束,衡量模型报告的信念和偏好是否满足逻辑一致性约束,例如基本的概率规则。

当前 AI 模型在 CRI 上的表现如何?

当前表现最好的模型 Opus 5 在 CRI 上得分约为 73.6(满分 100),自 2024 年末以来,被评估模型的得分大致呈线性提升,目前尚未出现这一增长放缓的迹象。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”什么是概念推理指数(CRI)?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”CRI 将 LMCA、ACCoRD 和 DTBench 三个基准整合起来,用于衡量 AI 模型的概念推理能力,并给出一个 0 到 100 的单一得分。”}},{“@type”:”Question”,”name”:”LMCA 数据集评估哪些类型的推理?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”LMCA 评估模型对与哲学、决策理论和 AI 风险相关的概念性论证的判断能力,并将模型评分与人类专家评分进行比较。”}},{“@type”:”Question”,”name”:”ACCoRD 如何测试 AI 模型的逻辑一致性?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”ACCoRD 通过 567 条纳入 CRI 的已验证约束,衡量模型报告的信念和偏好是否满足逻辑一致性约束,例如基本的概率规则。”}},{“@type”:”Question”,”name”:”当前 AI 模型在 CRI 上的表现如何?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”当前表现最好的模型 Opus 5 在 CRI 上得分约为 73.6(满分 100),自 2024 年末以来,被评估模型的得分大致呈线性提升,目前尚未出现这一增长放缓的迹象。”}}]}

本文在人工智能协助下完成,并由编辑团队进行审阅。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST