如今,越来越多的科学著作至少在某种程度上要由人工智能来评判,而一项新研究表明,即使基础数据从未改变,研究者选择的措辞也可能改变 AI 评审的结论。研究人员在考察修辞对 AI 评审的影响时发现,在基于大语言模型的同行评审系统中,是“表述方式”而非“证据本身”在悄然拉高或压低评分,这再次引发了一个问题:机器评审到底有多可靠?
这种担忧并非假设。同行评审是一个已有数十年历史的制度,研究人员在论文发表前相互审查彼此的工作,如今却在投稿洪流下不堪重负。Ars Technica 引用的一项近期Frontiers 期刊调查发现,超过一半的同行评审人已经在评审流程的某个环节依赖 AI 工具,往往只是为了跟上工作量。正是这种依赖,使得 AI 评审中的修辞偏差问题变得格外紧迫:如果机器已经在给论文打分,而仅仅是用词不同就能改变分数,那么科学公平性的风险会迅速上升。
明立(Ming Li)带领的团队正是为填补这一空白而开展测量的。他们的论文于 2026 年 8 月提交,以ICLR 2026 投稿为基础,将修辞与实质内容剥离开来,以观察呈现方式究竟能在多大程度上左右基于 AI 的判断。结果勾勒出一种结构化、不均衡、在某些情况下甚至相当可预测的偏差图景。
Summary
要点总结
- 仅仅改变修辞框架就能在可测量的程度上改变 AI 评审分数,而基础科学内容保持完全一致。
- 研究人员构建了一个由4,200 篇完整论文稿件组成的语料库,这些稿件源自120 篇匿名化的 ICLR 2026 投稿,用于测试这一效应。
- 证据框架与新颖性立场在整体评估分数上带来了最大幅度的正负波动,超过其他任何修辞维度。
- 原始 AI 评分较低的论文在修辞重写后往往会上升,而原本得分较高的论文则倾向于下降。
- 更严格的评审协议将平均分数拉低了1.36 分,但并未可靠地降低其对修辞的敏感度。
研究概览与方法
研究团队设计了一项对照实验,刻意剥除除论文措辞之外的所有变量,将修辞敏感性作为同一稿件不同版本之间唯一变化的因素。正是这一设计赋予了研究结果以分量:稿件版本之间的任何评分差异都可以追溯到呈现方式,而非科学内容的真实差别。
基于 ICLR 2026 投稿的受控稿件语料库
为实现这一点,研究人员构建了一个由 4,200 篇完整论文稿件组成的语料库,这些稿件源自 120 篇匿名化的 ICLR 2026 投稿——这是该领域重要的机器学习会议之一。每篇原始论文都被改写成多个修辞变体,从而形成足够大的数据集,以发现少数论文无法暴露的模式。
修辞重写与 AI 评审协议
两个不同的大语言模型重写器分别在六个不同的修辞维度上改写每篇稿件,并将这些维度推向相反方向,例如更自信与更谨慎的表述框架,同时保持所报告的科学内容不变。随后,五个不同的 LLM 评审者对所有生成的稿件进行评估,各自先在标准评审协议下评审一次,再在更严格的协议下评审一次,以便团队比较修辞在不同评估条件下的表现。研究还测试了联合、递归以及评审者引导的重写流程,以观察多种策略叠加是否会放大这种效应。
修辞选择对 AI 评审分数的影响
核心发现是:基于 AI 的同行评审中的修辞敏感性并非随机噪声,而是遵循清晰的层级结构,其中某些文体选择远比其他选择重要。这种结构性特征使问题不再只是个别趣闻,而是评估系统在设计时必须主动应对的因素。
关键修辞维度:证据框架与新颖性立场
在测试的六个修辞维度中,证据框架与新颖性立场在整体评估分数上产生了迄今最大幅度的正负对比。研究范围的框架效应则构成了较弱的第二梯队,而其余维度的影响更小且不够稳定。换言之,一篇论文在多大程度上自称具有新颖性,或在多大程度上强势呈现其证据,可能比若干其他文体因素加在一起对 AI 评审者更为重要。
基于原始评审分数的分数变动模式
分数变动的方向高度依赖于稿件的起点。原本获得较低 AI 评审分数的论文在修辞重写后往往会“爬升”,而原本得分较高的论文则倾向于“下滑”。最明显的方向性对比——即同一论文在正向与负向重构版本之间的分数差距最大——出现在中等分数区间,而这恰恰是稿件命运最具争议的地带。
重写工作流的复杂性与依赖性
人们或许会以为叠加多种重写技术会带来更大的分数波动,但数据并不支持这一点。更复杂的工作流,包括联合重写、递归重写以及评审者引导的重写,并未稳定地带来比简单方法更大的收益。联合重写的效果高度依赖于所使用的重写模型,而向评审者提供明确指导也并未持续优于对稿件进行一次简单、无引导的二次审视。多轮重写带来的收益呈现递减且依赖配置,而非持续叠加的优势。在所有测试条件下,重写器主要决定了相反修辞变体之间的差距有多大,而评审者则决定了由此产生的分数变化的幅度与方向。
评审协议效应与启示
收紧评审规则会整体拉低分数,但并不能修复潜在的修辞偏差,而这或许才是对任何构建或依赖 AI 评审系统的人来说更重要的结论。
严格评审协议的影响与稳健评估的必要性
与标准协议相比,切换到严格评审协议使整体评估平均分数降低了 1.36 分。这在绝对值上是一个不小的降幅,但并未持续降低 AI 评审者对修辞框架的敏感度。更严格的规则让评审者整体上更苛刻,却未必在抵御文体操控方面更“公正”。
对于关注基于 AI 的同行评审兴起的人来说,这一区别至关重要。如果仅仅收紧评分细则并不能消除修辞敏感性,那么单纯要求 AI 评审者“更严格”并不是解决方案。研究结果指向另一种思路:构建在面对保持内容不变的修辞变化时仍然稳健的评估系统,也就是说,只要基础科学没有改变,无论证据是以自信还是谨慎的方式呈现,系统都应给出相同的判断。
在一个已经为稿件数量、评审倦怠以及人类评审不一致性所困扰的领域中,正如 Ars Technica 对更广泛同行评审危机的报道所记录的那样,进一步依赖 AI 打分的诱惑只会越来越大。这项研究提醒我们:把判断过程自动化并不会自动消除偏见,它只是改变了偏见的来源。
常见问题
修辞选择如何影响基于 AI 的同行评审分数?
诸如证据框架与新颖性立场等修辞选择会在科学内容不变的情况下显著影响 AI 评审判断。
本研究使用了什么数据集来分析 AI 评审中的修辞敏感性?
研究使用了一个受控语料库,其中包含 4,200 篇稿件,这些稿件源自 120 篇匿名化的 ICLR 2026 投稿。
更复杂的重写策略会带来更好的 AI 评审分数吗?
不会,更复杂的重写工作流并未稳定地带来更大的 AI 评分提升。
采用严格评审协议对 AI 评审分数有何影响?
严格评审协议将整体评估平均分数降低了 1.36 分,但并未持续改变修辞敏感性。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”修辞选择如何影响基于 AI 的同行评审分数?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”诸如证据框架与新颖性立场等修辞选择会在科学内容不变的情况下显著影响 AI 评审判断。”}},{“@type”:”Question”,”name”:”本研究使用了什么数据集来分析 AI 评审中的修辞敏感性?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”研究使用了一个受控语料库,其中包含 4,200 篇稿件,这些稿件源自 120 篇匿名化的 ICLR 2026 投稿。”}},{“@type”:”Question”,”name”:”更复杂的重写策略会带来更好的 AI 评审分数吗?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”不会,更复杂的重写工作流并未稳定地带来更大的 AI 评分提升。”}},{“@type”:”Question”,”name”:”采用严格评审协议对 AI 评审分数有何影响?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”严格评审协议将整体评估平均分数降低了 1.36 分,但并未持续改变修辞敏感性。”}}]}
本文在人工智能的协助下完成,并由编辑团队进行审阅。

