HomeAIOpenAI在风暴中:一项研究指责该公司在受版权保护的数据上训练其模型

OpenAI在风暴中:一项研究指责该公司在受版权保护的数据上训练其模型

一项由AI Disclosures Project发布的新研究对OpenAI采用的训练方法的透明度和伦理性提出了关键质疑。调查的核心是GPT-4o,这是该公司最新的语言模型,被指控识别和使用受版权保护的内容,这些内容来自出版商O’Reilly Media的保密材料。

一项旨在提高人工智能竞赛透明度的研究

该研究是在AI Disclosures Project项目的框架内进行的,该项目由技术专家Tim O’Reilly和经济学家Ilan Strauss领导。项目的目标很明确:促进人工智能领域的更大责任,强调开发LLM(大型语言模型)的公司需要采用透明的实践。

该文件是一个工作论文,分析了当前在披露用于训练这些模型的数据方面缺乏正式义务如何可能导致信任和合法性方面的严重问题。研究人员认为,就像在金融市场中出现了披露规则以促进强劲的市场一样,在人工智能领域也需要类似的监管以避免滥用和系统性损害。

OpenAI 进行受版权保护内容的测试:数据表明一切都很清楚

为了进行他们的调查,研究人员使用了合法获得的一个由34本受版权保护的书籍组成的数据集,这些书籍由O’Reilly Media出版。通过一种称为DE-COP membership inference attack的技术,他们测量了语言模型是否能够区分由人类撰写的文本和由LLM生成的改写版本。结果将矛头指向GPT-4o

AUROC 分数(衡量模型区分两个类别能力的指标)清晰地表明:

  • GPT-4o 在识别来自 O’Reilly Media 的非公开内容方面获得了 82% 的分数 — 这一数值表明这些内容很有可能已被包含在训练数据中。
  • 作为对比,GPT-3.5 Turbo模型显示出更弱的识别能力(大约50%),而GPT-4o Mini,该模型的一个更轻量的版本,既没有识别出公共内容也没有识别出非公共内容。
  • 数据显示,GPT-4o 对非公开访问材料的识别能力(82% AUROC)优于自由获取的 O’Reilly 内容(64% AUROC)。
  • 相反,GPT-3.5 Turbo 对公共内容(64%)比对保密内容(54%)更熟悉。

研究人员建议,可能的版权内容访问来源可能是LibGen,这是一个知名的在线平台,托管未经授权的受版权保护书籍的数字副本。研究中分析的所有书籍实际上都存在于那个虚拟图书馆中。

AI产业:合法性、经济性与内容的可持续性

这些结果引发了一个更广泛的问题:系统使用受版权保护的数据来训练语言模型可能会损害创作原创内容的专业人士的经济可持续性。如果企业未因使用其出版物而获得补偿,整个信息生态系统——包括出版业——可能面临贫困的风险。

根据报告,未经授权使用专有数据且不进行补偿 会导致在线内容的质量和多样性下降。这不仅是一个道德问题,也是一个经济问题:没有收入,出版社和专业创作者无法继续生产有价值的内容。

研究人员的担忧:模型知道的比他们声称的要多

另一个研究中强调的方面是最新语言模型在理解和再现人类语言与人工智能生成语言之间细微差异的能力的提高。此外,研究人员指出可能存在“时间偏差”,因为语言会随着时间演变。为了消除这种类型的偏差,测试是在两个在相同时间段内训练的模型(GPT-4o 和 GPT-4o Mini)上进行的。

尽管证据仅限于一个特定案例——OpenAI 和 O’Reilly 文本——作者认为这一现象可能在生成性人工智能领域中是广泛且系统性的。

走向训练数据的合法市场?

该研究以一个更广泛的思考结束:有必要建立一个系统,使IA开发者能够通过许可协议透明的补偿合法访问训练数据,以便内容创作者获得合理的报酬。

一些企业已经在朝这个方向开发商业模式。这就是Defined.ai的情况,这是一个销售训练数据的平台,确保同意作者并删除所有可识别的个人信息。一个受监管的行业可能是一些大型AI公司当前不透明行为的合法和可持续替代方案。

政治的角色:欧洲可以成为先驱

该报告还提供了一个监管视角:欧盟人工智能法案的生效,该法案规定了模型训练的披露义务,可能会引发一个良性循环。如果规则被明确规定并真正实施,权利持有人最终可以知道他们的作品何时以及如何被使用。

这将是创建mercati legali的一个基本步骤,在这些市场中,创作者的内容被有效地视为由IA使用的beni economici

不仅仅是OpenAI:一项研究指责一种越来越频繁的做法

通过对O’Reilly Media 出版社的 34 本书的详细分析,研究人员提供了实证证据,这表明 OpenAI 可能在训练其 GPT-4o 模型时也使用了非公开和受版权保护的数据

如果得到证实,这不仅可能严重违反版权法规,还可能违反透明度、共识和公平原则,这是大型科技公司在人工智能日益深刻影响我们的社会和经济的时代应该遵守的。

Satoshi Voice
本文在人工智能的支持下完成,并由我们的记者团队审核,以确保准确性和质量。
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST