HomeAIWikimedia面临压力:由于AI机器人,流量激增50%

Wikimedia面临压力:由于AI机器人,流量激增50%

在自由知识的数字宇宙中心,Wikimedia今天面临着其近期历史上最复杂的挑战之一:日益增长的自动化bot AI系统地掠夺其内容的浪潮。 

特别是在过去几个月中,由所谓的crawler AI生成的流量增加了50%,这对平台的技术能力和经济可持续性都造成了严重挑战。

人工智能 (AI) 对数字基础设施的影响不断增长:Wikimedia 案例

2024年1月开始,Wikipedia和其他Wikimedia项目等平台的数据下载量出现了bull增长。 

这一增长并不是由于人类用户的更多参与,而是由于公司系统性且往往缺乏监管地使用自动化bot,这些公司开发人工智能模型。

这些工具旨在收集和分析大量文本、图像和其他内容,使用Wikimedia作为其算法训练的主要数据来源。 

一项操作,一方面证明了该平台在数字知识生态系统中的核心地位,另一方面对其信息基础设施施加了不可承受的压力。

问题不仅仅在于传输数据的数量。真正的关键问题在于这些bot访问内容的方式。

在大多数情况下,请求实际上是针对稀有或很少访问的页面,即那些不在缓存系统中的页面。也就是说,缓存机制允许临时保存访问量较大的页面的副本,以加快加载速度。

当这种情况发生时,必须由中央服务器直接处理请求,这导致工作负载显著增加,尤其是成本增加。 

这种情况在具有高度媒体相关性的事件中变得尤为关键,在这些事件期间,“人类”流量已经达到很高的水平。

机器人失控:忽视规则,规避封锁

另一个令人担忧的现象维度是由行为日益复杂且有时不当的爬虫所代表的。事实上,许多这些bot无视既定惯例,绕过自动阻止系统,并伪装成看似合法的用户。

Questo tipo di condotta non solo viola le norme di buon uso della rete, ma costringe i team tecnici di Wikimedia a un 持续监控 e a un impiego costante di risorse per proteggere l’infrastruttura. 

资源本可以用于增强平台或丰富其内容。

为了应对这种情况,维基媒体基金会正努力不局限于技术或防御性的反应。所提出的解决方案不仅仅是简单地遏制问题,而是旨在实现对自由知识的协作和可持续管理

因此诞生了WE5, 这是一个新的战略举措,旨在促进在平台托管数据的获取和使用中采用更公平和负责任的方法。

该项目是对科技公司和人工智能开发者的邀请。 

具体来说,这是一个邀请,要求遵守规则,分担网络管理成本,并确保基础设施的生存,这是世界上主要的自由信息来源之一的基础。

整个事件为未来的自由获取知识提出了一个关键问题:在数据已成为人工智能生命线的时代,谁来支付这些数据的保存和分发费用?

Wikimedia,一直以免费和共享的原则为动力,现在正处于开放性和可持续性之间的十字路口。

如果大型科技公司和大量使用基金会内容的参与者不改变路线,该项目可能被迫减少可访问性或引入更严格的限制以保护其基础设施。

呼吁尊重数字公共利益

Wikimedia向世界传达的信息是明确的。也就是说,自由知识是一种公共财富,因此,必须以尊重和责任的态度对待。

将基金会提供的巨大信息资产用于商业目的时,必须以透明的形式进行,符合规则。此外,如有必要,还需附有公平贡献形式

在一个日益被算法和自动化主导的数字化环境中,确保知识的获取不被少数人的经济利益所妥协是至关重要的。 

只有通过社区、机构和企业之间的开放对话,才能保持全球自由、可访问和可持续的百科全书的梦想。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST