当前位置:首页 > 科技资讯 > 正文

维基百科与AI大厂握手:数据共享背后的双赢策略

AI巨头终于意识到与内容平台对抗非长久之计。

就在全球知名百科全书维基百科庆祝其25周年之际,维基媒体基金会宣布,包括亚马逊、Meta、微软、Mistral AI及Perplexity在内的多家AI大厂已加入“维基媒体企业合作伙伴计划”。

维基百科与AI大厂握手:数据共享背后的双赢策略 维基百科 AI大厂 数据共享 双赢 第1张

这意味着这些企业将付费获取维基百科的“企业级数据访问权”,以获取该网站的实时数据。而维基媒体企业合作伙伴计划则根据他们的特定需求,对维基百科海量的文章数据进行结构化处理,使其更易于模型训练和商业用途。维基媒体基金会表示,来自亚马逊、微软等企业的授权费用将直接用于支持该非营利组织的长期运营。

简而言之,维基百科将旗下数据资产整理成AI更易理解的形式,以便AI企业即取即用。

01

在AI大模型的训练中,结构化数据以其固有的清晰度、一致性和效率,成为构建可靠且可扩展AI大模型的关键。尤其是用于分类、回归和预测等任务的模型,结构化数据更是不可或缺。

维基百科与AI大厂握手:数据共享背后的双赢策略 维基百科 AI大厂 数据共享 双赢 第2张

在金融大模型中,交易金额、交易时间、交易类型等结构化的交易记录,可以作为模型的输入特征,帮助AI学习和识别风险模式,从而提升输出结果的稳定性。此外,结构化数据与知识图谱之间存在天然的协同关系,通过结合两者,AI大模型可以更准确地理解数据的上下文和语义。

维基百科向AI企业提供结构化数据访问权的原因,是后者爬虫已成为该非营利组织的噩梦。维基媒体基金会产品高级总监Marshall Miller此前在博客文章中表示,“使用维基百科内容的AI聊天机器人必须引导更多用户访问维基百科,确保免费知识能够持续流通。访问量下降可能导致志愿者减少,内容更新和丰富的速度放缓,个人捐赠者对这项工作的支持也可能下降。”

为了保证内容的可访问性,维基媒体基金会采用分布式存储维基百科内容,并根据一定策略分配到不同存储节点,实现数据就近存储,提高访问速度和效率。当某个内容被多次请求时,他们会将内容缓存到离用户最近的数据中心;如果某个内容长时间未被请求,则存储在核心数据中心。

根据内容热度存储数据,使维基百科能够尽可能节省服务器开支。然而人类的偏好与AI截然不同,人类更关注时事热点,而AI追求的是进化,倾向于大量且快速地获取所有数据。内容的热度对AI毫无意义,这意味着维基百科认为的冷门内容也会被频繁访问,也就是说AI比人类访客更能消耗宝贵的带宽。

其实维基百科想要向这些AI企业收费不难理解,但后者为何会在这个时间点选择付费呢?过去三年,因AI爬虫抓取数据而引发的诉讼屡见不鲜,AI企业也一直“白嫖”内容平台,甚至宁愿打官司也不愿付费。如今,这些企业的想法却发生了180度大转弯。

AI企业之所以愿意向维基百科付费,是因为他们不希望看到维基百科倒下。AI行业一直存在一个悖论:如何在不依赖人类提供的大量训练数据的情况下让AI变得更智能?这好比要求一个旱鸭子横渡长江却不配游泳教练。

维基百科与AI大厂握手:数据共享背后的双赢策略 维基百科 AI大厂 数据共享 双赢 第3张

02

目前构建AI大模型的关键技术是基于人类反馈的强化学习(RLHF),这不仅依赖人类标注员,更需要持续向大模型投喂数据。就像培养优秀学生需要优质教师一样,大模型的性能提升需要海量的预训练数据和高质量的指令微调/强化学习数据。

在跳出RLHF模式之前,AI大模型的进化需要汲取人类的智慧,还无法在完全没有外部数据的情况下实现自我进化。谷歌、微软、亚马逊、Meta已意识到一味向内容平台索取会导致人类创作者降低输出内容的热情。如果没有广大创作者在互联网上分享内容,难道要他们亲自上阵?

尽管已有团队基于强化学习中的“自我博弈”开始探索“无数据自我进化”,即AI给自己出题、自己解题、再从中学习。但问题在于由于没有外部“标准答案”,评估每个自生成问题的难度和可解性都需要大模型实际解答。整个过程如同反复试错的穷举法,极其耗费时间和算力。

维基百科与AI大厂握手:数据共享背后的双赢策略 维基百科 AI大厂 数据共享 双赢 第4张

换句话说,尽管AI的无数据自我进化省去了获取外部数据的成本,却不得不面临预训练算力激增以及模型迭代需要更多时间的问题。对于大厂而言,算力可能不是问题,但他们缺时间。以OpenAI为例,在CEO山姆·奥特曼宣布进入红色警报状态、推迟非核心项目应对谷歌Gemini的强势反扑后,仅用一个月就推出了GPT 5.2。

当前AI行业的状态是“争先恐后”,没有哪家企业敢于慢工出细活。当不需要外部训练数据的方法还有暂时解决不了的缺陷时,AI企业就不得不回过头来与维基百科这种拥有高质量数据的平台和解。万一维基百科选择躺平摆烂,就轮到这些AI企业头疼了。

更何况出钱从维基百科买数据反而更有性价比。毕竟AI企业宝贵的人力资源要用于升级算法,让员工创作内容是大材小用。