当前位置:首页 > 科技资讯 > 正文

清华大学AI研究揭示科学探索的“矛盾效应”

就在近日,清华大学的一项AI for Science研究不仅登上了Nature杂志,而且还得到了Science的深度报道。

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第1张

这项来自清华大学李勇团队的研究通过分析了全球2.5亿篇科学文献,揭示了AI for Science领域存在的一个典型矛盾——

AI在助力科学家“个体加速”的同时,却导致科学界的集体注意力窄化和趋同优化的“群体登山”现象。

换句话说,尽管AI帮助科学家发表了更多论文、更早成为项目负责人,但人们却集体涌向了少量适合AI研究的“热门山峰”,从而无形中削弱了科学探索的广度。

而且进一步的分析表明,这一矛盾并非偶然,而是由当前科学智能AI模型缺乏通用性导致的系统性影响。

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第2张

那么,这项研究究竟是如何进行的呢?

第一步:探寻AI for Science的演化轨迹

回到起点,团队之所以进行这项研究,主要是发现AI for Science领域存在一个明显的矛盾——

在AI持续赋能科研的背景下,为何各学科的整体科学进展未见明显加速?

一方面,AI for Science研究已经产生了AlphaFold这样的荣获诺贝尔奖的成果;但另一方面,统计表明各学科领域的颠覆性研究成果在逐年下降,似乎未能获得AI的助力。

这背后的原因到底是什么?到目前为止,业界仍然没有明确的答案。

于是,团队带着这个问题出发了,并最终发表了《Artificial Intelligence Tools Expand Scientists’ Impact but Contract Science’s Focus》这篇论文。

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第3张

在论文中,团队的首项工作是:从浩如烟海的文献中找出那些“AI赋能的研究”

这一步对后续定量刻画AI对科学的影响至关重要。

为此,团队摒弃了停留在关键词层面的浅层检索方法,而提出了一条“高质量专家标注 + 大规模语言模型推理”相结合的技术路径——

通过领域专家标注少量论文样本,再让语言模型大规模推理的迭代优化,逐步让语言模型学会从标题和摘要中深层次的分析“那些是使用了AI工具的研究”。

论文显示,BERT的识别准确率非常高,达到了0.875分(满分为1)。

靠着这套方法,他们扫描了近50年来的海量文献(涵盖1980-2025年),最终绘制出了一张“AI赋能科研全景地图”

这张地图横跨“机器学习、深度学习、生成式AI”三个时代,涵盖4130万篇论文、覆盖2857万研究者,被团队视为研究“AI如何系统性影响科研”的首个基准数据集

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第4张

然后…发现AI for Science领域的矛盾效应

基于该数据集,团队系统性分析了AI在自然科学六大领域(生物、医学、化学、物理、材料科学和地质学)的影响。

所采用的分析方法大致可分为以下三个阶段:

step 1:构建“科学语义地图”

step 2:定义衡量“广度”的指标

step 3:进行比较分析

简单来说,团队想要回答一个关键问题——

有了AI的帮助后,科学家探索的领域到底是变宽了,还是变窄了?

为了客观衡量这种看不见、摸不着的“认知版图”,他们提出了基于隐藏变量的科学学分析方法。

该方法和传统科学学的区别在于,它不再仅仅依赖论文的标题、关键词、作者、引用关系等“表面”数据,而是深入到论文的“思想”和“内容”本身,从而能更精细地度量像“知识广度”这样抽象的概念。

具体到第一步,他们把每篇论文中最能代表其内容的标题和摘要作为核心文本,通过一个深度嵌入表征模型转换成一个由768个数字组成的、固定长度的数学向量。

这个向量就是每篇论文在高维数字空间中的“坐标”——理论上,语义相似的论文,其向量距离也会更接近

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第5张

而当所有论文都找到自己的“坐标”后,团队主要通过“直径”和熵值这两个指标来测量知识广度。

前者用来衡量探索的“最远边界”

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第6张

后者用来衡量分布的“均匀度”

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第7张

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第8张

背后原因揭秘:当前模型缺乏通用性

清华大学AI研究揭示科学探索的“矛盾效应” AI for Science 矛盾效应 科学智能 OmniScientist 第9张

论文链接:https://rdcu.be/eY5f7