当前位置:首页 > 科技资讯 > 正文

机器学习助力MOFs热力学评估:高效预测与筛选

来自普林斯顿大学和科罗拉多矿业学院的联合研究团队,利用机器学习提出了一种高效预测方法,直接从MOFs的结构序列预测自由能,从而显著降低计算成本,实现了高通量、可扩展的MOFs热力学评估。

金属有机框架(Metal–Organic Frameworks, MOFs)因其独特的孔结构和化学功能,在气体存储、分离等领域展现出巨大潜力。然而,MOFs庞大的设计空间使得仅依靠实验探索效率低下。为了加速MOFs的发现,研究团队利用机器学习模型预测其性质,并成功解决了从筛选到合成的低转化率问题。

该模型通过大语言模型(LLM)直接从MOFs的结构序列预测自由能,极大提高了计算效率。在无需重新训练的情况下,该模型展现出极高的通用性,F1值高达97%。这一成果已发表在ACS Publications。

研究亮点:

  • 高精度模拟完整分子模拟结果,判断MOFs的合成可行性。
  • 显著缩短实验室和分子模拟所需时间。
  • 为基于性能的计算MOFs筛选提供了可行的机器学习自由能预测工具。

机器学习助力MOFs热力学评估:高效预测与筛选 MOFs 机器学习 自由能预测 高通量筛选 第1张

MOFMinE:涵盖100万个MOFs原型

为了支撑模型训练,研究团队构建了一个包含约100万个MOFs原型的MOFMinE数据集,涵盖了从构件选择到功能化修饰的全流程信息。

机器学习助力MOFs热力学评估:高效预测与筛选 MOFs 机器学习 自由能预测 高通量筛选 第2张

MOFMinE数据集的构建与表征概览,包含约100万个结构

构建方法

数据集基于ToBaCCo-3.0平台生成,每个MOF的生成方法是将构建单元映射到拓扑模板上,指导构建单元在MOFs晶胞中的空间排列和连接方式。

数据规模与多样性

MOFMinE包含1,393种拓扑模板、27种无机NBB、14种有机NBB和19种基础EBB,涵盖了13种功能化修饰,保证了化学和拓扑结构的多样性。

自由能子集

在100万个MOFs原型中,有一个子集共65,574个结构收集了自由能数据。该子集用于LLM的自由能预测微调和测试。

用于高效预测MOFs自由能的MOFSeq-LMM模型

在MOFMinE数据集的支撑下,研究团队构建了MOFSeq-LMM模型框架,用于高效预测MOFs自由能。该框架将MOFs的结构信息转化为计算机可理解的序列表示(MOFSeq),并结合大语言模型进行学习和预测。

MOFSeq表征

研究人员开发了基于字符串的序列表示方法MOFSeq,以优化的方式编码MOFs的局部与全局结构特征。

机器学习助力MOFs热力学评估:高效预测与筛选 MOFs 机器学习 自由能预测 高通量筛选 第3张

LLM-Prop模型设计

研究团队采用了LLM-Prop大语言模型,用于材料性质预测。该模型规模适中,约3,500万参数,保证了学习能力和计算效率。

预训练与微调

* 预训练阶段:

研究人员通过应变能数据预训练LLM-Prop模型。预训练过程中使用了dropout率0.2和0.5,结果表明0.2的dropout在预训练和下游任务中表现更佳。

* 微调阶段:

设置与预训练相同,但模型目标改为预测自由能,并将训练epoch数增加至200。LLM-Prop设计为轻量化模型,优先考虑计算效率。

预测MOFs合成准确率达97%

在完成MOFSeq-LMM模型的训练后,研究团队对模型在自由能预测、合成可行性判定以及多晶型MOFs筛选中的表现进行了系统评估。实验结果验证了模型的高精度和在高通量MOF设计与筛选中的应用潜力。

自由能预测性能

结果显示:模型能够以0.789 kJ/molMOFatom的平均绝对误差(MAE)精确预测自由能,同时取得R² = 0.990的高相关性。

消融实验结果

消融实验结果表明,局部与全局特征的协同作用对提高预测精度至关重要。预训练策略也显著提升了模型的泛化能力。

合成可行性判定

将ΔL_MFFL设定为4.4 kJ/molMOFatom阈值后,模型的F1分数达到97%,ROC曲线下面积(AUC)高达0.98。

AI重塑MOFs和材料学研究新范式

随着人工智能在材料科学中的深度介入,研究范式正在发生变革。研究者开始构建可计算、可推理的材料表示体系,让模型学习哪些结构组合在物理上合理、在热力学上可行、在合成上值得尝试。这不仅提高了研究效率,也推动了材料科学的创新与发展。