来自普林斯顿大学和科罗拉多矿业学院的联合研究团队,利用机器学习提出了一种高效预测方法,直接从MOFs的结构序列预测自由能,从而显著降低计算成本,实现了高通量、可扩展的MOFs热力学评估。
金属有机框架(Metal–Organic Frameworks, MOFs)因其独特的孔结构和化学功能,在气体存储、分离等领域展现出巨大潜力。然而,MOFs庞大的设计空间使得仅依靠实验探索效率低下。为了加速MOFs的发现,研究团队利用机器学习模型预测其性质,并成功解决了从筛选到合成的低转化率问题。
该模型通过大语言模型(LLM)直接从MOFs的结构序列预测自由能,极大提高了计算效率。在无需重新训练的情况下,该模型展现出极高的通用性,F1值高达97%。这一成果已发表在ACS Publications。
研究亮点:
为了支撑模型训练,研究团队构建了一个包含约100万个MOFs原型的MOFMinE数据集,涵盖了从构件选择到功能化修饰的全流程信息。
MOFMinE数据集的构建与表征概览,包含约100万个结构
数据集基于ToBaCCo-3.0平台生成,每个MOF的生成方法是将构建单元映射到拓扑模板上,指导构建单元在MOFs晶胞中的空间排列和连接方式。
MOFMinE包含1,393种拓扑模板、27种无机NBB、14种有机NBB和19种基础EBB,涵盖了13种功能化修饰,保证了化学和拓扑结构的多样性。
在100万个MOFs原型中,有一个子集共65,574个结构收集了自由能数据。该子集用于LLM的自由能预测微调和测试。
在MOFMinE数据集的支撑下,研究团队构建了MOFSeq-LMM模型框架,用于高效预测MOFs自由能。该框架将MOFs的结构信息转化为计算机可理解的序列表示(MOFSeq),并结合大语言模型进行学习和预测。
研究人员开发了基于字符串的序列表示方法MOFSeq,以优化的方式编码MOFs的局部与全局结构特征。
研究团队采用了LLM-Prop大语言模型,用于材料性质预测。该模型规模适中,约3,500万参数,保证了学习能力和计算效率。
* 预训练阶段:
研究人员通过应变能数据预训练LLM-Prop模型。预训练过程中使用了dropout率0.2和0.5,结果表明0.2的dropout在预训练和下游任务中表现更佳。
* 微调阶段:
设置与预训练相同,但模型目标改为预测自由能,并将训练epoch数增加至200。LLM-Prop设计为轻量化模型,优先考虑计算效率。
在完成MOFSeq-LMM模型的训练后,研究团队对模型在自由能预测、合成可行性判定以及多晶型MOFs筛选中的表现进行了系统评估。实验结果验证了模型的高精度和在高通量MOF设计与筛选中的应用潜力。
结果显示:模型能够以0.789 kJ/molMOFatom的平均绝对误差(MAE)精确预测自由能,同时取得R² = 0.990的高相关性。
消融实验结果表明,局部与全局特征的协同作用对提高预测精度至关重要。预训练策略也显著提升了模型的泛化能力。
将ΔL_MFFL设定为4.4 kJ/molMOFatom阈值后,模型的F1分数达到97%,ROC曲线下面积(AUC)高达0.98。
随着人工智能在材料科学中的深度介入,研究范式正在发生变革。研究者开始构建可计算、可推理的材料表示体系,让模型学习哪些结构组合在物理上合理、在热力学上可行、在合成上值得尝试。这不仅提高了研究效率,也推动了材料科学的创新与发展。
本文由主机测评网于2026-06-12发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260646990.html