AI4Materials 关注如何用机器学习加速材料的表示、性质预测、模拟、逆向设计和实验验证. 这个专题将重点放在 材料生成 上: 尤其是如何从已有材料中学习结构和化学规律, 再把它们迁移到新组分、新体系或新目标性质中.
机器学习如何加速科学方法
[] Unknown-material (Nature 2018) 是一篇非常经典的领域地图式综述.
四步基础流程
数据收集
机器学习学到的是现有数据中的规律, 所以数据库的错误也会被当作“规律”学进模型. 论文以 ICSD 为例: 当时其中约有 188,000 条结构记录, 虽然经过技术错误检查, 但仍可能含有人为转录误差和实验测量误差. 因此训练前需要处理缺失值、异常值、重复结构、单位不一致与数据来源不可追溯等问题.
术语补充: ICSD
ICSD (Inorganic Crystal Structure Database, 无机晶体结构数据库) 收录已发表的无机晶体实验结构. 一条典型记录包含化学式、晶胞参数、空间群、原子分数坐标及文献来源. 它与 Materials Project 这类以 DFT 计算为主的数据库不同, ICSD 的核心价值是 实验上报道过的晶体结构, 但已收录不等于每个字段都无误差.
按标注情况, 数据又对应三类学习设置: 监督学习使用“结构-性质”成对标签, 无监督学习只从结构或测量中寻找聚类与潜在模式, 半监督学习则利用大量无标签材料和少量已知性质材料.
数据表征
原始科学数据通常不能直接喂给模型. 将它转换成适合学习的数值特征即为特征工程. 例如光谱信号可在时域采集, 但经傅里叶变换到频域后才更容易解释和学习.
与一般的机器学习随便用一个模块来 encode 不同, 一个好的原子结构表示除开保留化学环境外, 还要同时 对不改变物理系统的操作保持不变: 整体平移、整体旋转和同类原子的编号置换. 晶体还要考虑周期边界; 同一晶格可以换原点、换晶胞或换基矢, 因而分数坐标本身不是唯一表示.
库仑矩阵
一种表征方式是 库仑矩阵 (Coulomb matrix), 用原子核电荷 $Z_i$ 和坐标 $\mathbf R_i$ 表示分子. 其常见定义为
$$ C_{ij}=\begin{cases} \frac{1}{2}Z_i^{2.4}, & i=j,\\[4pt] \frac{Z_iZ_j}{\lVert\mathbf R_i-\mathbf R_j\rVert}, & i\ne j. \end{cases} $$对角项是自由原子能量的经验近似, 非对角项描述原子核间的库仑排斥. 因为它只使用原子间距, 所以天然对整体平移和旋转不变; 但原始矩阵会随原子编号而置换行列, 通常还要排序行列或取特征值. 它适合有限分子, 却不会自然处理周期晶体和不定原子数.
针对晶体, 论文还举出了三类方案: 径向分布函数 (RDF) 统计原子对距离, Voronoi 剖分根据空间中离哪个原子最近来描述局部配位, property-labelled materials fragments 则把局部材料片段和元素属性绑定. 这些工作的共同目标, 是用稳定的局部环境表示代替不唯一的晶胞坐标.
学习器选择 & 模型优化与评估
离散输出对应分类, 例如判断材料是金属还是绝缘体; 连续输出对应回归, 例如预测极化率. 论文按当时的工具箱介绍了几类学习器, 都很古典在此略去.
加速整个科研闭环
在第二部分, 作者按科学家真正在做的工作组织材料.
指导化学合成
合成规划的搜索空间非常大, 传统系统如 OCSS 和 Chematica 依赖专家手工编写的反应规则和语境约束. 论文总结了两种机器学习路线: 一种用神经网络对规则系统产生的候选反应或路线排序; 另一种把分子写成 SMILES 字符串, 将“产物 到反应物”建模为 seq-to-seq 翻译问题. 机器学习还可以预测一个分子能否结晶、推荐无机反应条件, 或用主动学习选择下一个最有信息量的实验.
辅助多模态材料表征
晶体结构通常需要联合 X 射线/中子衍射、磁共振与自旋共振、振动光谱等多种实验结果. 各模态的空间尺度和敏感性不同, 单独分析时甚至可能给出冲突的结构解释.
用代理模型缩短计算
密度泛函理论 (DFT) 可以在合理成本下预测许多材料性质, 但精度受交换-关联泛函近似限制, 对弱相互作用、强关联 $d/f$ 电子体系等问题尤为明显. 论文提到用数据构造或校准泛函, 例如 BEEF; 也可直接学习电子密度到能量/势的映射, 部分绕过 Kohn-Sham 方程.
另一条重要路线是用量子力学数据学习 势能面 (potential energy surface, PES) 或原子间势, 将单次昂贵的量子计算蒸馏成可以反复调用的快速代理模型. 论文报告这在简单材料中可节省数个数量级的计算成本, 但多尺度方法串联时还必须跟踪误差如何传播.
原子间势
原子间势 (interatomic potential) 是一个从元素种类、原子坐标和晶格到体系势能的函数:
$$ E=U(\mathbf Z,\mathbf R,\mathbf L). $$对所有可能的原子构型而言, $U$ 形成的高维曲面就是 势能面 (PES). 系统会倾向势能更低的构型; 对坐标求负梯度还可得到每个原子受到的力:
$$ \mathbf F_i=-\frac{\partial U}{\partial \mathbf R_i}. $$因此一个原子间势可以同时用于结构松弛、分子动力学、声子和热力学性质计算. 如果每一个动力学时间步都重新做 DFT, 计算会非常昂贵; 原子间势的作用就是用远更便宜的近似反复评估 $E$ 和 $\mathbf F$.
经验原子势预先假设函数形式, 再拟合少量参数, 例如 Lennard-Jones、EAM 和 Tersoff 势. 机器学习原子间势则用 DFT 给出的能量、力和应力作为标签, 学习更灵活的 $U_\theta$. 常见的局部性假设是
$$ U_\theta=\sum_i \varepsilon_\theta(\mathcal N_i), $$即总能量是各原子局部环境 $\mathcal N_i$ 贡献之和. 训练范围足够广、可覆盖多元素和多种材料体系的 MLIP, 通常又称为通用或基础原子势.
原子势的精度不会自动超过其参考数据. 它在未见过的成分、配位、电荷态或高能构型上可能发生严重外推误差, 所以它适合快速松弛和粗筛候选, 关键结论仍应由 DFT 或实验复核.
定向发现新化合物
对晶体材料, 当时主要路线是确定一种晶体原型, 再遍历元素组合. 例如模型可预测一个组分采用 Heusler 或 half-Heusler 结构的概率.
分子设计则走得更远. 经典的 QSAR (定量结构-活性关系) 从分子描述符预测生物活性; GAN 与强化学习则开始直接设计分子. 论文举出的 ORGAN 将对抗生成与奖励函数结合, 使新分子在保持多样性的同时偏向指定的化学特征或物理/生物性质.
论文同时指出, 固体材料的生成当时明显落后于分子: 元素组成、周期晶格、原子坐标与无限多个等价表示必须同时处理.
从文献中回收知识
大量合成条件、失败实验和材料性质只存在于论文正文、表格或补充材料中. 文本挖掘的任务是从非结构化文本中抽取实体、事实和关系, 建成可搜索的专用数据库, 支持药物-靶点关联、高通量实验分析和材料数据库建设. 但附件格式不统一、元数据缺失与命名不一致, 会使自动抽取难以互操作; 所以论文将可访问、可复用和标准化的科研数据视为后续发展的基础.
CHGGen
[] Unknown-material 保留已有晶体的 host 骨架, 只生成或重新安排其中的 guest 原子. 可以写成
$$ p\!\left(\mathbf x_{\mathrm{guest}}\mid \mathbf x_{\mathrm{host}},\,\mathbf L,\,\mathbf a\right), $$其中 $\mathbf x_{\mathrm{host}}$ 是保留的骨架原子, $\mathbf x_{\mathrm{guest}}$ 是需要补全的原子坐标, $\mathbf L$ 是晶格, $\mathbf a$ 是元素种类. 这属于结构条件生成.
为什么需要 host?
基于 GNN 的扩散模型很擅长学习短程键长和局部配位, 但有限的消息传播范围使它不容易维持长程周期秩序. 论文在 $\mathrm{Li_{32}P_{16}S_{56}}$ 超晶胞上展示了这种 locality bias:生成结构中 Li-S 和 P-S 的局部径向分布看起来合理, 整体却变成缺乏长程晶格秩序的“局部片段马赛克”.
CHGGen 的思路是不让模型重新发明整个晶体. 已有 host 提供长程对称性和周期骨架, 扩散模型只需在这个上下文中寻找 guest 的合理位置.
晶体 inpainting
Inpainting 来自图像补全:图片的已知区域保持不变, 模型只填充被遮挡的区域. 在晶体中, mask $\mathbf m$ 不再划分像素, 而是划分 host 和 guest 原子. 每个反向扩散步都将已知 host 加噪到当前噪声尺度, 对全部原子做一次去噪, 再用 mask 拼回:
$$ \mathbf x_{t-1} =(1-\mathbf m)\odot \mathbf x^{\mathrm{host}}_{t-1} +\mathbf m\odot \mathbf x^{\mathrm{model}}_{t-1}. $$当 $m_i=0$ 时取 host 坐标, $m_i=1$ 时取模型生成的 guest 坐标. 论文还使用 RePaint 式 resampling:在同一噪声尺度上反复跳回并重新去噪, 让 guest 多尝试几次如何与 host 衔接.
算法CHGGen
输入 > 指定元素组成和原子数, 以及相关晶体提供或成分模型预测的原子体积先验 $V_0$.
输出 > 经基础势和 DFT 筛选的新晶体候选.
- 以 $N V_0$ 估计晶胞体积, 随机搜索 Bravais 晶格, 并随机初始化全部原子坐标.
- 用基于 NequIP 的 SE(3)-等变 GNN 预测 score, 进行无条件反向扩散; 然后用 CHGNet 同时松弛晶格和原子坐标.
- 移除局部配位很灵活的 guest 原子, 对剩余 host 用 spglib 逐步放宽容差做对称性精修.
- 在精修后的 host 中重新随机初始化 guest, 通过 mask 和重采样执行条件扩散补全.
- 用 CHGNet 松弛候选并估计相对 Materials Project 相图的分解能 $E_d$; 仅将低 $E_d$ 候选送入 r2SCAN-DFT 做更可信的验证.
两个材料域
Zn-P-S:从相关硫化物骨架向新化学空间延伸
论文在 ZnS-P$_2$S$_5$ 化学空间中搜索 ZnP$_2$S$_6$ 和 Zn$_2$P$_2$S$_7$. 多数生成结构在 CHGNet 松弛前后的中位能量变化为 $0.08\,\mathrm{eV/atom}$, 中位最大成对 RMSD 为 $0.10\,\text{Å}$, 说明它们多数已在局部能量极小值附近. 基础势预测有 6.5% 的结构处于凸包上, 但 r2SCAN-DFT 将这些候选修正为亚稳态; 最低分解能分别为 $0.015$ 和 $0.046\,\mathrm{eV/atom}$.
这个“未成功”的结果很有价值:CHGNet 对高分解能有系统性低估, 误差约为 $30\,\mathrm{meV/atom}$, 所以基础势只适合粗筛, 不能代替最后的 DFT 判定. 尽管没找到新的凸包稳定相, inpainting 生成对称晶体的成功率仍显著高于无条件生成, 后者低于 5%.
Li-Si:在已知合金附近寻找新多晶型
在 Li-Si 体系中, Materials Project 当时有 13 个 DFT 结构, 其中 4 个在 $0\,\mathrm K$ 处于凸包上. CHGGen 生成的 $\mathrm{Li_5Si_2}$ $R\bar 3m$ 多晶型经 r2SCAN-DFT 得到 $E_d=-7\,\mathrm{meV/atom}$; 还找到了 $\mathrm{Li_5Si_2}$、$\mathrm{Li_2Si}$ 和 $\mathrm{Li_4Si}$ 的低能 $C2/m$ 亚稳多晶型. 不过这个 $\mathrm{Li_5Si_2}$ 稳定结构已被遗传算法和随机结构搜索报道过, 因此它验证了方法能力, 但不算首次发现的新晶体.
如何看待这篇论文?
CHGGen 比 CrystalGAN 更接近现代材料生成的完整形态:对称性已经进入结构先验, 反向扩散由 SE(3)-等变网络实现, 大批候选先由基础势松弛和筛选, 最后再用 DFT 复核. 而且 inpainting 与现有生成模型是模块化的:同一个扩散模型只要在采样时改变 mask, 就能从无条件生成切换到已有骨架上的条件生成.
但它仍是 proof of concept. host 的获得依赖先做无条件生成, 对称精修只是通过 spglib 放宽容差, 生成结构也多为 $C2$ 或 $Cm$ 这样的中等对称性. MatterGen 在 Li-Si 上表现更好, 各类 GNN 扩散模型在晶胞变大时都还有扩展性问题, 论文也没有进行实验合成. 因此它最重要的贡献是 一种从现有晶体骨架出发进行局部生成的方法, 而不是宣布已经解决了新材料发现.
入门综述
- Butler et al., 2018, [] : 建立机器学习与材料科学的整体问题框架.
- Ramprasad et al., 2017, [] : 理解材料描述符、代理模型、小数据和不确定性.
- Pyzer-Knapp et al., 2025, [] : 连接性质预测、生成模型、合成规划与材料基础模型.
- Yuan et al., 2026, [] : 集中理解大型原子模型和机器学习原子势的发展路线.
经典文献
数据与表示
- Jain et al., 2013, [] : Materials Project 与高通量材料数据库.
- Schütt et al., 2017, [] : 连续滤波器与三维原子表示.
- Xie and Grossman, 2018, [] : 将周期性晶体表示为图并预测材料性质.
- Chen et al., 2019, [] : 统一原子、键与全局状态的材料图网络.
原子势与模拟
- Behler and Parrinello, 2007, [] : 用神经网络近似高维势能面.
- Batzner et al., 2022, [] : E(3) 等变图神经网络原子势.
- Chen and Ong, 2022, [] : 面向周期表范围的通用图网络原子势.
逆向设计与发现闭环
- Sanchez-Lengeling and Aspuru-Guzik, 2018, [] : 从目标性质出发进行生成式逆向设计.
- Nouira et al., 2018, [] : 从已知二元氢化物生成三元晶体的历史性尝试.
- Merchant et al., 2023, [] : 图网络、DFT 验证与主动学习组成的大规模材料发现流程.
- Szymanski et al., 2023, [] : 把候选筛选、合成规划、机器人和实验反馈连接成闭环.
2025–2026 新进展
生成式材料设计
- Zeni et al., 2025, [] : 联合生成元素、坐标与周期晶格, 并按目标性质进行条件生成.
- Zhong et al., 2025, [] : 在已有 host 晶体中补全 guest 原子, 并用基础势和 DFT 验证.
- Dobberstein and Hamaekers, 2026, [] : 以自回归方式逐步生成材料结构, 作为扩散模型之外的新路线.
原子基础模型与开放数据
- Wood et al., 2025, [] : 跨材料、分子和催化体系训练的 Universal Models for Atoms.
- Batatia et al., 2025, [] : 预训练原子势的开箱使用与少样本微调.
- Barroso-Luque et al., 2026, [] : 大规模开放 DFT 数据集及预训练 EquiformerV2 模型.
- Liang et al., 2026, [] : 在元素覆盖、精度与原子模拟速度之间寻求平衡.
- Peng et al., 2026, [] : 在统一设置下比较大型原子模型的泛化能力.
合成、实验与智能体
- Park et al., 2026, [] : 区分计算稳定性、动力学稳定性与实验可合成性.
- Canty and Abolhasani, 2026, [] : 自驱动实验室的历史、基础设施与开放问题.
- Ghafarollahi and Buehler, 2026, [] : 多智能体规划、物理验证和迭代改进的材料发现流程.
建议阅读顺序
- Butler 2018 与 Ramprasad 2017: 建立领域词汇.
- Materials Project、CGCNN 与 SchNet: 理解数据和结构表示.
- Behler–Parrinello、NequIP 与 M3GNet: 理解能量、力和等变性.
- CHGGen: 理解“已有晶体骨架 → 新 guest 原子排布”的结构补全.
- GNoME、MatterGen: 进入大规模发现与按目标性质生成.
- A-Lab、Synthesis Gap: 理解从计算候选到真实合成之间的距离.
- UMA、MACE-MP-0、OMat24、LAMBench: 跟进材料基础模型与评测.
阅读每篇论文时记录六个问题: 材料如何表示, 标签从哪里来, 模型预测什么, 使用了哪些物理对称性, 测试是否真正分布外, 以及结果经过了何种计算或实验验证.