awesome_materials_datasets
收藏官方服务:
资源简介:
这是一个汇总了多个材料科学数据集的仓库,包括Materials Project、Alexandria、OQMD、LeMaterial等,提供了每个数据集的材料数量、结构数量、近似大小和下载链接。
This is a repository aggregating multiple materials science datasets, including Materials Project, Alexandria, OQMD, LeMaterial, etc., and provides the quantity of materials, quantity of structures, approximate size, and download links for each dataset.
创建时间:
2026-06-01
原始信息汇总
数据集汇总列表:awesome_materials_datasets
该页面收录了多个材料科学领域的主流数据库,并提供了各自包含的材料数量、结构数量以及下载链接。以下是详细汇总:
主要数据库概览(按材料/结构数量排列)
| 数据库名称 | 材料数量 | 结构数量 | 备注 |
|---|---|---|---|
| LeMaterial (All) | 5,860,446 | 6,725,590 | 包含全部数据 |
| Alexandria | 4,635,066 | 5,459,260 | — |
| LeMaterial (Compatible, PBE) | 5,335,299 | 5,335,299 | 兼容PBE泛函 |
| AFLOW | 3,900,000 | — | 源自aflowlib |
| OQMD | 1,076,926 | 1,076,926 | — |
| Materials Project | 148,453 | 189,403 | — |
| LeMaterial (Compatible, PBESOL) | 447,824 | 447,824 | 兼容PBESOL泛函 |
| LeMaterial (Compatible, SCAN) | 422,840 | 422,840 | 兼容SCAN泛函 |
下载链接与数据规模
| 数据库 | 约计大小 | 官方/下载链接 |
|---|---|---|
| ICSD | 335,032 (2026.2版本) | https://icsd.products.fiz-karlsruhe.de/(商业数据库) |
| LeMaterial | 5.8M | Hugging Face: LeMat-Bulk;文档 |
| Materials Project | 200,000 | https://materialsproject.org/ |
| OQMD | 1M | https://oqmd.org/ |
| Alexandria database | 4.6M | https://alexandria.icams.rub.de/ |
| OMat24 | — | Hugging Face: facebook/OMAT24 |
| AFLOW | 3.9M | https://www.aflowlib.org/ |
注意:以上所有链接均为原始页面提供的官方地址,可直接访问获取数据。
搜集汇总
数据集介绍

构建方式
在计算材料科学领域,大规模结构数据库的构建是推动材料基因组计划发展的关键基础。该数据集通过整合全球多个权威材料数据库的晶体结构数据而成,涵盖了Materials Project、OQMD、Alexandria、AFLOW以及LeMaterial等主流平台。构建过程主要基于密度泛函理论(DFT)的高通量计算,对不同泛函(如PBE、PBESOL、SCAN)计算的结构进行系统归类与兼容性筛选,最终汇聚成包含逾千万条材料记录的超大规模结构化数据集。
使用方法
使用者可通过Hugging Face平台直接下载LeMaterial等子集的完整数据,具体访问链接为https://huggingface.co/datasets/LeMaterial/LeMat-Bulk,数据集文档详见lematerial.org。其他数据库如Materials Project、OQMD与Alexandria则可通过其官方网站的API接口或数据下载页面获取结构文件与元信息。建议结合pymatgen、ASE等开源材料学工具进行数据解析与格式转换,利用材料标识符进行跨库关联分析,从而在高通量筛选、性质预测或图神经网络训练等场景中充分发挥该多源数据集的综合价值。
背景与挑战
背景概述
材料科学作为现代工业的基石,其发展高度依赖于对海量晶体结构数据的系统化挖掘。在此背景下,awesome_materials_datasets数据集应运而生,由全球多个顶尖研究机构联合构建,涵盖Materials Project、Alexandria、OQMD、LeMaterial等核心数据库,共计超过560万种材料及670万条结构信息。该数据集旨在整合分散的晶体学数据,为高通量计算、机器学习力场训练及新材料的逆向设计提供标准化资源。自发布以来,它已成为连接第一性原理计算与数据驱动研究的桥梁,推动着催化剂、电池材料及超导体的虚拟筛选,对加速材料基因组计划的研究范式具有深远影响。
当前挑战
该数据集面临的核心挑战在于数据异构性与计算一致性。尽管LeMaterial已针对PBE、PBESOL、SCAN等泛函进行兼容性分类,但不同数据库(如ICSD与OQMD)的晶体结构优化标准、对称性处理及缺失值填充策略仍存在显著差异,导致跨库联合建模时面临标签噪声与特征偏移的困扰。构建过程中,从逾千万级候选结构中筛选高质量条目需解决计算资源瓶颈:例如Alexandria的4.6M结构需平衡DFT精度与通量,而5.8M规模的LeMaterial存储与传输亦对分布式索引架构提出严苛要求。此外,商业数据库ICSD的访问限制进一步加剧了数据获取与复现的壁垒。
常用场景
经典使用场景
在计算材料科学领域,大规模晶体结构数据库是驱动高性能材料发现的基石。awesome_materials_datasets 数据集汇总了包括 Materials Project、OQMD、Alexandria 以及 LeMaterial 在内的多个顶尖公开数据库,涵盖了数百万种已知与预测的无机晶体结构及其对应的高通量密度泛函理论(DFT)计算属性。该数据集最经典的使用场景是作为训练集,用于构建预测晶体结构稳定性、带隙、形成能等关键物理化学性质的机器学习模型。研究者常从中抽取子集,结合图神经网络或等变神经网络框架(如 M3GNet、CHGNet),实现从成分到性质的端到端预测,极大加速候选材料的虚拟筛选流程。
解决学术问题
该数据集系统性地解决了材料科学中两大核心学术瓶颈:数据碎片化与标注规模不足。过往研究受限于单一数据库(如仅用 Materials Project 约15万条记录)导致模型泛化能力弱,而该汇总集合逾千万个结构-属性对,为训练普适性预训练模型(如 Darwin、Matbench-Discovery)提供了足量、多样且经统一兼容性处理的高质量样本。基于此,学界得以定量探究晶体结构表示学习的迁移性、多任务优化策略及不确定性估计等前沿问题。其对 PBE、PBESOL、SCAN 等多种泛函版本的兼容标注,更是厘清了不同近似对属性预测精度的影响,推动了可解释材料智能的发展。
实际应用
在实际工业界,awesome_materials_datasets 衍生为高通量虚拟筛选管线中的标准参照基准。能源材料企业利用其训练替代DFT的代理模型,快速评估数千种新型电极材料或固态电解质的离子电导率与相稳定性,将传统数月级的计算周期缩短至数小时。例如,搭配 OQMD 与 Alexandria 数据库的联合训练模型,已成功应用于筛选钙钛矿光伏吸收层与无钴高镍正极材料。此外,该数据集也被嵌入材料基因组工作流中,通过自动编码器对不稳定结构进行过滤,仅保留符合热力学凸包阈值的候选对象,显著降低后续实验合成的试错成本。
数据集最近研究
最新研究方向
在材料科学领域,高通量计算与数据驱动范式正深刻重塑新材料的发现路径。awesome_materials_datasets 汇聚了如Materials Project、Alexandria、OQMD、LeMaterial等知名数据库,涵盖从数十万到数百万级不等的材料结构与性质数据,构建了迄今为止最庞大的开源材料数据生态。当前前沿研究方向聚焦于利用这些海量数据训练先进的图神经网络与基础模型(如OMat24),实现材料性能的精准预测与逆向设计。结合人工智能与自动化实验平台,研究者正加速推进新型电池材料、催化剂的理性筛选,这一趋势不仅降低了试错成本,更开启了“AI for Materials”的黄金时代,对推动可持续能源与绿色制造具有深远意义。
以上内容由遇见数据集搜集并总结生成



