遇见数据集

Batt-SLM/Batt-P30K datasets

收藏
github2026-07-16 更新2026-07-23 收录
官方服务:

资源简介:

Batt-SLM数据集包含115,756个电池溶剂样分子,用于训练生成器;Batt-P30K数据集是DFT标记的子集,包含29,519个分子,用于机器学习预测氧化还原电位和螯合倾向指数。

The Batt-SLM dataset comprises 115,756 battery solvent-analogous molecules, intended for generator training. The Batt-P30K dataset, a DFT-labeled subset containing 29,519 molecules, is employed for machine learning-driven predictions of redox potentials and chelating propensity indices.

创建时间:
2026-06-28
原始信息汇总

Batt-SLM 数据集详情

数据集概述

Batt-SLM 是一个电池溶剂类分子数据集,主要包含两个子数据集:

  • Batt-SLM:包含 115,756 个电池溶剂类分子,用于训练生成模型。
  • Batt-P30K:包含 29,519 个经过 DFT 标记的子集,提供详细的电子结构性质。

该数据集与以下学术论文相关:Z.-Y. Zhang, R. Mercado., T. T. Le, C. Zhang, Unlocking the Chemical Space for Rechargeable Batteries with Generative Solvent Design System, ACS Nano, 2026, DOI: 10.1021/acsnano.6c06255。

数据集结构

Batt-SLM 子集

  • Batt-SLM.smi:用于训练生成器的分子 SMILES 文件。
  • filter_smiles.py:从给定 SMILES 中过滤分子的 Python 脚本。

Batt-P30K 子集

以 HDF5 (.h5) 格式存储,每个分子以独立的 HDF5 组保存,组名为分子 ID。所有电子性质均在 ωB97X-V/def2-TZVPPD/SMD(ε=18.5) 理论水平上计算得到。

每个分子组包含以下字段:

字段 形状 类型 描述
smiles (1,) string 分子的规范 SMILES 表示
elems (N_atoms,) string 原子元素符号
coord (N_atoms, 3) float32 所有原子的笛卡尔坐标(单位:Å)
ener (1,) float32 中性分子的总能量
ener_anion (1,) float32 阴离子的总能量
ener_cation (1,) float32 阳离子的总能量
homo (1,) float32 最高占据分子轨道(HOMO)能量
lumo (1,) float32 最低未占分子轨道(LUMO)能量
gap (1,) float32 HOMO-LUMO 能隙
ea (1,) float32 电子亲和能(EA)
ip (1,) float32 电离势(IP)
dipole (3,) float32 偶极矩 (x, y, z)
quadrupole (6,) float32 四极矩的六个独立分量

该子集还包含用于属性预测的 PiNet2 模型(HOMO、LUMO、IP、EA、偶极矩)以及相关源代码(build_pinet2.py)。

属性预测模型

氧化还原电位预测(Redox-Pot)

  • 基于 EA/IP 与氧化还原自由能的线性拟合(使用 RX-392 数据集)。
  • 包含线性拟合代码 redox_free_ener.py 和预测代码 redox_potential.py
  • 拟合结果图保存在 LR-EAIP-RedoxFreeEner/EAIP_Redox.jpg

螯合倾向指数预测(CPI)

  • 基于逻辑回归模型,使用 87 种电池溶剂的功能数据(SolvFunc-87.csv)。
  • 包含模型训练的随机测试和外部测试结果。
  • 提供预测函数 chelation_propensity_index.py 及测试代码 random_test.pyexternal_test.py
搜集汇总
数据集介绍
Batt-SLM/Batt-P30K datasets 数据集图片
构建方式
在可充电电池溶剂分子的广阔化学空间中,Batt-P30K数据集作为Batt-SLM庞大分子库中一个经过密度泛函理论(DFT)精确标注的子集应运而生。该数据集精心筛选了29,519个分子,所有分子的几何结构均基于ωB97X-V/def2-TZVPPD/SMD(ε=18.5)理论水平进行优化与电子性质计算。每个分子以独立的HDF5组形式存储,组名对应分子ID,内部完整保存了SMILES表示、原子种类、笛卡尔坐标以及中性分子、阴离子和阳离子的总能量,同时涵盖了HOMO、LUMO能级、能隙、电子亲和能、电离势、偶极矩和四极矩等关键电子结构参数。
使用方法
研究人员可通过Git仓库快速部署该数据集及相关工具。首先克隆项目并创建Conda环境,随后安装PiNN包并复制数据加载器至相应目录。训练PiNet2模型时,需手动下载Batt-P30K.h5文件,并在build_pinet2.py脚本中调整目标属性与随机种子后执行。对于氧化还原电位预测,用户只需将待测分子的XYZ文件放置于指定文件夹,运行redox_potential.py即可获得结果。整合倾向指数(CPI)的计算则更为直接,调用chelation_propensity_index.py中的predict_cpi函数即可完成对给定分子的评估。
背景与挑战
背景概述
Batt-P30K数据集由张子阳、Rocio Mercado、Trung T. Le与陈锐等研究人员于2026年发表在ACS Nano期刊上的工作中提出,其核心研究问题聚焦于探索可充电电池溶剂化学空间的系统性生成与筛选。该数据集包含29,519个经高精度密度泛函理论(ωB97X-V/def2-TZVPPD/SMD(ε=18.5))计算标记的类溶剂分子,提供了包括分子结构、能量、前线轨道能级、电子亲和能、电离势及多极矩在内的丰富电子性质。作为Batt-SLM更大分子库的量子力学标注子集,Batt-P30K为电池溶剂的高通量虚拟筛选与机器学习预测模型的训练奠定了坚实的数据基础,推动了生成式溶剂设计系统在能源材料领域的应用。
当前挑战
该数据集所解决的领域问题在于,传统电池溶剂研发依赖实验试错与有限化学空间的探索,效率低下且难以覆盖潜在高性能分子的多样性。Batt-P30K通过提供高质量量子力学标注的数据,使得机器学习模型能够精准预测氧化还原电位与螯合倾向指数,加速新型溶剂的发现。构建过程中面临的主要挑战包括:对超过十一万个类溶剂分子进行大规模量子化学计算的高昂计算成本,以及在不同分子体系中确保计算精度与一致性的技术难题。此外,数据存储采用HDF5格式兼顾了效率与可扩展性,但如何有效整合多尺度电子性质信息并平衡标注数据的代表性,仍是持续优化的方向。
常用场景
经典使用场景
Batt-P30K数据集专为高通量筛选锂离子电池溶剂分子而设计,其核心应用场景在于利用深度神经网络(如PiNet2)对分子电子性质进行精准预测。该数据集收录了约3万个经密度泛函理论(ωB97X-V/def2-TZVPPD/SMD)标注的类溶剂分子,涵盖了HOMO、LUMO、能隙、电离势、电子亲和能、偶极矩等关键电子结构参数。研究者可基于这些标注数据训练模型,实现从分子结构到电子性质的端到端映射,从而快速评估候选溶剂分子的氧化还原稳定性与电化学窗口。这一场景突破了传统实验试错法的效率瓶颈,为大规模虚拟筛选提供了可靠的数据基础。
解决学术问题
该数据集旨在解决电池溶剂领域长期存在的‘化学空间稀疏性’问题——即已知溶剂分子数量有限且实验表征成本高昂,导致新型电解液设计缺乏系统性理论指导。通过提供高精度、多维度的量子化学计算标签,Batt-P30K使得研究者能够量化溶剂分子的氧化还原电位、螯合倾向(CPI)等关键指标,从而建立‘结构-性质’关联模型。其重要性在于:一方面,它推动了机器学习从单纯的结构生成向性质驱动的逆向设计范式转型;另一方面,该数据集公开的PiNet2模型与线性拟合方程(EA/IP与氧化还原自由能的关系)为后续研究奠定了可复现的基准,显著加速了高电压、长循环寿命电池电解液的理性设计进程。
实际应用
在实际应用中,Batt-P30K数据集已成为生成式溶剂设计系统(GSDS)的核心组件,赋能工业界快速筛选适用于锂电池、钠电池乃至液流电池的新型溶剂。具体而言,研发人员可利用该数据集训练的模型对AI生成的虚拟分子库进行自动化性质评估:例如,通过预测分子的最高占据分子轨道(HOMO)与最低未占分子轨道(LUMO)能量,可预判其阳极稳定性与阴极兼容性;而偶极矩与螯合活性(CPI)的预测则有助于评估溶剂对金属离子的溶剂化能力。目前,该数据集已成功用于识别具有低粘度、高介电常数及优异抗氧化性的氟代溶剂候选物,部分分子已进入电化学测试阶段,显著缩短了从计算筛选到实验验证的迭代周期。
数据集最近研究
最新研究方向
在可再生能源迅猛发展的浪潮中,高性能电池的研发已成为推动能源转型的关键枢纽。Batt-P30K数据集作为电池溶剂类分子(Batt-SLM)的DFT标记子集,提供了29,519个分子的高精度电子结构信息,涵盖HOMO/LUMO能级、电子亲和能、电离势及偶极矩等关键性质。该数据集的前沿研究聚焦于利用机器学习模型(如PiNet2)预测氧化还原电位和螯合倾向指数(CPI),以加速新型电解液溶剂的理性设计。近期工作通过生成式溶剂设计系统(GSDS)探索广阔的化学空间,结合高通量筛选与物理信息约束,显著提升了电池能量密度与循环稳定性。这一研究范式不仅为锂离子电池、钠离子电池等体系提供了数据驱动的新路径,更推动了人工智能与电化学深度交叉的学科前沿发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务