遇见数据集

PITg-Curated

收藏
arXiv2026-07-31 更新2026-08-04 收录
官方服务:

资源简介:

PITg-Curated是一个专为聚酰亚胺玻璃化转变温度预测及结构设计而构建的精选数据集,由大连理工大学研究团队创建。该数据集包含10066条去重后的聚酰亚胺重复单元结构,并标注了对应的玻璃化转变温度(Tg)标签。数据集的构建过程包括从现有数据资源收集聚酰亚胺结构,经过严格的去重和清洗,确保每个重复单元唯一且具有可靠的Tg信息。该数据集主要用于聚酰亚胺结构-性质关系建模,支持目标条件下的结构生成、性能预测及候选结构推荐,旨在解决传统聚酰亚胺设计中候选结构性质偏差大、实验验证成本高的问题。

PITg-Curated is a curated dataset specifically developed for polyimide glass transition temperature (Tg) prediction and structural design, created by the research team from Dalian University of Technology. This dataset contains 10,066 deduplicated repeating unit structures of polyimides, with corresponding glass transition temperature (Tg) labels annotated. The dataset construction workflow includes collecting polyimide structures from existing data resources, followed by strict deduplication and cleaning steps to ensure each repeating unit is unique and accompanied by reliable Tg information. This dataset is primarily used for polyimide structure-property relationship modeling, supporting structure generation under target conditions, performance prediction, and candidate structure recommendation, aiming to address the issues of large property deviation of candidate structures and high experimental verification costs in traditional polyimide design.

创建时间:
2026-07-31
原始信息汇总

UniPolymer 数据集概述

项目简介

UniPolymer 是一个面向聚酰亚胺(PI)玻璃化转变温度(Tg)研究的数据集与工具包,提供正向预测逆向设计两条完整流程。

数据集构成

基础数据集

  • PI_Tg_10066.csv:统一项目数据集,包含 10,066 条数据,包含 smiles(化学结构)和 tg(玻璃化转变温度)两个核心列。

正向预测数据

  • PI_Tg_10066_with_desc_p1_m128.csv:完整 10,066 行的迁移训练表格,扩展至 145 列,包括 smilesvalue、15 个标量描述符以及 mfp_0mfp_127 共 128 个分子指纹特征。
  • PI_Tg_10066_holdout80_p1_m128.csv:确定性的 80 行留出验证集,使用相同特征模式。

逆向设计数据

  • data.xlsx:原始数据集转换格式,用于逆向设计脚本。
  • processed/:处理后的 SELFIES 数据集,包含 2,290 个唯一的 RDKit 验证结构,可由当前 SELFIES 编码器表示。

模型检查点

正向预测模型

  • 对比学习骨干网络contrastive_roberta/ 目录下
  • 最佳 Tg 预测模型PI_Tg_best_model.pt

逆向设计模型

  • 生成器检查点best_model_valloss_0.9011.pt,训练统计中 tg_min=19.0tg_max=460.0
  • GBR 正向评估器forward_model_best_r2_0.8535.pkl

功能模块

  1. 正向预测:支持 SMILES 或图像输入,预测 Tg 值,Web 后端使用打包的检查点进行单 SMILES 预测。
  2. 逆向设计:给定目标 Tg,生成候选 PI 结构,可通过命令行或 Web 界面操作。
  3. Web 应用:提供 /(SMILES/图像到 Tg 预测)和 /inverse(目标 Tg 到候选结构)两个界面。
  4. 终端演示:一键脚本生成演示结果。

使用说明

  • 模型文件较大,需使用 Git LFS 管理。
  • 推荐 Python 3.10 环境,通过 Conda 创建 unipolymer 环境并安装依赖。
  • 图像识别功能需要 DECIMER 及其模型文件;SMILES 预测和逆向生成无需 DECIMER。
搜集汇总
数据集介绍
PITg-Curated 数据集图片
构建方式
PITg-Curated数据集是针对聚酰亚胺玻璃化转变温度(Tg)预测与设计而构建的专用数据集,包含10066条去重后的聚酰亚胺重复单元结构及其对应的Tg标签。数据来源包括公开的聚合物数据库(如PoLyInfo)和同行评审文献,以及本文通过全原子分子动力学模拟补充计算的数据,其中模拟数据占比21.15%。所有结构经RDKit解析并标准化为规范SMILES表示,Tg值统一转换为摄氏度,并对同一结构的多个Tg标签取中位数作为最终标签,以降低数据源差异和测试条件的影响。该数据集的Tg范围覆盖19°C至730°C,主要集中在200–500°C区间,同时包含低温和高温区域,具备良好的温度分布广度。
特点
PITg-Curated数据集在结构组成上呈现显著的化学多样性,涵盖刚性稠环芳香结构、柔性醚桥、柔性烷基连接链、脂环单元、含氟基团、酮/羰基桥和砜桥等多种代表性结构基元,反映了链段刚性、桥接机制和局部化学环境的丰富差异。这种多样性为模型学习聚酰亚胺结构-Tg之间的复杂映射提供了充分的化学基础。此外,数据集的构建严格遵循去重和标准化流程,确保了结构表示的规范性和标签的可靠性,为监督学习和条件生成任务提供了高质量的训练数据。
使用方法
PITg-Curated数据集支持多种机器学习任务,尤其是聚酰亚胺Tg的预测和基于目标Tg的条件生成。在预测任务中,数据集以8:1:1的比例划分为训练集、验证集和测试集,模型使用SMILES序列表示结构,结合Transformer编码器提取序列语义,并融合RDKit分子描述符和Morgan指纹等多尺度特征进行Tg回归。在生成任务中,数据集的SELFIES表示用于训练条件生成模型,通过连续-离散联合Tg条件引导自回归生成。生成的候选结构可利用冻结的预测模型进行Tg评估,并结合化学有效性校验和聚酰亚胺骨架约束进行筛选与排序,最终推荐满足目标Tg的高质量候选结构。
背景与挑战
背景概述
聚酰亚胺(PI)因其卓越的热稳定性、机械性能与耐化学性,在航空航天、柔性电子及微电子封装等领域具有广泛应用。玻璃化转变温度(Tg)作为决定聚合物链段运动能力和适用温度范围的关键参数,其精确调控对特定应用场景的材料设计至关重要。然而,传统的聚酰亚胺研发依赖于经验驱动的结构组合与反复的合成-测试循环,需在广阔化学空间中进行筛选,导致成本高昂且开发周期冗长。为此,大连理工大学的研究团队在2026年构建了PITg-Curated数据集,包含10066条去重后的聚酰亚胺重复单元及其对应的Tg标签,其中约21%的数据来自自主分子动力学模拟,其余来源于公开数据库和文献。该数据集旨在为数据驱动的聚酰亚胺Tg预测和目标导向的结构生成提供坚实基础,支撑了UniPolymer框架的性能预测与候选结构推荐,对加速高性能聚酰亚胺材料的理性设计具有重要推动作用。
当前挑战
PITg-Curated数据集面临的挑战主要源于聚酰亚胺Tg的复杂决定机制与有限实验数据间的矛盾。Tg受局部化学环境、链段构象及多重结构因素协同影响,单一分子描述符或序列表征难以全面捕捉其结构-性能关系。此外,现有生成方法缺乏对生成结构与目标性能一致性的有效评估,导致大量低相关性候选结构进入后续阶段,徒增无效实验与研发成本。数据构建过程中,需严格整合来自多源数据库和文献的聚酰亚胺结构及Tg信息,需人工核验结构准确性、统一温度单位并处理重复结构,同时借助分子动力学模拟扩充数据量,这涉及计算成本高、标注一致性难以保障、不同来源间数据偏差校正等难题,共同构成了构建高质量、高可靠性数据集的显著挑战。
常用场景
经典使用场景
PITg-Curated数据集作为包含10066条去重聚酰亚胺重复单元及其玻璃化转变温度(Tg)标签的精选资源,主要用于构建和验证聚酰亚胺结构与Tg之间的定量构效关系模型。研究者利用该数据集进行监督式回归任务,通过分子描述符、指纹图谱及序列表示的融合,训练高精度预测器,以实现对Tg的快速、准确估计。此外,该数据集还支持迁移学习与预训练-微调策略,即将通用聚合物预训练模型的知识迁移至聚酰亚胺领域,从而在有限标注数据下提升预测性能。该场景聚焦于材料信息学中的核心挑战——从化学结构预测宏观热学性质,为后续的逆向设计提供可靠的基石。
解决学术问题
该数据集有效解决了聚酰亚胺Tg预测中实验数据稀缺、结构多样性高以及构效关系复杂等长期困扰学术界的难题。通过系统整合公共数据库、文献及分子动力学模拟数据,提供了大规模、高质量、去冗余的标注样本,缓解了数据不足导致的模型过拟合与泛化能力弱的问题。同时,PITg-Curated支持多尺度特征融合与自监督表征学习,使模型能够捕捉局部化学环境、链段构象及整体分子属性对Tg的联合影响,突破传统描述符或单一序列表示的局限性。这一数据资源显著提升了预测准确率(R²=0.93),为揭示聚酰亚胺结构-热性能关联的内在机制提供了坚实的数据基础,推动了数据驱动材料设计的理论发展。
衍生相关工作
基于PITg-Curated数据集,衍生出一系列前沿研究工作,推动了聚合物信息学与生成式设计的发展。首先,该数据集催生了统一框架UniPolymer的构建,其整合了性质预测、条件生成、候选评估与结构推荐,为聚酰亚胺设计提供了闭环解决方案。其次,围绕该数据集,研究者探索了自监督化学语义预训练、结构一致性增强(如随机SMILES对比学习)及多尺度信息融合等方法,这些技术显著提升了结构与性质映射的鲁棒性。此外,该数据集还促进了连续-离散联合Tg条件表示的创新,以及SELFIES自回归生成策略的优化,增强了生成结构的化学有效性与目标一致性。在评估维度上,衍生了结合RDKit解析性、酰亚胺骨架约束及分子性质检查的多层次验证体系,以及基于Tg偏差与结构约束的推荐排序算法,为材料逆设计提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务