遇见数据集

zihaojing/EDT-Former-pretrain-data

收藏
Hugging Face2026-05-13 更新2026-05-31 收录
官方服务:

资源简介:

该数据集用于训练Stage 1 EDT-Former编码器,该编码器学习将分子图表示与文本对齐。它源自PubChem分子,这些分子带有BRICS片段ID和熵引导图ID的注释。

许可证:MIT许可证 任务类别: - 文本生成 语言: - 英语 标签: - 分子 - 化学 - 预训练 - 图大语言模型(Graph-LLM) - SMILES 美观名称:EDT-Former编码器预训练数据集 样本规模区间:1000万 < 样本数 < 1亿 # EDT-Former编码器预训练数据集 本数据集为**EDT-Former**第一阶段编码器的预训练语料库,相关细节见于ICLR 2026收录论文: > **面向分子理解的图大语言模型对齐任务的熵引导动态Token** > 作者:Jing Zihao, Zeng Qiuhao, Fang Ruiyi, Sun Yan, Wang Boyu, Hu Pingzhao > *ICLR 2026* · [论文](https://www.arxiv.org/abs/2602.02742) · [代码](https://github.com/selmiss/DQ-Former) ## 数据集说明 本数据集用于训练EDT-Former第一阶段编码器,该编码器旨在实现分子图表征与文本的对齐。数据集源自标注了BRICS片段标识符与熵引导图标识符的PubChem分子库。 ## 数据格式 各数据子集均以JSONL格式存储,每行即为一个代表单条分子-文本对的JSON对象,包含图特征、SMILES字符串及关联文本描述。 | 数据子集 | 文件名 | 大小 | |-------|------|------| | 训练集 | `train.jsonl` | ~12 GB | | 验证集 | `val.jsonl` | ~37 MB | | 测试集 | `test.jsonl` | ~78 MB | ## 使用方法 python from datasets import load_dataset dataset = load_dataset("zihaojing/EDT-Former-pretrain-data") 也可在EDT-Former配置文件中引用该数据集: yaml # configs/stage1_dqw2d/data_config_preprocessed.yaml use_preprocessed: true preprocessed_data: zihaojing/EDT-Former-pretrain-data ## 相关资源 | 资源类型 | 链接 | |----------|------| | 监督微调数据集 | [zihaojing/EDT-Former-sft-data](https://huggingface.co/datasets/zihaojing/EDT-Former-sft-data) | | 第一阶段编码器 | [zihaojing/EDT-Former-encoder](https://huggingface.co/zihaojing/EDT-Former-encoder) | | 完整模型(第二阶段) | [zihaojing/EDT-Former-model](https://huggingface.co/zihaojing/EDT-Former-model) | | 代码 | [selmiss/DQ-Former](https://github.com/selmiss/DQ-Former) | ## 引用格式 bibtex @inproceedings{jing2026edtformer, title={Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding}, author={Jing, Zihao and Zeng, Qiuhao and Fang, Ruiyi and Sun, Yan and Wang, Boyu and Hu, Pingzhao}, booktitle={International Conference on Learning Representations (ICLR)}, year={2026} }

提供机构:
zihaojing
二维码
社区交流群
二维码
科研交流群
商业服务