liupf/ChEBI-20-MM
收藏资源简介:
ChEBI-20-MM数据集是一个扩展自ChEBI-20数据集的多模态基准数据集,专注于分子科学领域。该数据集整合了多种分子数据模态,包括InChI、IUPAC、SELFIES和图像,旨在评估模型在分子生成、图像识别、IUPAC识别、分子描述和检索任务中的能力。通过增加数据模态的多样性,该数据集能够更全面地评估模型在多模态数据处理中的性能。
The ChEBI-20-MM dataset is a multimodal benchmark dataset extended from the ChEBI-20 dataset, focusing on the field of molecular science. It integrates various molecular data modalities including InChI, IUPAC, SELFIES and molecular images, aiming to evaluate the performance of models across tasks such as molecular generation, image recognition, IUPAC recognition, molecular description and retrieval. By increasing the diversity of data modalities, this dataset enables a more comprehensive assessment of model performance in multimodal data processing.
ChEBI-20-MM 数据集
概述
ChEBI-20-MM 是一个从 ChEBI-20 数据集发展而来的广泛且多模态的基准测试。它旨在为分子科学领域的各种模型的能力提供全面的基准测试。该基准集成了多模态数据,包括 InChI、IUPAC、SELFIES 和图像,使其成为广泛分子任务的多功能工具。
数据集描述
ChEBI-20-MM 是原始 ChEBI-20 数据集的扩展,重点在于整合多种分子数据模态。该基准旨在评估模型在以下关键领域的能力:
- 分子生成:评估模型生成准确分子结构的能力。
- 图像识别:测试模型在将分子图像转换为其他表示格式方面的熟练程度。
- IUPAC 识别:评估模型从其他表示格式生成 IUPAC 名称的能力。
- 分子描述:评估模型生成分子结构描述性描述的能力。
- 检索任务:衡量模型在准确高效地检索分子信息方面的有效性。
实用性和重要性
通过扩展数据模态的多样性,该基准能够更全面地评估模型在多模态数据处理方面的性能。
数据可视化
我们采用可视化技术来分析数据源对语言模型的适用性和化学空间覆盖范围。下图展示我们使用不同的可视化方法来分析由每个模型的分词器生成的文本长度分布和标记计数,这些方法评估了语言模型对我们数据集文本特征的适应性。

我们还关注数据集中前10个支架,统计每个支架的分子数量。在这里,半透明条表示总数,而实心条表示训练集中的数量。另一方面,对于化学空间覆盖范围的分析,我们选择分子量(MW)、LogP、芳香环数量和拓扑极性表面积(TPSA)作为描述符。我们检查这些描述符在数据集中的分布和相关性,提供对我们数据中化学多样性和复杂性的见解。




