antiTINA-botanical-recovery-matrix
收藏官方服务:
资源简介:
该数据集包含一系列植物化学物质的分子、药理学和安全性特征数据。每个数据样本提供了植物化学物质的详细信息,包括其来源植物部分(ifs_part)、名称(phytochemical_name)和SMILES字符串(smiles_string)等化学标识符。分子描述符涵盖分子量(molecular_weight)、亲脂性(logp)和拓扑极性表面积(tpsa)。药理学特征聚焦于神经科学领域,包括推测的神经靶点(neuro_target_drop)、血脑屏障渗透性评分(bbb_permeability_score)以及可能的转运机制(transport_mechanism)。安全性评估数据包括肝毒性标志(hepatotoxicity_flag)和来自ChEMBL数据库的安全性信息(ChEMBL_Safety)。此外,数据还包含标准化配方百分比(normalized_formula_percentage),可能指示在配方中的含量。数据集规模较小,仅包含3个训练样本。基于其特征组合,该数据集适用于计算药物发现、植物化学物质筛选、神经活性化合物预测,以及涉及血脑屏障渗透性和安全性评估的研究任务。
创建时间:
2026-06-20
原始信息汇总
数据集名称
antiTINA-botanical-recovery-matrix
数据集来源
- 链接: https://huggingface.co/datasets/Squillaci88/antiTINA-botanical-recovery-matrix
数据集描述
该数据集是一个关于植物化学物质与血脑屏障(BBB)渗透性、神经靶点、肝毒性等相关信息的结构化数据集,主要关注“ifs_part”与“neuro_target_drop”等特征,可能用于分析植物成分在神经系统中的作用及安全性。
数据集特征
数据集包含以下12个字段:
- ifs_part: 字符串类型,可能代表植物部分或成分来源。
- neuro_target_drop: 字符串类型,可能表示神经靶点或作用机制。
- phytochemical_name: 字符串类型,植物化学物质名称。
- smiles_string: 字符串类型,化学结构的SMILES表示。
- molecular_weight: 浮点数类型,分子量。
- logp: 浮点数类型,脂水分配系数(LogP)。
- tpsa: 浮点数类型,拓扑极性表面积(TPSA)。
- bbb_permeability_score: 浮点数类型,血脑屏障渗透性评分。
- transport_mechanism: 字符串类型,运输机制。
- hepatotoxicity_flag: 布尔类型,肝毒性标记(True/False)。
- normalized_formula_percentage: 浮点数类型,标准化配方百分比。
- ChEMBL_Safety: 字符串类型,基于ChEMBL数据库的安全性评估。
数据集划分
- 训练集(train): 包含 3个样本,大小为 807字节。
数据文件
- 格式: 默认配置(default)下的数据文件路径为:
data/train-*
数据集大小
- 下载大小: 6642 字节
- 数据集总大小: 807 字节
搜集汇总
数据集介绍

构建方式
该数据集名为antiTINA-botanical-recovery-matrix,旨在整合植物化学信息与神经靶点活性数据,以构建多维度生物活性矩阵。数据集的构建过程涵盖了植物化学物质的结构特征、理化性质及生物活性指标,包括分子量(logP)、拓扑极性表面积(TPSA)、血脑屏障通透性评分、转运机制、肝毒性标志及归一化配方百分比。此外,还整合了ChEMBL数据库中的安全性评估信息。通过对三项具体样本的标注与结构化,构建出一个小型但高关联性的矩阵数据集,便于开展植物化学物质神经靶向活性的初步关联分析。
特点
该数据集的核心特点在于其跨学科、多模态的信息融合。它同时包含了植物化学物质的SMILES字符串、神经靶点自发性下降指标、以及多种理化性质参数。数据集中还通过血脑屏障通透性评分与转运机制字段,展现了植物化学物质在中枢神经系统渗透性方面的潜力。同时,肝毒性标志与ChEMBL安全性两类字段的引入,使得数据兼具生物活性与毒理学视角,能够在早期筛选阶段实现功效与风险的并行评估。这种结构化的矩阵式设计,有利于支持多变量分析和特征关联探索。
使用方法
该数据集以默认配置存储于HuggingFace平台,包含单一训练集分割,共3个样本。用户可通过HuggingFace Datasets库直接加载,使用`load_dataset('antiTINA-botanical-recovery-matrix', split='train')`命令快速获取数据。加载后即可对其特征字段进行提取与分析,利用分子量、LogP、TPSA等连续型变量进行回归预测,或基于肝毒性标志及安全性标签开展分类研究。数据集体积小巧,适合作为基准或概念验证任务中快速实验的数据源,亦可用于探索植物化学物质神经靶向活性的初步模型训练与评估。
背景与挑战
背景概述
antiTINA-botanical-recovery-matrix数据集是在神经炎症与天然植物化学交叉领域应运而生的新兴资源,旨在系统整合植物源化合物对血脑屏障穿透性及神经靶点调控的分子特征。该数据集由致力于药物发现与计算毒理学的研究团队构建,核心研究问题聚焦于评估天然产物在阿尔茨海默症、帕金森病等神经系统疾病中的治疗潜力,尤其关注其血脑屏障渗透性、肝毒性风险及跨膜转运机制。尽管数据集规模尚小,但因其独特的生物活性多维标注(如BBB通透性评分、转运机制、肝毒性标志),为植物化学库的虚拟筛选与神经药物设计提供了基础性训练样本,有望推动传统植物药现代化与精准神经治疗学的交叉研究。
当前挑战
该数据集面临的核心挑战在于多维度生物活性标注的精确性与跨域泛化能力。首先,天然化合物血脑屏障穿透性的预测需综合分子极性(TPSA)、脂溶性(LogP)与主动转运机制,现有标注依赖计算模型与体外实验,存在系统误差;其次,肝毒性标志(hepatotoxicity_flag)与ChEMBL安全性标签的整合需克服异质数据源的标注一致性问题,当前仅3条样本的规模难以支撑可靠建模;此外,缺乏对化合物构象柔性、代谢稳定性及靶点结合动态的量化,限制了其在真实神经药物发现中的实用性。构建过程中,从文献挖掘与公共数据库提取归一化分子式百分比、神经靶点相互作用等特征时,面临数据稀疏与命名实体歧义的挑战,进一步增加了数据清洗与质量控制的复杂性。
常用场景
经典使用场景
antiTINA-botanical-recovery-matrix数据集聚焦于植物化学组分的神经活性与安全性评估,为药物发现与神经科学领域提供了一条创新的数据路径。该数据集整合了植物化学成分的分子描述符(如SMILES结构、分子量、LogP)、血脑屏障渗透性评分、转运机制及肝毒性标志等关键指标,尤其适用于构建基于机器学习的预测模型,以筛选潜在的中枢神经系统活性天然产物。研究人员可通过该数据集开展反向虚拟筛选,识别能够高效穿越血脑屏障且安全性良好的植物源先导化合物,为天然药物研发奠定数据基础。
解决学术问题
该数据集针对天然产物研究中普遍存在的活性成分复杂、安全性数据匮乏的困境,提供了一种结构化的解决方案。通过整合标准化分子参数与多维度生物活性标签,它有助于解决植物化学组分血脑屏障通透性预测、神经靶向选择性以及肝毒性风险评估等关键学术难题。其引入的归一化配方百分比与ChEMBL安全注释,为量化植物提取物中活性成分的贡献度提供了新思路,推动了从传统植物药理经验向计算筛选范式的转变,对构建天然产物神经药理学知识图谱具有深远学术意义。
衍生相关工作
基于该数据集的衍生产品包括面向天然产物神经活性预测的图神经网络模型,其利用分子图拓扑结构进行迁移学习,拓展了传统构效关系研究的边界。此外,相关工作还催生了植物化学组分的多目标优化算法,旨在平衡神经效能与安全性,并衍生出整合网络药理学与机器学习的中药复方合理性评估框架。这些工作共同推动了数据驱动的植物神经药理学发展,为构建大规模、标准化的天然产物生物活性数据库提供了参考基准。
以上内容由遇见数据集搜集并总结生成



