maomlab/AqSolDB|化学数据集|数据分析数据集
收藏Aqueous Solubility Database (AqSolDB)
数据集概述
AqSolDB 是一个包含 9,982 个独特化合物的水溶性值的数据集,这些数据从 9 个不同的公开可用水溶性数据集中整理而来。
数据集信息
- 语言: 英语
- 许可证: MIT
- 来源: 精选
- 任务类别: 表格回归
- 标签: 化学, 化学信息学
- 大小类别: 1K<n<10K
- 配置名称: AqSolDB
数据文件
- 配置: AqSolDB
- 测试集:
- 路径: AqSolDB/test.csv
- 文件大小: 578736 字节
- 样本数量: 2494
- 训练集:
- 路径: AqSolDB/train.csv
- 文件大小: 1737344 字节
- 样本数量: 7488
- 测试集:
数据特征
- ID: 字符串
- Name: 字符串
- InChI: 字符串
- InChIKey: 字符串
- SMILES: 字符串
- Solubility: 浮点数 (float64)
- SD: 浮点数 (float64)
- Ocurrences: 整数 (int64)
- Group: 字符串
- MolWt: 浮点数 (float64)
- MolLogP: 浮点数 (float64)
- MolMR: 浮点数 (float64)
- HeavyAtomCount: 浮点数 (float64)
- NumHAcceptors: 浮点数 (float64)
- NumHDonors: 浮点数 (float64)
- NumHeteroatoms: 浮点数 (float64)
- NumRotatableBonds: 浮点数 (float64)
- NumValenceElectrons: 浮点数 (float64)
- NumAromaticRings: 浮点数 (float64)
- NumSaturatedRings: 浮点数 (float64)
- NumAliphaticRings: 浮点数 (float64)
- RingCount: 浮点数 (float64)
- TPSA: 浮点数 (float64)
- LabuteASA: 浮点数 (float64)
- BalabanJ: 浮点数 (float64)
- BertzCT: 浮点数 (float64)
- ClusterNo: 整数 (int64)
- MolCount: 整数 (int64)
- group: 字符串
引用
@article{ author = {Murat Cihan Sorkun, Abhishek Khetan & Süleyman Er}, title = {AqSolDB, a curated reference set of aqueous solubility and 2D descriptors for a diverse set of compounds}, journal = {Scientific Data}, year = {2019}, volume = {6}, number = {143}, month = {aug}, url = {https://www.nature.com/articles/s41597-019-0151-1}, publisher = {Springer Nature} }

CliMedBench
CliMedBench是一个大规模的中文医疗大语言模型评估基准,由华东师范大学等机构创建。该数据集包含33,735个问题,涵盖14个核心临床场景,主要来源于顶级三级医院的真实电子健康记录和考试练习。数据集的创建过程包括专家指导的数据选择和多轮质量控制,确保数据的真实性和可靠性。CliMedBench旨在评估和提升医疗大语言模型在临床决策支持、诊断和治疗建议等方面的能力,解决医疗领域中模型性能评估的不足问题。
arXiv 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
HazyDet
HazyDet是由解放军工程大学等机构创建的一个大规模数据集,专门用于雾霾场景下的无人机视角物体检测。该数据集包含383,000个真实世界实例,收集自自然雾霾环境和正常场景中人工添加的雾霾效果,以模拟恶劣天气条件。数据集的创建过程结合了深度估计和大气散射模型,确保了数据的真实性和多样性。HazyDet主要应用于无人机在恶劣天气条件下的物体检测,旨在提高无人机在复杂环境中的感知能力。
arXiv 收录
PDT Dataset
PDT数据集是由山东计算机科学中心(国家超级计算济南中心)和齐鲁工业大学(山东省科学院)联合开发的无人机目标检测数据集,专门用于检测树木病虫害。该数据集包含高分辨率和低分辨率两种版本,共计5775张图像,涵盖了健康和受病虫害影响的松树图像。数据集的创建过程包括实地采集、数据预处理和人工标注,旨在为无人机在农业中的精准喷洒提供高精度的目标检测支持。PDT数据集的应用领域主要集中在农业无人机技术,旨在提高无人机在植物保护中的目标识别精度,解决传统检测模型在实际应用中的不足。
arXiv 收录
FMA (Free Music Archive)
免费音乐档案 (FMA) 是一个大型数据集,用于评估音乐信息检索中的多个任务。它包含 343 天的音频,来自 16,341 位艺术家的 106,574 首曲目和 14,854 张专辑,按 161 种流派的分级分类排列。它提供完整长度和高质量的音频、预先计算的功能,以及轨道和用户级元数据、标签和自由格式的文本,例如传记。作者定义了四个子集:Full:完整数据集,Large:音频限制为 30 秒的完整数据集 从轨道中间提取的剪辑(如果短于 30 秒,则为整个轨道),Medium:选择25,000 个具有单一根流派的 30 年代剪辑,小:一个平衡的子集,包含 8,000 个 30 年代剪辑,其中 8 种根流派中的每一个都有 1,000 个剪辑。官方分为训练集、验证集和测试集(80/10/10)使用分层抽样来保留每个流派的曲目百分比。同一艺术家的歌曲只是一组的一部分。资料来源:FMA:音乐分析数据集
OpenDataLab 收录