Rostlab/ProstT5Dataset|蛋白质结构数据集|序列分析数据集
收藏数据集概述
数据集描述
ProstT5Dataset 是一个经过精心筛选的蛋白质序列及其对应结构序列(3Di)的标记化集合。该数据集源自 AlphaFold Protein Structure Database,并包括多个聚类和质量过滤步骤。为了捕捉序列的3D信息,采用了 3Di结构字符串表示,这种格式有效地翻译了序列的3D信息。序列标记使用 ProstT5 Tokenizer 生成。
数据字段
- input_id_x (3Di Tokens): 从蛋白质中派生的标记化3Di结构表示序列。
- input_id_y (氨基酸 Tokens): 蛋白质的标记化氨基酸序列。
数据收集和标注
数据集从 AlphaFold Protein Structure Database 开始,经过两步聚类和一步质量过滤:
- 第一步聚类:使用 MMseqs2 对 214M UniprotKB 蛋白质序列进行聚类,基于成对序列相似性得到 52M 个聚类。
- 第二步聚类:Foldseek 进一步将这些蛋白质聚类成 18.8M 个聚类,并通过添加多样成员扩展到 18.6M 个蛋白质。
- 质量过滤:移除低 pLDDT 分数、短长度和高度重复的 3Di 字符串的蛋白质。最终训练集包含 17M 个蛋白质。
数据分割
数据被分割为训练集、测试集和验证集,通过将整个聚类(经过质量过滤)移动到任一集合中。为了防止对大型家族的偏见,验证集和测试集仅保留代表性蛋白质。这导致了 474 个蛋白质用于测试,474 个蛋白质用于验证,约 17M 个蛋白质用于训练。
数据集信息
- 特征:
input_id_x
:序列类型为 int64input_id_y
:序列类型为 int64
- 分割:
test
:字节数为 1087504,示例数为 474valid
:字节数为 1124160,示例数为 474train
:字节数为 65391887792,示例数为 17070828
- 下载大小:810671738 字节
- 数据集大小:65394099456 字节
- 许可证:MIT
- 任务类别:
- 文本生成
- 标签:
- 生物学
- 大小类别:
- 10M<n<100M

中国气象数据
本数据集包含了中国2023年1月至11月的气象数据,包括日照时间、降雨量、温度、风速等关键数据。通过这些数据,可以深入了解气象现象对不同地区的影响,并通过可视化工具揭示中国的气温分布、降水情况、风速趋势等。
github 收录
中国食物成分数据库
食物成分数据比较准确而详细地描述农作物、水产类、畜禽肉类等人类赖以生存的基本食物的品质和营养成分含量。它是一个重要的我国公共卫生数据和营养信息资源,是提供人类基本需求和基本社会保障的先决条件;也是一个国家制定相关法规标准、实施有关营养政策、开展食品贸易和进行营养健康教育的基础,兼具学术、经济、社会等多种价值。 本数据集收录了基于2002年食物成分表的1506条食物的31项营养成分(含胆固醇)数据,657条食物的18种氨基酸数据、441条食物的32种脂肪酸数据、130条食物的碘数据、114条食物的大豆异黄酮数据。
国家人口健康科学数据中心 收录
长江干流实时水位观测数据集(2024年)
该数据集为长江干流主要水文站实时水位观测数据集,包含了汉口、户口、九江、宜昌等16个水文站点的逐小时或逐日水位观测数据。 该数据集包含3个excel表格文件,长江干流站点.xls,逐日水位.xlsx,逐小时水位.xlsx。
国家地球系统科学数据中心 收录
LEVIR-CD
LEVIR-CD 是一个新的大规模遥感建筑变化检测数据集。引入的数据集将成为评估变化检测 (CD) 算法的新基准,尤其是基于深度学习的算法。 LEVIR-CD 由 637 个非常高分辨率(VHR,0.5m/像素)Google Earth (GE) 图像块对组成,大小为 1024 × 1024 像素。这些时间跨度为 5 到 14 年的双时相图像具有显着的土地利用变化,尤其是建筑增长。 LEVIR-CD涵盖别墅住宅、高层公寓、小型车库和大型仓库等各类建筑。在这里,我们关注与建筑相关的变化,包括建筑增长(从土壤/草地/硬化地面或在建建筑到新建筑区域的变化)和建筑衰退。这些双时相图像由遥感图像解释专家使用二进制标签(1 表示变化,0 表示不变)进行注释。我们数据集中的每个样本都由一个注释器进行注释,然后由另一个注释器进行双重检查以产生高质量的注释。完整注释的 LEVIR-CD 总共包含 31,333 个单独的变更构建实例。
OpenDataLab 收录
Beijing Traffic
The Beijing Traffic Dataset collects traffic speeds at 5-minute granularity for 3126 roadway segments in Beijing between 2022/05/12 and 2022/07/25.
Papers with Code 收录