InstaDeepAI/human_reference_genome
收藏资源简介:
人类参考基因组数据集是基于GRCh38/hg38参考组装构建的,包含所有常染色体和性染色体的序列,总共有32亿个核苷酸。该数据集主要用于Nucleotide Transformers模型的预训练。每个数据实例包含一个表示DNA序列的字符串、一个表示染色体的字符串以及两个表示序列第一个和最后一个核苷酸索引的整数。数据集分为训练集、验证集和测试集,分别包含不同数量的实例。
人类参考基因组数据集是基于GRCh38/hg38参考组装构建的,包含所有常染色体和性染色体的序列,总共有32亿个核苷酸。该数据集主要用于Nucleotide Transformers模型的预训练。每个数据实例包含一个表示DNA序列的字符串、一个表示染色体的字符串以及两个表示序列第一个和最后一个核苷酸索引的整数。数据集分为训练集、验证集和测试集,分别包含不同数量的实例。
数据集概述
数据集名称
- 名称: Human Reference Genome
- 别名: 人类参考基因组
数据集描述
- 构建方式: 该数据集由人类参考基因组GRCh38/hg38的所有常染色体和性染色体序列构成,总共有3.2亿个核苷酸。
- 用途: 作为Nucleotide Transformers模型的预训练语料库。
数据集结构
- 数据实例: 每个实例包含一个代表序列的字符串、一个指示染色体的字符串以及两个分别代表序列起始和结束核苷酸位置的整数。
数据字段
- sequence: 包含DNA序列的字符串。
- chromosome: 指示染色体的字符串(1,2,...,21,X,Y)。
- start_pos: 序列起始核苷酸的索引。
- end_pos: 序列结束核苷酸的索引。
数据分割
- 分割类型: 训练集、验证集、测试集。
- 分割统计:
- 训练集: 6kb - 498,444实例;12kb - 249,222实例。
- 验证集: 6kb - 7,784实例;12kb - 3,892实例。
- 测试集: 6kb - 8,469实例;12kb - 4,234实例。
数据来源
- 源数据: 来自GRCh38/hg38人类参考基因组的染色体序列。
引用信息
bibtex @article{dalla2023nucleotide, title={The Nucleotide Transformer: Building and Evaluating Robust Foundation Models for Human Genomics}, author={Dalla-Torre, Hugo and Gonzalez, Liam and Mendoza Revilla, Javier and Lopez Carranza, Nicolas and Henryk Grywaczewski, Adam and Oteri, Francesco and Dallago, Christian and Trop, Evan and Sirelkhatim, Hassan and Richard, Guillaume and others}, journal={bioRxiv}, pages={2023--01}, year={2023}, publisher={Cold Spring Harbor Laboratory} }




