bolinas-dna/zoonomia-v1-v2
收藏资源简介:
zoonomia-v1-v2是一个基因组学数据集,基于bolinas-dna/zoonomia-v1-v1的投影骨干,但子集化为那些人类锚点与任何Ensembl rel 115 protein_coding转录本的转录起始位点(TSS)区域(即[TSS − 256, TSS + 256])重叠的窗口,约占原始v1数据的7.1%。该数据集包含15,863,610行训练数据,覆盖108种哺乳动物,每行包含255 bp的DNA序列信息,并经过反向互补增强和随机打乱处理。数据构建过程包括:将hg38基因组划分为255 bp窗口,应用保守性过滤器,跨哺乳动物投影,并添加v2特定的蛋白质编码mRNA TSS邻近性过滤器。模式包括查询名称、物种、目标染色体、起始位置、结束位置、链、目标染色体大小、序列和增强列。数据集用于生物学和基因组学研究,支持流式加载。
zoonomia-v1-v2 is a genomics dataset based on the same projection backbone as bolinas-dna/zoonomia-v1-v1, but subsetted to windows whose human anchor overlaps the [TSS − 256, TSS + 256] region for any Ensembl rel 115 protein_coding transcript, representing approximately 7.1% of v1. It contains 15,863,610 training rows covering 108 mammals, with each row including 255 bp DNA sequence information, reverse-complement augmentation, and shuffling. The construction process involves tiling hg38 into 255 bp windows, applying a conservation filter, cross-mammal projection, and a v2-specific protein-coding mRNA TSS proximity filter. The schema includes columns such as query_name, species, t_chrom, t_start, t_end, t_strand, t_src_size, sequence, and augmentation. The dataset is designed for biology and genomics research and supports streaming loading.



