haploformer-1kg-preprocessed
收藏资源简介:
HaploFormer 1KG 预处理序列标记(seqlab)数据集是基于1000 Genomes Project的开放预处理产物,专为HaploFormer 1KG版本发布设计,支持可重复的基因组学教程和模型训练。数据集包含3,202个1000 Genomes NYGC 30x样本的常染色体数据,按染色体1到22组织,主要分为两部分:一是模型无关的.slhap目录,存储去重的个性化氨基酸单倍型;二是模型衍生的.slpool目录(通过artifact key esm2_650m__ec065a8ecd0f标识),存储每个唯一单倍型的行,并包含基于ESM2-650M模型(层0,float16精度)的pooled蛋白质语言模型嵌入表示,用于HaploFormer初始检查点。此外,数据集提供小型参考表(如whole_genome_v1.parquet)和清单文件(manifest.parquet和manifest.json)以辅助数据管理。数据源来自Standard Model Bio的Cloudflare R2工作桶,是1000 Genomes Project开放数据的预处理衍生版本。该数据集适用于基因组学、单倍型分析、蛋白质语言模型嵌入、序列标记任务,以及使用HaploFormer进行模型训练和生物文档可视化(如UMAP)。
The HaploFormer 1KG preprocessed sequence labeling (seqlab) dataset is an open preprocessed product based on the 1000 Genomes Project, specifically designed for the release of HaploFormer 1KG to support reproducible genomics tutorials and model training. It includes autosomal data from 3,202 1000 Genomes NYGC 30x samples, organized by chromosomes 1 to 22, and is primarily divided into two parts: the model-agnostic .slhap directory, which stores deduplicated personalized amino acid haplotypes, and the model-derived .slpool directory (identified by artifact key esm2_650m__ec065a8ecd0f), which stores rows for each unique haplotype and contains pooled protein language model embeddings (based on the ESM2-650M model, layer 0, float16 precision) for HaploFormer initial checkpoints. Additionally, the dataset provides small reference tables (e.g., whole_genome_v1.parquet) and manifest files (manifest.parquet and manifest.json) to aid data management. The data source is the Cloudflare R2 work bucket from Standard Model Bio, representing a preprocessed derivative of the open data from the 1000 Genomes Project. This dataset is suitable for genomics, haplotype analysis, protein language model embeddings, sequence labeling tasks, and model training with HaploFormer, as well as biological document visualization (e.g., UMAP).
数据集名称
HaploFormer 1KG Preprocessed seqlab Artifacts
数据集描述
该数据集包含由 HaploFormer 1KG 发布所使用的开放 1000 Genomes Project 预处理产物,用于基因组学、单倍型和蛋白质语言模型嵌入研究。
许可协议
CC-BY-4.0
语言
英语
数据集内容
- 常染色体逐染色体
.slhap目录:包含 3,202 个 1000 Genomes NYGC 30x 样本的个性化氨基酸单倍型,去重后存储。 - 匹配的逐染色体
.slpool目录:包含模型范围的 pooled pLM 嵌入,每个单倍型一行,并包含用于初始 HaploFormer 1KG 检查点的池化表示文件slpool.mean_masked.npy。 - 小参考表:可复现笔记本所需的参考表格。
数据结构
数据集位于 data/1KG-3202-repaired/ 目录下,结构如下:
data/1KG-3202-repaired/ chr1.slhap/ ... chr22.slhap/ chr1.esm2_650m__ec065a8ecd0f.slpool/ ... chr22.esm2_650m__ec065a8ecd0f.slpool/ refs/ whole_genome_v1.parquet manifest.parquet manifest.json
工件密钥
esm2_650m__ec065a8ecd0f- 来源嵌入家族:ESM2-650M,第0层,
float16格式,附带 seqlab 模型作用域工件标识哈希ec065a8ecd0f。
数据来源
文件镜像自 Standard Model Bio 的 Cloudflare R2 工作桶:
s3://smb-data-prod-scratch/seqlab/datasets/1kg_wgs_20220422/whole_proteome/personalized/
原始数据来自 1000 Genomes Project,这些文件是预处理衍生物,用于可复现的 HaploFormer 教程和模型训练。
可复现性
使用 HaploFormer 模型仓库中的配套笔记本,通过 huggingface_hub.snapshot_download 下载该数据集,设置环境变量 SEQLAB_ARTIFACT_KEY=esm2_650m__ec065a8ecd0f,即可训练相同的全基因组 HaploFormer 模型,并运行 BioDocs/GeneDocs 查询时 UMAP 可视化。




