遇见数据集

haploformer-1kg-preprocessed

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

HaploFormer 1KG 预处理序列标记(seqlab)数据集是基于1000 Genomes Project的开放预处理产物,专为HaploFormer 1KG版本发布设计,支持可重复的基因组学教程和模型训练。数据集包含3,202个1000 Genomes NYGC 30x样本的常染色体数据,按染色体1到22组织,主要分为两部分:一是模型无关的.slhap目录,存储去重的个性化氨基酸单倍型;二是模型衍生的.slpool目录(通过artifact key esm2_650m__ec065a8ecd0f标识),存储每个唯一单倍型的行,并包含基于ESM2-650M模型(层0,float16精度)的pooled蛋白质语言模型嵌入表示,用于HaploFormer初始检查点。此外,数据集提供小型参考表(如whole_genome_v1.parquet)和清单文件(manifest.parquet和manifest.json)以辅助数据管理。数据源来自Standard Model Bio的Cloudflare R2工作桶,是1000 Genomes Project开放数据的预处理衍生版本。该数据集适用于基因组学、单倍型分析、蛋白质语言模型嵌入、序列标记任务,以及使用HaploFormer进行模型训练和生物文档可视化(如UMAP)。

The HaploFormer 1KG preprocessed sequence labeling (seqlab) dataset is an open preprocessed product based on the 1000 Genomes Project, specifically designed for the release of HaploFormer 1KG to support reproducible genomics tutorials and model training. It includes autosomal data from 3,202 1000 Genomes NYGC 30x samples, organized by chromosomes 1 to 22, and is primarily divided into two parts: the model-agnostic .slhap directory, which stores deduplicated personalized amino acid haplotypes, and the model-derived .slpool directory (identified by artifact key esm2_650m__ec065a8ecd0f), which stores rows for each unique haplotype and contains pooled protein language model embeddings (based on the ESM2-650M model, layer 0, float16 precision) for HaploFormer initial checkpoints. Additionally, the dataset provides small reference tables (e.g., whole_genome_v1.parquet) and manifest files (manifest.parquet and manifest.json) to aid data management. The data source is the Cloudflare R2 work bucket from Standard Model Bio, representing a preprocessed derivative of the open data from the 1000 Genomes Project. This dataset is suitable for genomics, haplotype analysis, protein language model embeddings, sequence labeling tasks, and model training with HaploFormer, as well as biological document visualization (e.g., UMAP).

创建时间:
2026-06-10
原始信息汇总

数据集名称

HaploFormer 1KG Preprocessed seqlab Artifacts

数据集描述

该数据集包含由 HaploFormer 1KG 发布所使用的开放 1000 Genomes Project 预处理产物,用于基因组学、单倍型和蛋白质语言模型嵌入研究。

许可协议

CC-BY-4.0

语言

英语

数据集内容

  • 常染色体逐染色体 .slhap 目录:包含 3,202 个 1000 Genomes NYGC 30x 样本的个性化氨基酸单倍型,去重后存储。
  • 匹配的逐染色体 .slpool 目录:包含模型范围的 pooled pLM 嵌入,每个单倍型一行,并包含用于初始 HaploFormer 1KG 检查点的池化表示文件 slpool.mean_masked.npy
  • 小参考表:可复现笔记本所需的参考表格。

数据结构

数据集位于 data/1KG-3202-repaired/ 目录下,结构如下:

data/1KG-3202-repaired/ chr1.slhap/ ... chr22.slhap/ chr1.esm2_650m__ec065a8ecd0f.slpool/ ... chr22.esm2_650m__ec065a8ecd0f.slpool/ refs/ whole_genome_v1.parquet manifest.parquet manifest.json

工件密钥

  • esm2_650m__ec065a8ecd0f
  • 来源嵌入家族:ESM2-650M,第0层,float16 格式,附带 seqlab 模型作用域工件标识哈希 ec065a8ecd0f

数据来源

文件镜像自 Standard Model Bio 的 Cloudflare R2 工作桶: s3://smb-data-prod-scratch/seqlab/datasets/1kg_wgs_20220422/whole_proteome/personalized/ 原始数据来自 1000 Genomes Project,这些文件是预处理衍生物,用于可复现的 HaploFormer 教程和模型训练。

可复现性

使用 HaploFormer 模型仓库中的配套笔记本,通过 huggingface_hub.snapshot_download 下载该数据集,设置环境变量 SEQLAB_ARTIFACT_KEY=esm2_650m__ec065a8ecd0f,即可训练相同的全基因组 HaploFormer 模型,并运行 BioDocs/GeneDocs 查询时 UMAP 可视化。

搜集汇总
数据集介绍
haploformer-1kg-preprocessed 数据集图片
构建方式
该数据集基于1000 Genomes Project NYGC 30x测序数据,覆盖3202个样本的22条常染色体。首先,通过Seqlab流程对每个样本的基因组进行个性化氨基酸单倍型推断,生成去重后的单倍型文件(.slhap格式)。随后,利用ESM2-650M蛋白语言模型(第0层,float16精度)为每条单倍型计算池化嵌入表示,并存储为模型相关的.slpool文件,其中包含用于HaploFormer初始检查点的平均池化特征。最终,数据集以染色体为单位组织成独立目录,并辅以参考表格和清单文件,确保可复现性。
特点
数据集的核心特点在于其层次化与模型兼容性。.slhap目录存储的是模型无关的去重个性化单倍型,便于独立分析;而.slpool目录则通过标准化的嵌入密钥(ESM2-650M)与特定模型深度绑定,可直接用于HaploFormer训练。此外,该数据集规模庞大,涵盖3202个个体的全基因组信息,并经过严格预处理以消除冗余。参考表格与清单文件进一步提升了数据检索与基因型-表型关联分析的效率。
使用方法
用户可通过HuggingFace Hub的snapshot_download功能一键下载整个数据集,并设置环境变量SEQLAB_ARTIFACT_KEY为esm2_650m__ec065a8ecd0f以匹配嵌入版本。配合HaploFormer模型仓库中的可复现笔记本,可直接训练全基因组模型或运行BioDocs/GeneDocs的UMAP可视化查询。对于特定分析,可加载相应染色体的.slhap单倍型数据及.slpool嵌入,利用已提供的参考表完成基因层面的可解释性研究。
背景与挑战
背景概述
在基因组学与蛋白质语言模型交叉融合的前沿领域,HaploFormer-1KG预处理器数据集应运而生。该数据集由Standard Model Bio机构于近期创建,依托国际千人基因组计划(1000 Genomes Project)的高质量测序数据(NYGC 30x),面向3202名个体,构建了覆盖常染色体的个性化氨基酸单倍型图谱。核心研究问题在于,如何将蛋白质语言模型(如ESM2-650M)的嵌入表示与单倍型多样性相整合,从而为基因组规模的下游分析提供可复现的基准。这一数据集通过提供模型无关的单倍型目录和模型相关的汇聚表示,显著提升了HaploFormer模型训练的可复现性,尤其推动了群体遗传学与深度学习在疾病关联研究中的交融,对理解人类基因组变异的功能意义产生了重要影响。
当前挑战
该数据集所解决的领域问题核心挑战在于,传统基因组变异注释方法难以捕捉氨基酸单倍型对蛋白质功能的全局影响,而蛋白质语言模型嵌入虽强大,却缺乏与群体单倍型数据的系统对齐。构建过程中,亦面临多重技术挑战:首先,需对千人基因组计划30x覆盖率的高通量测序数据进行个性化单倍型推导,并去除冗余以压缩存储;其次,需确保不同染色体间嵌入计算的一致性,避免因模型版本或批次效应导致偏差;最后,构建一套可复现的管道以管理模型无关与模型相关的工件(如.slhap与.slpool文件),并维护查错与版本控制,这对数据集的长期可用性构成了特殊考验。
常用场景
经典使用场景
在群体遗传学与计算基因组学交叉领域,HaploFormer-1KG预训练数据集为解析人类基因组单倍型多样性提供了基础性资源。经典使用场景聚焦于利用该数据集训练基于Transformer架构的基因组语言模型,捕捉单倍型序列中的长程依赖与进化信号。研究者通过载入22条常染色体的单倍型目录及蛋白质语言模型的池化嵌入,能够预训练出适用于全基因组范围的HaploFormer模型,进而在无监督或弱监督条件下完成单倍型聚类、变异效应预测等下游任务。该数据集凭借其标准化的预处理流程与公开可复现的特性,成为连接原始测序数据与高级基因组特征表示的关键枢纽。
解决学术问题
该数据集着力应对人类基因组学中单倍型层面的表征学习难题。传统方法依赖于人工设计的特征或有限窗口的统计指标,难以完整刻画单倍型的全局结构与功能约束。HaploFormer-1KG预处理数据通过将ESM2-650M等蛋白质语言模型的嵌入映射至单倍型空间,使得模型能够在群体尺度上学习氨基酸变异的联合分布,从而有效预测错义突变的功能影响、识别正向选择信号并量化单倍型间的亲缘关系。其核心意义在于证明:预训练的蛋白质表示经适当地池化与对齐后,可迁移至非编码区单倍型分析,拓展了基因组语言模型的适用边界。
衍生相关工作
围绕HaploFormer-1KG预处理数据集已衍生出多项具有影响力的工作。学术界涌现出一系列以该数据集为基准的基因组基础模型研究,其中代表性工作包括基于该数据集开发的群体适应度预测模型、单倍型与表型关联的图神经网络,以及利用其多染色体池化嵌入进行跨物种进化保守性分析的方法。这些工作推动了“预训练-微调”范式在基因组学中的系统化应用,并催生了若干公开排行榜与复现基准,促进了可重复计算研究在群体遗传学领域的发展,进一步强化了该数据集作为标准预处理参考的核心地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务