遇见数据集

arcinstitute/evoeval

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

evoeval 是一个基因组变异效应评估的数据集集合,包含多个子数据集,每个子集以GRCh38坐标作为键,存储为Parquet格式的变异表,并带有标签和注释列。数据集用于评估变异效应预测模型,涵盖不同任务:ClinVar用于区分致病/可能致病与良性/可能良性变异;SpliceVarDB用于区分剪接改变变异与正常变异;GPN-star benchmarks包括COSMIC体细胞癌症突变与中性变异的区分、OMIM疾病相关变异与常见变异的区分,以及gnomAD平衡基准测试;TraitGym包括GWAS精细映射的非编码变异和孟德尔疾病调控变异的因果变异与匹配对照的区分。每个子集都有标准列模式(如染色体、位置、参考等位基因、替代等位基因)和特定注释列,类平衡和分层信息详细提供。数据集旨在支持基因组学中的机器学习模型评估。

evoeval is a collection of datasets for genomic variant effect evaluation, comprising multiple sub-datasets. Each sub-dataset is keyed by GRCh38 coordinates, stored as Parquet-formatted variant tables, and includes label and annotation columns. This collection is intended to assess variant effect prediction models, covering a range of tasks: ClinVar for distinguishing pathogenic/likely pathogenic variants from benign/likely benign variants; SpliceVarDB for differentiating splice-altering variants from normal variants; GPN-star benchmarks, which encompass distinguishing somatic cancer mutations from neutral mutations in COSMIC, differentiating disease-associated variants from common variants in OMIM, and the gnomAD balancing benchmark; TraitGym, which involves distinguishing causal variants from matched controls for non-coding variants in GWAS fine-mapping and regulatory variants associated with Mendelian diseases. Each sub-dataset adheres to a standard column schema (e.g., chromosome, position, reference allele, alternative allele) with specialized annotation columns, and detailed class balance and stratification information is provided. This dataset collection aims to support the evaluation of machine learning models in genomics research.

提供机构:
arcinstitute
搜集汇总
数据集介绍
arcinstitute/evoeval 数据集图片
构建方式
EvoEval数据集是一个专注于基因组变异效应评估的综合性基准数据集集合。其构建基于GRCh38参考基因组坐标,所有变异均以Parquet格式存储为标准表格,包含chrom、pos、ref、alt等核心坐标列,并额外标注了genomic_element、consequence和variant_type等注释信息。数据集整合了多个权威来源,包括ClinVar临床意义分类、SpliceVarDB实验验证的剪接变异、COSMIC体细胞突变、OMIM疾病关联变异、gnomAD群体等位基因频率数据以及TraitGym精细映射的因果变异,构建了覆盖编码区、非编码区、剪接位点等多种功能区域的变异效应评估任务。每个子数据集都采用统一的列模式,便于下游模型进行统一的评分与评估。
特点
该数据集最显著的特点在于其多维度的分层评估能力。它涵盖了从临床意义分类(ClinVar)、剪接效应预测(SpliceVarDB)、体细胞突变识别(COSMIC)到罕见病关联(OMIM)和群体遗传平衡基准(gnomAD_balanced)的七个子数据集,任务类型极为丰富。每个子数据集都提供了精细的功能区域分层(如CDS、intron、splice_site、UTR等)和变异类型分层(SNV、插入、缺失、MNV),支持对模型在不同基因组区域和变异类型上的表现进行深入分析。特别是gnomAD_balanced子数据集实现了每个功能阶层内正负样本的完美平衡,而TraitGym子数据集则通过匹配MAF和LD评分控制了混杂因素,使得评估结果更加公正可靠。
使用方法
该数据集的使用十分灵活便捷。用户可以直接从HuggingFace仓库加载各子数据集的Parquet文件,利用统一的坐标列和标签列进行模型评估。每个子数据集的标签定义清晰明确,如ClinVar中以ClinSigSimple值区分致病性与良性变异,SpliceVarDB中以classification字段区分剪接改变与正常变异。数据集不包含预计算的模型评分,用户需自行在通用基因组参考序列或特定模型框架下计算变异效应分数,然后与标签进行比对获得AUC等评估指标。支持按genomic_element、consequence、variant_type等维度进行分层评估,特别适用于评估基因组语言模型在不同功能区域上的预测能力。
背景与挑战
背景概述
EvoEval数据集由Song Lab于2024年创建,旨在系统评估基因组变异效应预测模型在多种临床与功能场景下的表现。该数据集整合了ClinVar、SpliceVarDB、GPN-star基准及TraitGym等多个来源的变异注释数据,涵盖从致病性分类、剪接改变判别到调控因果变异识别等核心研究问题,为计算生物学领域提供了一个标准化的变异效应评估平台。凭借其大规模的样本量(超过1400万条记录)和细粒度的功能注释(如基因组元件、变异类型及后果类别),EvoEval已成为评估基因变异致病性预测方法的关键资源,推动模型在精准医学与群体遗传学中的应用与发展。
当前挑战
构建EvoEval所面临的挑战首先体现在领域问题本身的复杂性:变异效应预测需区分致病性与良性变异,但数据中广泛存在的类别不平衡(如COSMIC数据集正负样本比达1:102)和功能区域稀疏性(如OMIM调控区域仅含406个阳性位点)显著增加了模型泛化的难度。其次,数据整合过程中需统一来自不同来源的坐标系统(GRCh38)、变异类型编码与功能注释标准,确保各子数据集在保留原生信息(如ENCODE调控元件)的同时兼容通用格式,这对数据清洗与元数据对齐提出了严苛的技术要求。
常用场景
经典使用场景
evoeval数据集的经典使用场景聚焦于基因组变异效应预测模型的评估与基准测试。该数据集整合了ClinVar、SpliceVarDB、COSMIC、OMIM、gnomAD及TraitGym等多个来源的变异数据,覆盖从编码区到非编码调控区的广泛基因组元素。每个子集均以统一格式存储,包含染色体坐标、参考等位基因和替代等位基因等标准列,并附有病理性、剪接效应、癌症驱动、疾病关联及群体频率等标签。研究人员可利用这些标注完备的数据,系统评估模型在区分致病性与良性变异、预测剪接异常、识别癌症体细胞突变和解析复杂性状因果变异等方面的泛化能力,从而推动对变异功能影响的深层理解。
解决学术问题
该数据集着力解决基因组学中变异效应预测的标准化评估难题。长期以来,不同研究采用各自建立的小规模评估集,导致模型性能比较缺乏统一标杆。evoeval通过汇集多个高质量、注释详尽的变异集合,构建了覆盖编码区、剪接位点、非编码RNA及调控元件等多类基因组元素的基准测试框架。它解决了模型在高度不平衡场景下(如OMIM数据集中正负样本比例达1:6500)的鲁棒性评估问题,并借助精心设计的匹配控制策略(如TraitGym中按功能类别匹配对照组)消除了变量偏差。这一标准化评估体系为变异效应预测领域确立了客观、可复现的学术评价范式,极大地推动了方法的迭代与进化。
衍生相关工作
evoeval数据集的发布催生了众多下游经典工作。由GPN-star项目衍生出的模型借助gnomAD平衡基准与OMIM子集进行训练与评估,在非编码变异效应预测上取得了突破性进展,推动了基于进化信息的变异打分方法发展。TraitGym子集的设计启发了后续在复杂性状精细定位中构建匹配对照组的新思路,被多篇GWAS后分析论文采纳为评估标准。SpliceVarDB的剪接效应数据促进了剪接预测模型的专项优化,衍生出如SpliceAI改进版等方法。ClinVar子集则成为几乎所有变异致病性预测工具(如PrimateAI、EVE、AlphaMissense)的标准评估集合,推动了群体遗传学与计算生物学交叉领域的繁荣。这一系列衍生工作充分彰显了evoeval作为基准数据集的核心学术影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务