遇见数据集

HVUE-v2

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

HVUE v2(人类病毒组理解评估基准)是一个用于评估DNA语言模型在病毒基因组学任务中表现的基准数据集。该数据集专注于三个具有流行病学意义的分类任务:致病性分类(区分致病性与良性病毒株)、传播性预测(基于R₀值的二元分类,R₀<1 vs R₀≥1)以及宿主趋向性预测(识别感染人类的病毒与非人类趋向病毒)。HVUE v2通过一个六阶段流水线构建,包括基因组合并与去重、MMseqs2聚类(95%或70%相似度)、聚类感知的数据划分(70/15/15训练/验证/测试分割,确保同一聚类内所有序列进入同一分割)、固定长度窗口分块(500/1000/2000 bp)、SHA-256哈希精确去重以及自动泄漏审计,从而彻底消除了版本1中存在的训练-测试重叠问题。数据集按任务和配置组织为多个子集,例如致病性任务包含standard_capped_500bp、standard_capped_1000bp、standard_capped_2000bp、hard_capped_1000bp和standard_temporal_1000bp等配置;传播性任务具有类似配置;宿主趋向性任务则包含standard_95_500bp、standard_95_1000bp、standard_95_2000bp和hard_70_1000bp配置。每个子集下包含train.csv、dev.csv和test.csv文件,每行包含两列:sequence(DNA序列,由A/T/G/C组成)和label(二元标签0或1)。所有配置均经过验证,确认无任何精确匹配或近似匹配的泄漏。该数据集适用于训练和评估面向病毒基因组学的DNA基础模型,如HViLM。

HVUE v2 (Human Virome Understanding Evaluation Benchmark) is a benchmark dataset designed to evaluate the performance of DNA language models on viromics tasks. It focuses on three classification tasks of epidemiological significance: pathogenicity classification (distinguishing between pathogenic and benign viral strains), transmissibility prediction (binary classification based on R₀ value, R₀<1 vs R₀≥1), and host tropism prediction (identifying human-infecting viruses vs. non-human tropic viruses). HVUE v2 is constructed through a six-stage pipeline including genome assembly and deduplication, MMseqs2 clustering (at 95% or 70% similarity), cluster-aware data splitting (70/15/15 train/validation/test split ensuring all sequences from the same cluster go to the same split), fixed-length window chunking (500/1000/2000 bp), SHA-256 hash exact deduplication, and automatic leakage auditing, thereby completely eliminating training-test overlap issues present in version 1. The dataset is organized into multiple subsets by task and configuration. For example, the pathogenicity task includes configurations such as standard_capped_500bp, standard_capped_1000bp, standard_capped_2000bp, hard_capped_1000bp, and standard_temporal_1000bp; the transmissibility task has similar configurations; the host tropism task includes configurations such as standard_95_500bp, standard_95_1000bp, standard_95_2000bp, and hard_70_1000bp. Each subset contains train.csv, dev.csv, and test.csv files, with each row having two columns: sequence (DNA sequence composed of A/T/G/C) and label (binary label 0 or 1). All configurations have been validated to have no exact or approximate match leakage. This dataset is suitable for training and evaluating DNA foundation models for viromics, such as HViLM.

创建时间:
2026-08-26
原始信息汇总

HVUE v2: 人类病毒组理解评估基准(Human Virome Understanding Evaluation Benchmark)

数据集概述

HVUE v2 是一个为评估 DNA 语言模型而严格构建的基准数据集,聚焦于三个具有流行病学相关性的病毒预测任务。该数据集为 HVUE 基准的第二版,相比第一版(存在训练-测试序列重叠问题),v2 通过聚类感知划分进行了修正,并验证了零泄漏。

核心任务

  1. 致病性分类(Pathogenicity Classification):区分致病病毒株与非致病病毒株
  2. 传播性预测(Transmissibility Prediction):基于 R₀ 值的二分类(R₀ < 1 与 R₀ ≥ 1)
  3. 宿主嗜性预测(Host Tropism Prediction):识别可感染人类的病毒与非人类嗜性病毒

六阶段构建流程

  1. 整合:收集源基因组并在基因组水平去重
  2. MMseqs2 聚类:在 95% 同一性(标准)或 70% 同一性(严格)下进行基因组聚类
  3. 聚类感知划分:在级别进行训练/验证/测试划分(70/15/15),同一簇内所有序列归入同一划分
  4. 分块:划分后将基因组切割为固定长度窗口(500/1000/2000 bp)
  5. 去重:基于 SHA-256 哈希在划分内部进行精确匹配去重
  6. 泄漏审计:自动验证跨划分零重叠

与 v1 的关键改进:v1 先分块后随机划分,v2 先以聚类级别划分再分块。

数据集配置

致病性分类配置

配置名称 描述
standard_capped_500bp 标准泄漏控制基准,500-bp 片段
standard_capped_1000bp 标准泄漏控制基准,1000-bp 片段
standard_capped_2000bp 标准泄漏控制基准,2000-bp 片段
hard_capped_1000bp 更严格的硬划分基准,1000-bp 片段
standard_temporal_1000bp 时间基准,1000-bp 片段

传播性预测配置

配置名称 描述
standard_capped_500bp 标准泄漏控制基准,500-bp 片段
standard_capped_1000bp 标准泄漏控制基准,1000-bp 片段
standard_capped_2000bp 标准泄漏控制基准,2000-bp 片段
hard_capped_1000bp 更严格的硬划分基准,1000-bp 片段
standard_temporal_1000bp 时间基准,1000-bp 片段

宿主嗜性预测配置

配置名称 描述
standard_95_500bp 95% 聚类感知基准,500-bp 片段
standard_95_1000bp 95% 聚类感知基准,1000-bp 片段
standard_95_2000bp 95% 聚类感知基准,2000-bp 片段
hard_70_1000bp 70% 聚类感知严格基准,1000-bp 片段

注:宿主嗜性预测不提供时间划分(源数据缺乏采集日期元数据)。

数据格式

数据集目录结构按任务划分,每个配置目录下包含 train.csvdev.csvtest.csv 文件。每个 CSV 文件包含两列:

  • sequence:DNA 序列(A/T/G/C)
  • label:二分类标签(0 或 1)

数据质量保证

所有配置均已确认在跨划分间实现零精确匹配或近似匹配重叠。审计脚本可通过相关资源获取。

数据集信息

  • 许可证:MIT License
  • 语言:英语
  • 任务类别:文本分类
  • 标签:生物学、基因组学、病毒学、DNA、病毒、基础模型、基准

相关资源

  • HViLM 模型权重:https://huggingface.co/duttaprat/HViLM-base
  • 代码仓库:https://github.com/duttaprat/HViLM
  • HVUE v1(已弃用):https://huggingface.co/datasets/duttaprat/HVUE

引用信息

bibtex @article{dutta2026hvilm, title={HViLM: A foundation model for viral genomics enables multi-task prediction of pathogenicity, transmissibility, and host tropism}, author={Dutta, Pratik and Vaska, Jack and Surana, Pallavi and Sathian, Rekha and Chao, Max and Zhou, Zhihan and Liu, Han and Davuluri, Ramana V}, journal={bioRxiv}, pages={2026--03}, year={2026}, publisher={Cold Spring Harbor Laboratory} }

搜集汇总
数据集介绍
HVUE-v2 数据集图片
构建方式
HVUE v2基准数据集的构建遵循一套严谨的六阶段流水线,旨在为DNA语言模型在病毒基因组学领域的评估提供无泄漏的测试平台。构建流程始于对病毒基因组序列的整合与去重,随后利用MMseqs2工具在95%或70%的序列一致性阈值下进行聚类。关键步骤在于采用聚类感知的划分策略,将数据集以聚类为单位随机分割为训练、验证和测试子集,确保同簇序列不被分散至不同分区。此后,基因组被切分为固定长度(500、1000或2000碱基对)的片段,并在分区内通过SHA-256哈希进行精确去重,最终执行自动化泄漏审计以验证跨分区的零重叠。这一流程从根本上纠正了版本1中分块后随机划分所致的训练-测试重叠问题。
使用方法
使用者可通过HuggingFace datasets库或Pandas直接加载数据。推荐的方式是利用load_dataset函数,指定所需的数据目录(如Pathogenicity/standard_capped_1000bp)并声明train、validation与test数据文件, thereby获得标准的三段式划分。CSV文件内仅含sequence与label两列,前者提供DNA序列(由A/T/G/C组成),后者为二值标签。该设计便于直接用于训练与评估DNA语言模型,同时可参照官方指南复现由基准引发的下游任务。数据集的便捷访问机制和标准化格式,允许研究者快速集成至现有工作流,进行跨模型的性能对比,而无需额外处理数据分歧问题。
背景与挑战
背景概述
HVUE v2(Human Virome Understanding Evaluation Benchmark)是由Dutta等研究者于2026年构建的基准数据集,旨在评估DNA语言模型在病毒基因组学三大流行病学相关任务上的表现:致病性分类、传播性预测及宿主趋向性识别。该数据集源自HViLM基础模型研究,其核心贡献在于通过六阶段流水线彻底消除了训练与测试集间的序列泄漏问题,相较v1版本实现了严格的簇感知划分与零泄漏验证。HVUE v2提供了多尺度片段(500/1000/2000bp)、多相似度阈值(95%/70%)及时间划分等多种配置,为病毒基因组学语言模型的公平比较与泛化能力评估确立了新标准,对推动计算病毒学与基因组基础模型研究具有重要影响。
当前挑战
HVUE v2面临的挑战涵盖学科与构建两个层面。在学科层面,病毒基因组具有高度变异性与重组性,致病性、传播性及宿主趋向性的分子决定因素复杂且常受环境与宿主互作影响,使得基于序列的判别任务极具难度,且数据集中类别不平衡与进化时间跨度问题进一步加剧了模型泛化挑战。在构建层面,需确保严格无泄漏的划分:v1因分块后随机切分导致训练与测试重叠,v2须先经MMseqs2在基因组水平聚类(95%/70%一致性),再按簇划分,并于分块后执行SHA-256哈希精确去重及自动化泄漏审计,同时处理宿主趋向性任务因缺乏采集日期元数据而无法进行时间划分的限制,保障了基准的可靠性与可复现性。
常用场景
经典使用场景
HVUE v2作为人类病毒组理解的评估基准,专为DNA语言模型设计,其经典使用场景涵盖三个流行病学相关的病毒预测任务:致病性分类(区分致病性与良性病毒株)、传播性预测(基于基本再生数R₀的二元分类)以及宿主嗜性预测(识别感染人类的病毒)。该基准在基因组学与病毒学交叉领域具有独特价值,研究者常利用其标准配置(如500/1000/2000碱基对片段)对预训练DNA模型进行零样本或少样本微调评估,以衡量模型捕获病毒序列中功能信号的泛化能力。
解决学术问题
该数据集解决了病毒基因组学中长期存在的评估数据泄漏问题,通过引入六阶段流水线(包括MMseqs2聚类、簇感知划分及基于SHA-256的去重),确保了训练集与测试集之间零重叠,从而提供可信的模型性能比较。它填补了缺乏标准化病毒序列评估基准的空白,使得不同DNA语言模型在致病性、传播性和宿主嗜性预测任务上的表现可被客观量化,促进了计算病毒学中可复现研究的发展。
实际应用
在公共卫生与临床实践中,HVUE v2可用于辅助病毒监测与风险评估。例如,通过分析新测序的病毒基因组片段,模型能快速提示其潜在致病性或人畜共患传播风险,从而加快疫情预警。此外,该基准支持时间序列分割配置(如标准时间性1000bp),使研究者能评估模型对未来出现的病毒变异株的预测能力,这对疫苗设计与抗病毒药物靶点筛选具有间接但重要的参考价值。
数据集最近研究
最新研究方向
HVUE v2基准的发布标志着病毒基因组学领域对DNA语言模型评估严谨性的深度反思与范式革新。针对第一代基准在数据划分上的序列泄露缺陷,HVUE v2通过引入MMseqs2聚类感知分割与多维度审计机制,构筑了零泄漏的评估防线,为病原性判别、传播力预测及宿主嗜性识别三大流行病学任务提供了可靠标尺。其时间序列划分与硬度可调的配置设计,更是顺应了基因组基础模型向临床应用转化的前沿需求,旨在驱动模型从静态序列理解迈向动态演化追踪与泛化能力强化。这一升级不仅重塑了病毒学AI模型的性能评测基准,更对全球公共卫生监测中的人机协同智能预警体系构建具有深远牵引意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务