遇见数据集

fungi-its-barcodes

收藏
Hugging Face2026-09-17 更新2026-09-18 收录
官方服务:

资源简介:

该数据集(fungi-its-barcodes)是针对真菌内转录间隔区(ITS)的参考序列集合,用于六级分类学注释(门、纲、目、科、属、种),遵循 UNITE 命名规范。数据来源于 UNITE + INSD 真菌数据库(Abarenkov et al. 2023),并采用 MyCoAI 数据发布(Romeijn et al. 2024)中的训练/验证/测试划分和分类头格式。数据集包含以下文件:训练集(trainset.fasta,约150万条序列)、验证集(trainset_valid.fasta)、测试集1(test1.fasta,4,439条,酵母富集)、测试集2(test2.fasta,11,619条,丝状真菌)、测试集3(test3.fasta,367,337条,大规模基准)以及演示子集(top50.fasta,2,024条)。每条序列的 FASTA 头部编码了从界到种的完整分类路径,未知等级以问号标记。训练集中覆盖了18个门、70个纲、231个目、791个科、3,695个属和14,742个种。该数据集适用于文本分类任务,可用于训练和评估真菌 ITS 序列的分类模型。许可协议为 CC-BY-NC 4.0,仅限研究用途。

The dataset (fungi-its-barcodes) is a reference sequence collection for fungal internal transcribed spacer (ITS) regions, used for six-level taxonomic annotation (phylum, class, order, family, genus, species) following the UNITE naming scheme. The data originates from the UNITE + INSD fungal database (Abarenkov et al. 2023) and adopts the training/validation/test splits and classification head format from the MyCoAI data release (Romeijn et al. 2024). The dataset includes the following files: training set (trainset.fasta, ~1.5 million sequences), validation set (trainset_valid.fasta), test set 1 (test1.fasta, 4,439 sequences, yeast-enriched), test set 2 (test2.fasta, 11,619 sequences, filamentous fungi), test set 3 (test3.fasta, 367,337 sequences, large-scale benchmark), and a demo subset (top50.fasta, 2,024 sequences). Each sequences FASTA header encodes the complete taxonomic path from kingdom to species, with unknown ranks marked by question marks. The training set covers 18 phyla, 70 classes, 231 orders, 791 families, 3,695 genera, and 14,742 species. This dataset is suitable for text classification tasks and can be used to train and evaluate fungal ITS sequence classification models. Licensed under CC-BY-NC 4.0, for research purposes only.

提供机构:
zhangtaolab
创建时间:
2026-09-11
原始信息汇总

fungi-its-barcodes 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/zhangtaolab/fungi-its-barcodes
  • 许可协议:CC-BY-NC 4.0(仅限研究使用;商业授权需联系作者)
  • 任务类别:文本分类
  • 标签:fungi、ITS、taxonomy、barcoding、biodiversity

数据集简介

真菌内转录间隔区(ITS)参考序列,用于 6 级分类学分类(门 → 纲 → 目 → 科 → 属 → 种),采用 UNITE 规范。

文件构成

文件 序列数量 用途
trainset.fasta 约 150 万 训练参考序列
trainset_valid.fasta — 验证集划分
test1.fasta 4,439 测试 1 — 富集酵母
test2.fasta 11,619 测试 2 — 丝状真菌
test3.fasta 367,337 测试 3 — 大规模基准
top50.fasta 2,024 演示子集

数据格式

FASTA 头部编码完整的分类学路径;未知等级以 ? 标记:

KY106088|k__Fungi;p__Ascomycota;c__Saccharomycetes;o__Saccharomycetales;f__Saccharomycetaceae;g__Zygotorulaspora;s__Zygotorulaspora_mrakii|SH1312607.09FU

类别数量(训练集)

  • 门:18
  • 纲:70
  • 目:231
  • 科:791
  • 属:3,695
  • 种:14,742

数据来源

  • 参考序列源自 UNITE + INSD dataset for Fungi(Abarenkov 等,2023,PlutoF,doi:10.15156/bio/2938065)。
  • 训练/验证/测试划分及 UNITE 风格分类学头部遵循 MyCoAI 数据发布(Romeijn 等,2024,Molecular Ecology Resources,doi:10.1111/1755-0998.14006;github.com/MycoAI/MyCoAI)。
  • 使用本数据集时需同时引用上述两个来源。

使用方法

  • 微调模型:FungiHelixSeek-Taxonomy(https://huggingface.co/zhangtaolab/FungiHelixSeek-Taxonomy),在丝状真菌测试集(test2.fasta,干净标注的参考子集)上物种准确率为 70.8%。

bash python scripts/species_classification/predict.py --model_path models/FungiHelixSeek-Taxonomy --input_fasta test2.fasta --output predictions.csv

  • 训练配方与完整指标:scripts/species_classification on GitHub(https://github.com/zhangtaolab/FungiHelixSeek/blob/main/scripts/species_classification/README.md)

许可

CC-BY-NC 4.0(仅限研究使用;商业授权需联系作者)。

搜集汇总
数据集介绍
fungi-its-barcodes 数据集图片
构建方式
该数据集以真菌核糖体内部转录间隔区(ITS)参考序列为基础,整合了UNITE与INSD联合数据库中的公开真菌序列资源,并参照MyCoAI数据发布的划分策略与UNITE分类头格式进行系统化整理。序列来源具有明确的文献支撑,分类层级覆盖从门至种的六级分类单元,训练集规模约150万条,验证集与测试集按照独立样本进行拆分,其中测试集进一步细分为酵母富集集、丝状真菌集及大规模基准集,分类标签以分号分隔的层级路径形式编码于FASTA头部,未知分类等级以问号标识,从而构建起结构规范、来源可溯的真菌条形码参考数据集。
特点
本数据集的核心特征在于其分类体系的完整性与层级结构的精细化。训练集涵盖18个门、70个纲、231个目、791个科、3695个属及14742个种,能够支撑从粗粒度到细粒度的多层级分类任务。序列以标准FASTA格式存储,头部信息同时包含登录号、完整分类路径及UNITE物种假设标识,便于解析与建模。测试集的差异化设计兼顾了不同真菌类群的评估需求,其中丝状真菌测试集为物种级分类提供了经过标签清洗的参考子集,大规模基准集则可用于评估模型在规模化数据条件下的性能表现。
使用方法
该数据集主要面向真菌ITS序列的文本分类任务,可直接用于训练和评估深度学习或机器学习分类模型。使用者可通过加载FASTA文件获取序列及其对应的分类标签,依据任务需求选择不同层级的分类目标。官方推荐采用微调后的FungiHelixSeek-Taxonomy模型进行物种级预测,通过运行脚本指定模型路径、输入FASTA文件及输出预测结果文件即可完成推理,在丝状真菌测试集上物种准确率可达70.8%。训练配方与完整评估指标可参考GitHub仓库中的物种分类脚本说明,使用时需遵循CC-BY-NC 4.0许可,并同时引用UNITE与MyCoAI两个来源。
背景与挑战
背景概述
真菌内部转录间隔区(ITS)作为真菌物种鉴定的核心条形码标记,在生物多样性评估与生态学研究中占据不可替代的地位。然而,随着高通量测序技术的普及,海量ITS序列的准确分类面临参考数据库规模不足与分类层级不一致的双重制约。fungi-its-barcodes数据集应运而生,其原始序列衍生于UNITE与INSD联合构建的真菌参考数据集(Abarenkov等,2023),并采用了MyCoAI项目(Romeijn等,2024)所确立的训练、验证与测试划分策略。该数据集涵盖从门至种的六级分类阶元,训练集序列约150万条,并在三个独立测试集上提供酵母富集、丝状真菌及大规模基准评估方案。此项工作为真菌分类模型的标准化训练与公平比较提供了关键基础设施,对推动环境DNA宏条形码与真菌系统发育研究具有深远影响。
当前挑战
该数据集所应对的核心挑战在于真菌ITS序列固有的高种内变异与低种间分化,致使物种水平分类边界模糊,尤其近缘物种的准确区分极为困难。构建层面,参考序列源自异质性数据库,分类注释存在冲突或缺失,未知阶元以问号标记,需经严格质量筛选与统一格式化方可使用,而训练集与测试集间潜在的分布偏移进一步增加了泛化难度。此外,超过14,000个物种的极端长尾分布使稀有类别的代表性严重不足,类别不平衡问题突出。大规模基准测试集虽提供压力评估,但计算资源消耗与模型校准复杂度亦构成实际障碍。
常用场景
经典使用场景
在真菌分子生态学与生物多样性研究领域,内转录间隔区(ITS)作为真菌物种鉴定的核心条形码标记,长期依赖参考序列数据库进行序列比对与分类注释。fungi-its-barcodes数据集汇聚了源自UNITE与INSD的真菌ITS参考序列,涵盖从门至种的六级分类阶元,并以约150万条训练序列及多个测试集构建了系统化的监督学习框架。其经典使用场景在于训练和评估深度神经网络模型,用以实现从原始ITS序列到精细分类层级的端到端预测,尤其适用于酵母富集样本与丝状真菌样本的分类基准测试,为真菌条形码的自动化鉴定提供了标准化的数据资源。
解决学术问题
传统的真菌ITS序列分类方法高度依赖相似性比对与参考数据库的覆盖度,面对环境样本中大量未被培养的真菌类群时,常出现分类分辨率不足与假阳性注释等瓶颈。该数据集通过提供大规模、多层级且标注规范的真菌ITS参考序列,有效缓解了物种级分类中训练数据稀缺与类别不平衡的问题,使得基于深度学习的分类模型得以在统一基准上量化其泛化性能。其意义在于推动了真菌分类学从依赖人工比对向自动化、可重复的机器学习范式的转变,为环境DNA宏条形码研究中的高分辨率物种鉴定奠定了数据基础。
衍生相关工作
该数据集直接衍生自MyCoAI数据发布体系,并催生了FungiHelixSeek-Taxonomy等微调模型,后者在丝状真菌测试集上实现了70.8%的物种准确率,成为真菌ITS分类领域的重要基准。围绕该数据资源,研究者进一步探索了卷积神经网络、Transformer架构及混合模型在长序列分类中的适用性,并推动了UNITE分类注释格式与机器学习流程的标准化整合。相关衍生工作亦包括针对酵母与丝状真菌差异分类难度的基准分析,以及面向大规模环境样本的推理加速与模型轻量化研究,持续拓展着真菌条形码智能鉴定的方法边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务