phanerozoic/dna-origin-benchmark
收藏资源简介:
dna-origin-benchmark是一个用于DNA序列来源分类的标记数据集,包含24,950个长度为300 bp的DNA片段,覆盖382个生物体。每个片段标记其来源类别:人类、其他真核生物、细菌、病毒、工程/合成或未数据库化(即环境序列不在参考数据库中)。数据集结构包括唯一ID、DNA序列(ACGT组成)、类别(natural、nonhost、engineered、undatabased)、子类(如human、eukaryote等)、来源生物体以及划分(train、test、test_novel、undatabased)。数据组成按类别和子类分布:natural类包含human(1,500片段)和eukaryote(3,760片段),nonhost类包含bacteria(5,587片段)和virus(3,087片段),engineered类包含real(7,302片段)和recodings(1,560片段),undatabased类包含metagenome(2,154片段)。划分分布:train(16,323片段)、test(4,181片段)、test_novel(2,292片段)和undatabased(2,154片段)。构建过程基于NCBI RefSeq记录采样,涵盖自然和非宿主序列(来自94个真核生物分类群、140个细菌基因组和140个病毒基因组,以及人类),工程化序列(来自NCBI合成构造、密码子优化等记录),以及未数据库化片段(来自环境宏基因组,经Kraken2对RefSeq数据库未分类筛选)。通过CD-HIT-est在90%同一性下聚类,划分在聚类级别分配,确保无聚类跨越train和test,且20%的非宿主组分类群作为test_novel保留,构建过程可重现。任务包括:五个标记来源的分类、工程化与自然序列检测、人类与非宿主检测,以及对未数据库化序列的参考无关行为分析。基准测试比较了参考无关分类器与数据库工具(如Kraken2)的性能,显示在未数据库化序列上参考无关分类器覆盖率达100%。数据来源为NCBI RefSeq、NCBI合成记录和环境宏基因组记录,许可证为CC-BY-4.0。
--- 许可证: CC-BY-4.0 任务类别: - 文本分类 标签: - 基因组学 - DNA - 序列分类 - k聚体(k-mer) - 无参考序列 数据集规模: - 10K<n<100K --- # DNA来源基准数据集(dna-origin-benchmark) 本数据集包含用于来源分类的标记化DNA序列片段,每条片段长度为300碱基对(base pair,bp)。标签为序列的来源:人类、其他真核生物、细菌、病毒、工程化/合成序列,或无参考库序列(即参考数据库中未收录的环境序列)。数据集共包含382个物种的24950条序列片段。 ## 字段说明(Schema) | 字段 | 说明 | |---|---| | id | 唯一序列片段标识符 | | sequence | 300碱基对的DNA片段(碱基序列为ACGT) | | class | 类别:天然、非宿主、工程化或无参考库 | | subclass | 子类别:人类、真核生物、细菌、病毒、真实序列、编码方案或宏基因组 | | organism | 来源物种(或序列构建类型/编码方案/宏基因组) | | split | 数据集划分:训练集(train)、测试集(test)、新类测试集(test_novel)或无参考库集 | `test_novel`(新类测试集)包含训练集中未出现的完整物种及演化支,用于评估模型对未见过的分类群的泛化能力。`undatabased`(无参考库集)包含通过Kraken2工具比对参考序列数据库(RefSeq)无法分类的环境序列片段,用于评估无参考序列分类场景下的模型表现,此类场景下数据库驱动的分类方法无法找到匹配序列。 ## 数据集组成 ### 按类别与子类别统计 | 类别 | 子类别 | 序列片段数 | |---|---|---| | 天然 | 人类 | 1500 | | 天然 | 真核生物 | 3760 | | 非宿主 | 细菌 | 5587 | | 非宿主 | 病毒 | 3087 | | 工程化 | 真实序列(NCBI合成序列/载体) | 7302 | | 工程化 | 编码序列(大肠杆菌/酵母/GC偏好/基序/采样序列) | 1560 | | 无参考库 | 宏基因组 | 2154 | ### 按数据集划分统计 | 数据集划分 | 序列片段数 | |---|---| | 训练集(train) | 16323 | | 测试集(test) | 4181 | | 新类测试集(test_novel) | 2292 | | 无参考库集(undatabased) | 2154 | ## 数据集构建 天然及非宿主序列来自参考序列数据库(RefSeq)的记录,采样自94个真核生物分类群(从脊椎动物到原生生物)、140个细菌基因组、140个病毒基因组,以及人类样本。工程化阳性序列来自NCBI(美国国家生物技术信息中心)的合成构建体、密码子优化序列、表达及克隆载体序列,以及合成质粒记录,同时包含人类序列的6种同义编码方案(大肠杆菌优化、酵母优化、GC最大化、GC最小化、人类频率采样及限制性酶切位点规避序列)。无参考库序列片段取自环境宏基因组,仅保留经Kraken2工具比对RefSeq Standard-8数据库后返回“未分类”的片段。 所有序列片段通过CD-HIT-EST序列聚类工具以90%的相似度进行聚类;数据集划分基于聚类单元进行分配,确保单个聚类不会同时跨越训练集与测试集,且每个非宿主组中20%的分类群被完全留出作为`test_novel`(新类测试集)。该数据集的构建过程可通过固定随机种子复现。 ## 支持任务 1. 基于5个标记来源的序列来源分类任务 2. 工程化序列与天然序列的检测任务 3. 人类序列与非宿主序列的检测任务 4. 无参考序列场景下的分类任务(针对无参考库序列片段) ## 基线模型与对比实验 受试者工作特征曲线下面积(AUROC)是无参考序列闭式分类器(dna-origin-classifier,https://huggingface.co/phanerozoic/dna-origin-classifier)在各任务上的评价指标,其表现与两种基于数据库的工具在相同数据集划分下的表现进行对比。 ### 各任务性能对比 | 任务 | 闭式分类器(无参考序列) | Kraken2(RefSeq数据库) | |---|---|---| | 人类vs非宿主(测试集) | 0.993 AUROC | 灵敏度0.972 / 特异度1.000 | | 人类vs非宿主(新类分类群) | 0.990 AUROC | 特异度1.000(仅针对有参考库序列) | | 工程化vs天然(测试集) | 0.919 AUROC | 无可用数据 | | 五分类来源准确率(测试集) | 0.708 | 无可用数据 | ### 无参考库集覆盖度评估 针对`undatabased`(无参考库集)的覆盖度评估(此类序列未收录于RefSeq数据库): | 方法 | 覆盖度 | |---|---| | Kraken2(RefSeq数据库) | 0.0% | | BLAST(比对训练集) | 6.6% | | 闭式分类器 | 100%(其中99.1%被归类为非人类序列) | 数据库驱动的分类方法在此数据集上几乎无法完成分类,因为没有可匹配的参考序列;而基于序列组成的闭式分类器无需依赖参考数据库。在有参考库的分类群场景下,Kraken2的表现至少与闭式分类器相当;而闭式分类器在保持无参考序列分类能力的同时,模型体积仅为其约1/50000。 ## 数据集来源 NCBI(美国国家生物技术信息中心)参考序列数据库(RefSeq)、NCBI合成构建体记录及环境宏基因组记录(来源信息记录于`organism`字段)。 ## 许可证 数据集汇编采用CC-BY-4.0许可证。序列数据来源于NCBI。



