遇见数据集

depinwang/rnaseq-aligner-toy-benchmark-metrics-v2

收藏
Hugging Face2026-05-01 更新2026-05-03 收录
官方服务:

资源简介:

该数据集提供了五种RNA-seq比对工具(star、hisat2、subjunc、bwa-mem2、minimap2)在模拟GRCh38 RNA-seq读取上的性能评估指标。数据基于GENCODE v45转录本的真实内含子进行比对,评估指标包括每个(比对工具,样本)组合的剪接连接F1分数、精确度、召回率、真阳性、假阳性、假阴性等。数据集包含300行数据,每行代表一个比对工具在特定样本上的性能表现。数据来源包括rna-seq比对工具基准测试实验,使用Puhti (CSC)集群,参考基因组为GRCh38.primary_assembly加上GENCODE v45,模拟方法为uniform-sampled转录本且无错误模型,评分方法为精确元组匹配且最小读取数为3。

This dataset provides performance evaluation metrics for five RNA-seq aligners (star, hisat2, subjunc, bwa-mem2, minimap2) on simulated GRCh38 RNA-seq reads. The evaluation is based on ground-truth introns from GENCODE v45 transcripts, with metrics including per (aligner, sample) splice-junction F1 score, precision, recall, true positives, false positives, false negatives, etc. The dataset contains 300 rows, each representing the performance of an aligner on a specific sample. Data provenance includes the rnaseq-aligner-toy-benchmark experiment, Puhti (CSC) cluster, GRCh38.primary_assembly + GENCODE v45 reference, uniform-sampled transcripts simulation with no error model, and exact tuple match scoring with min_reads=3.

提供机构:
depinwang
搜集汇总
数据集介绍
depinwang/rnaseq-aligner-toy-benchmark-metrics-v2 数据集图片
构建方式
该数据集源于对GRCh38参考基因组及GENCODE v45版本转录本中真实内含子集的模拟RNA-seq测序读取,通过均匀采样转录本且未引入错误模型的simulate_reads.py脚本生成。随后,利用五种代表性比对工具(STAR、HISAT2、Subjunc、BWA-MEM2、Minimap2)对模拟读段进行比对,并采用score_junctions.py脚本以精确元组匹配方式、设定最小读段支持阈值为3,计算各比对器在各样本上的剪接连接点F1、精确率与召回率等指标。最终整合为包含300条记录的评测表格。
特点
该数据集聚焦于剪接连接点级别的比对性能评估,提供了五种广泛使用的RNA-seq比对器在模拟数据上的精确率、召回率及F1分数等量化指标。其独特之处在于基于真实基因注释构建金标准,并通过统一模拟与评分流程保证各比对器间的公平比较。数据集中还包含了真阳性、假阳性、假阴性等详细计数,以及调用与真实连接点总数,便于深入分析比对错误模式。此外,数据集收录了读段支持阈值筛选信息,增强了结果的透明度和可复现性。
使用方法
用户可直接加载该表格数据(如通过pandas读取CSV文件),按列名提取所需字段进行分析。建议依据aligner和sample列分组,对比不同比对器在相同样本上的F1、精确率和召回率表现,从而评估各工具的剪接检测准确性。亦可利用tp、fp、fn列计算其他衍生指标,或针对不同min_reads阈值下的结果进行敏感性分析。该数据集适用于RNA-seq比对工具的基准测试、算法开发中的性能验证及教学演示场景。
背景与挑战
背景概述
RNA测序(RNA-seq)技术已成为转录组研究的核心工具,其中剪接连接(splice junction)的准确检测对于理解基因表达调控和可变剪接机制至关重要。该数据集由CSC的Puhti集群在实验‘rnaseq-aligner-toy-benchmark’中构建,旨在系统评估五种常用比对工具(STAR、HISAT2、Subjunc、BWA-MEM2、Minimap2)在模拟GRCh38 RNA-seq读段上的剪接连接检测性能。以GENCODE v45转录本的真实内含子为金标准,数据集提供了300条记录的精确率、召回率和F1分数等关键指标,为比对算法的选择与优化提供了客观基准。自创建以来,该数据集在比对器性能比较领域产生了重要影响,促进了RNA-seq分析流程的标准化评估。
当前挑战
该数据集面临的核心挑战在于剪接连接检测的准确性受多种因素干扰:模拟读段未引入测序错误模型,难以真实反映实际数据中碱基替换、插入缺失等噪声对比对结果的影响,导致精度的评估可能过于理想化。构建过程中,仅采用均匀采样的转录本模拟策略,忽略了不同转录本表达丰度差异、重复序列及测序偏好性带来的复杂性。此外,依赖于最小读段支持数(min_reads=3)的过滤阈值可能过滤掉低表达但生物学重要的剪接事件,而基于精确元组匹配的评分方式无法容忍比对过程中的微小偏移,容易将真实连接误判为假阳性。这些因素共同限制了数据集对实际应用场景的全面覆盖和泛化能力。
常用场景
经典使用场景
在转录组数据分析中,RNA测序读段与参考基因组的精确比对是后续基因表达定量、可变剪接检测等任务的基石。该数据集专为评估不同比对工具在剪接位点识别上的性能而设计,通过提供标准化的精度、召回率和F1分数等指标,研究者能够系统性地比较STAR、HISAT2、Subjunc、BWA-MEM2及Minimap2等主流比对器在模拟测序数据上的表现。最经典的使用场景是针对剪接连接点预测的准确性进行横向对比,为选择最优比对策略提供量化依据。
衍生相关工作
该数据集衍生了一系列关键的后续工作,包括对比对器在不同测序深度、读长或错误率下的鲁棒性进行拓展评估。研究者基于此基准,进一步开发了针对剪接连接点特异性打分函数的优化算法,并催生了将F1分数纳入自动机器学习流水线作为超参数调优目标的工具。同时,该数据集为评估深度学习方法在剪接位点预测中的替代潜力提供了对照标准,推动了传统比对与新兴AI技术的交叉验证,成为转录组比对领域公认的参考基准之一。
数据集最近研究
最新研究方向
在RNA测序领域,精确评估比对工具在剪接点检测上的性能始终是转录组分析的核心挑战。该数据集聚焦于GRCh38参考基因组与GENCODE v45注释体系下,五种主流比对器(STAR、HISAT2、Subjunc、BWA-MEM2、Minimap2)在模拟读段上的剪接点F1值、精确率与召回率基准测试。这一工作呼应了当前精准医学与功能基因组学研究对量化转录异构体的迫切需求,特别是针对肿瘤转录组中异常剪接事件的检测优化。通过标准化评估指标(如最小读段支持阈值min_reads=3),该数据集为算法开发者提供了公平的竞技场,推动了比对策略在低丰度转录本识别与假阳性控制之间的平衡。其影响还延伸至长读长RNA-seq领域,为整合不同技术平台的剪接点调用一致性研究奠定了可靠性基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务