遇见数据集

OpenOmicsBench

收藏
github2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

OpenOmicsBench提供紧凑的批量RNA-seq计数矩阵,用于测试分析软件、教学可重复工作流和检查方法行为。

OpenOmicsBench provides compact bulk RNA-seq count matrices for testing analytical software, teaching reproducible analytical workflows, and examining method behaviors.

创建时间:
2026-09-07
原始信息汇总

OpenOmicsBench 数据集概述

OpenOmicsBench 是一个用于测试 RNA-seq 分析软件、教学可重复工作流程及检验方法行为的紧凑型批量 RNA-seq 计数矩阵数据集集合。

数据集基本信息

  • 版本: 当前为 Version 1 集合,包含 12 个基准对象,来源于 7 项 Expression Atlas 研究
  • 覆盖物种: 人类、小鼠、拟南芥
  • 实验设计类型: 平衡敲除、配对肿瘤样本、因子感染实验、RNA 干扰和疾病比较
  • 发布版本:
    • 0.1.0.dev0 预发布版(基础架构基线)
    • 1.0.0 首个完整集合发布版

数据内容与结构

每个生物对象包含以下内容:

  • 所选样本的源计数矩阵
  • 较小的 pocket 矩阵
  • 样本设计
  • 来源归属
  • 权利证据
  • 参考详情
  • 定量验证结果

数据集对象列表

ID 设计 样本数 Pocket基因数
rnaseq-002 SLC2A5 敲除(A549 异种移植) 10 2,000
rnaseq-003 AtRsgA 敲除(拟南芥幼苗) 6 4,000
rnaseq-004 Klf1 敲除(小鼠红系组织) 6 4,000
rnaseq-005 配对前列腺肿瘤及邻近组织 28 8,000
rnaseq-006 拟南芥感染(按基因型校正) 12 500
rnaseq-007 ELP3 缺失(BT549 细胞) 6 8,000
rnaseq-008 杜氏肌营养不良成肌细胞 9 8,000
rnaseq-009 拟南芥基因型(按感染校正) 12 500
rnaseq-010 野生型拟南芥感染应答 6 500
rnaseq-011 gsnor1 拟南芥感染应答 6 500
rnaseq-012 Dmd-mdx 成肌细胞对照野生型 6 8,000
rnaseq-013 Dmd-mdx-beta-geo 成肌细胞对照野生型 6 8,000

质量验证

  • 所有 12 个 pocket 均通过预设阈值(使用 DESeq2 1.50.2 与完整源矩阵比较)
  • 验证内容包括:清单、文件清单、字节数、SHA-256 哈希、样本顺序、矩阵形状及整型计数不变性
  • 每个对象均包含精确数值、输入哈希、工作流哈希、模型设计和运行时版本等证据文件
  • 参考检查确认每个 pocket 基因标识符均存在于匹配的 Ensembl 或 Ensembl Genomes 注释版本中

使用方式

需要 Python 3.11 或更高版本,在独立环境中安装:

  • 使用 omicsbench listinfovalidate 等命令查看和管理数据
  • validate 命令可离线运行,因每个 v1 对象均自包含
  • 提供 get 命令复制验证层级和 provenance 命令检查来源与转换记录

数据来源与许可

  • 生物源矩阵由 Expression Atlas 和 BioStudies 提供
  • 每个对象包含 attribution.jsonrights.json 文件
  • 分布的生物材料记录为 CC BY 4.0(含提供者信用和带日期的证据链接)
  • 软件采用 Apache License 2.0
  • 项目文与描述性元数据采用 Creative Commons Attribution 4.0 International

引用

存档版本作者显示为 Vivaan Patni,GitHub 开发和提交使用账户 vxxqv,所有版本的概念 DOI 为 10.5281/zenodo.22551734。

搜集汇总
数据集介绍
OpenOmicsBench 数据集图片
构建方式
在转录组学分析工具日新月异、方法评估却常因缺乏标准化测试材料而受阻的背景下,OpenOmicsBench的构建为方法学验证提供了一套经过精心整饬的基准资源。该数据集从Expression Atlas的七项原始研究中萃取生物源计数矩阵,并借助“对象”这一封装单元来组织数据;每个对象内含所选样本的完整源计数、体量更小的口袋矩阵、样本设计、来源归属、权利证据、参考文献及定量验证记录。构建过程尤为注重可复现性:口袋矩阵以预先声明的阈值与全量源矩阵进行比对,并通过DESeq2重新计算四项保真度指标,同时校验样本顺序、矩阵维度与整数计数的一致性,确保衍生数据在统计特性上与原始数据保持高度契合。
使用方法
使用该数据集时,需在Python 3.11或更新版本的隔离环境中从仓库根目录安装依赖与项目包,随后可通过命令行工具执行一系列操作。以`omicsbench list --assay bulk_rna_seq`浏览可用对象,以`omicsbench info rnaseq-002`查阅特定对象的元信息,并借助`omicsbench validate rnaseq-002`对清单、文件清单、字节数、SHA-256哈希、样本顺序、矩阵形状及未变更的整数计数进行校验,同时重新计算四项保真度指标。若需获取经核验的数据层级,可运行`omicsbench get rnaseq-002 --size pocket`将其复制至本地缓存;`omicsbench provenance rnaseq-002`则用于检查其来源与转化记录。每个公开命令的帮助文本中均附有使用示例。
背景与挑战
背景概述
随着RNA-seq技术的普及,可重复的分析流程与软件基准测试成为计算生物学的重要议题。OpenOmicsBench于2024年由Vivaan Patni构建,从Expression Atlas的七项研究中精选12个基准对象,覆盖人、小鼠与拟南芥的敲除、配对肿瘤、感染及疾病比较等设计。该数据集提供紧凑的计数矩阵与完整溯源信息,旨在测试分析软件、教学可重复工作流并检验方法行为,为RNA-seq方法学评估提供了标准化资源。
当前挑战
该数据集所应对的核心挑战在于,RNA-seq差异表达分析常因原始数据庞大、溯源缺失及样本元数据不完整而难以复现与公平比较,OpenOmicsBench通过提供经校验的紧凑计数矩阵与设计信息来缓解这一问题。构建过程中,需在保留足够基因信息与维持矩阵紧凑性之间取得平衡,确保口袋矩阵与源矩阵在DESeq2分析中产生一致的保真度指标,同时严格校验样本顺序、哈希值与整数计数,避免跨研究样本冲突和重复内容,保证每个对象自包含且可离线验证。
常用场景
经典使用场景
在生物信息学与计算生物学领域,RNA-seq计数矩阵的标准化处理与差异表达分析工具的性能评估长期依赖真实且可控的基准数据。OpenOmicsBench应运而生,其经典使用场景在于为DESeq2、edgeR等差异表达分析软件提供紧凑的基准计数矩阵,涵盖人类、小鼠及拟南芥等多物种的敲除、配对肿瘤、感染实验等设计。研究者可通过预置的pocket矩阵快速验证分析流程的重复性与方法行为,无需下载庞大的原始测序数据,即可在离线环境中完成软件测试与教学演示。
解决学术问题
该数据集直面学术研究中基准数据稀缺、来源不明与可重复性不足等痛点。通过提供自包含的计数矩阵、样本设计、来源归属及权利证据,OpenOmicsBench解决了方法学论文中因数据异质性导致的比较困难问题,并借助DESeq2保真度指标量化了pocket矩阵与全源矩阵的一致性。其意义在于为差异表达分析工具的鲁棒性评估建立了可审计、可复现的标准化框架,推动了计算生物学方法学研究的透明化进程。
实际应用
在实际应用层面,OpenOmicsBench服务于生物信息学软件开发者、统计方法研究者及高校教学人员。开发者可利用其验证新算法在平衡敲除、因子感染等复杂设计下的表现;教师可借助小型pocket矩阵在课堂上演示RNA-seq分析全流程;方法学家则能通过预声明的阈值与校验命令,快速排查软件版本更新引入的偏差。该数据集有效降低了RNA-seq分析工具测试的门槛与计算成本。
数据集最近研究
最新研究方向
在转录组学方法学评估与可重复性研究日益受到关注的背景下,OpenOmicsBench应运而生,为批量RNA-seq分析软件的基准测试提供了精炼而系统的资源。该数据集汇聚了来自Expression Atlas七项研究的12个基准对象,涵盖人类、小鼠与拟南芥的敲除、配对肿瘤、感染及疾病对比等设计,并随附来源、权利与验证证据。其核心方向在于以囊袋矩阵(pocket matrix)降低存储与计算开销,同时通过DESeq2保真度指标确保方法行为可比,推动可复现工作流与教学标准化。这一进展呼应了计算生物学对透明、可审计基准的迫切需求,为方法开发者与教育者提供了可靠的测试床,亦强化了数据溯源与许可合规的实践规范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务