遇见数据集

seqforge-benchmark

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

seqforge 验证基准数据集是一个用于验证 seqforge 编译器的基准测试集。每个数据包(packages/<accession>.fingerprint.tar.gz)是真实公共数据集 FASTQ 文件的头部切片(每个文件约前2000条 reads),并附带一个包含整个文件身份的指纹,使得 seqforge 可以在没有原始 FASTQ 文件的情况下重现相同的 manifest.yaml(包括哈希值)。该数据集是编译器开发过程中不断增长的验证集,单独的 held-out 测试集将另行提供。数据包仅包含 reads 头切片(不足以重建生物学信息)以及从论文中提取的文本(info/text/ 目录),原始论文及其图表由于版权原因未重新分发。数据包通过 seqforge preflight --redistributable 构建或通过 seqforge strip-fingerprint 重新打包,因此可共享。数据集包含7个 C. elegans(taxid 6239)数据集,覆盖多种测序技术(10x 3' v2/v3/v3.1、BD Rhapsody WTA)、制备方法(单细胞核、全细胞、性腺等)和布局(常规长度、等长 reads),并针对已知回归问题设计。

The seqforge validation benchmark dataset is a benchmark test set for verifying the seqforge compiler. Each data package (packages/<accession>.fingerprint.tar.gz) is a header slice of real public dataset FASTQ files (approximately the first 2000 reads per file), accompanied by a fingerprint containing the identity of the entire file, allowing seqforge to reproduce the same manifest.yaml (including hash values) without the original FASTQ files. This dataset is a growing validation set during compiler development; a separate held-out test set will be provided later. The data packages contain only read header slices (insufficient to reconstruct biological information) and text extracted from papers (info/text/ directory); original papers and figures are not redistributed due to copyright. Data packages are built via seqforge preflight --redistributable or repackaged via seqforge strip-fingerprint, thus shareable. The dataset includes 7 C. elegans (taxid 6239) datasets, covering multiple sequencing technologies (10x 3 v2/v3/v3.1, BD Rhapsody WTA), preparation methods (single-cell nuclei, whole cells, gonads, etc.), and layouts (regular length, equal-length reads), and is designed for known regression problems.

创建时间:
2026-07-23
原始信息汇总

数据集概述:seqforge validation benchmark

该数据集是 seqforge 项目的验证基准测试集,由 Byte-light 指纹包 组成。

核心内容

  • 每个指纹包位于 packages/<accession>.fingerprint.tar.gz,是真实公共数据集 FASTQ 文件的头部切片(每个文件约前 2000 条 reads)以及携带文件整体身份信息的引脚。
  • 该数据足以让 seqforge 复现相同哈希值的 manifest.yaml,而无需原始 FASTQ 文件
  • 该集合是编译器开发过程中持续增长的验证集;真正的留出测试集是独立的。

包含与不包含的内容

  • 读取数据:仅为头部切片,不包含完整 FASTQ 文件,无法重建生物学信息。
  • 文本内容:仅提取文本信息(info/text/);原始论文及其图片因版权原因不在本数据集中重新分发

使用方式

seqforge 的评估框架通过匿名方式按登录号拉取包(pooch 缓存,无需令牌),对切片运行编译器,并将解析后的库与预注册的 expected.yaml 进行比对评分。样本级别的事实依据归档中的 BioSample/SRA 记录进行评分。相关代码位于 seqforge 仓库的 evals/benchmark/ 目录。

数据集列表

所有数据集均为 C. elegans(taxid 6239),覆盖多种技术、制备方式、布局及已知回归问题,样本量适中:

登录号 化学方法 备注
PRJNA1027859 10x 3 v3/v3.1 单核神经元(试点演示数据集)
GSE274290 BD Rhapsody WTA 唯一 BD 来源的数据集;生殖系
GSE234962 10x 3 v3 运动神经元
GSE256266 10x 3 v3/v3.1 跨性别的胶质细胞;文件名布局不规则
PRJNA658829 10x 3 v3 全生物体;等长读段布局
PRJNA1195922 10x 3 v3/v3.1 雄性单核神经元
GSE126954 10x 3 v2 胚胎发育图谱

该集合会随着更多数据集的整理而不断扩充。

搜集汇总
数据集介绍
seqforge-benchmark 数据集图片
构建方式
本数据集作为seqforge编译器的验证基准,其构建匠心独运,将公开数据集的FASTQ文件进行头部切片(每文件约前2000条reads),并辅以携带完整文件身份信息的‘pin’文件,封装为轻量级的指纹包。每个指纹包均以压缩归档形式存储,能够在无需原始FASTQ文件的前提下,使seqforge重现相同的manifest.yaml及哈希值。构建过程严格遵循版权规范,仅提取文本元数据,而不包括原始论文及图表,确保数据共享的合规性。所选数据集均来自秀丽隐杆线虫,覆盖多种测序技术、文库制备方法及布局类型,包含已知回归测试场景,为编译器的持续优化提供了坚实的测试基础。
使用方法
seqforge的评估框架通过数据集登录号(如PRJNA1027859)自动拉取指纹包,并在本地缓存,无需认证。随后,编译器在真实的头部切片上运行,将解析得到的库文件与仓库中预注册的expected.yaml进行对比评分,样本级事实依据BioSample/SRA记录进行校验。该基准集与真正的留出测试集分离,确保开发阶段的诚实评估。使用者可通过seqforge仓库的evals/benchmark/目录查看详细评估逻辑,并根据自身需求扩展数据集,随着更多数据集的归档,此验证集将持续增长,助力编译器性能的持续提升。
背景与挑战
背景概述
单细胞基因组学作为现代生命科学研究的核心前沿,其数据分析流程的复杂性与日俱增,尤其在从原始测序数据(FASTQ)到表达矩阵的转化过程中,依赖于多样化的工具链和繁琐的参数配置。为应对这一挑战,seqforge 作为一个编译型工作流管理器应运而生,旨在实现单细胞测序数据的自动化处理与可复现分析。seqforge-validation-benchmark 数据集于近年由 liuhlab 研究团队构建,其核心研究问题在于创建一种轻量级、可分发且不侵犯版权的验证基准,以真实数据集的头部切片(head slice)和指纹包(fingerprint package)形式,确保编译器在无需原始完整数据的前提下,能够准确重现解析流程及生成一致的 manifest 文件。该基准选取了涵盖多种建库技术(如 10x Genomics 与 BD Rhapsody)、不同组织来源及性别差异的秀丽隐杆线虫(C. elegans)数据集,为评估 seqforge 编译器的性能与稳健性提供了标准化测试平台,对单细胞数据流程的可重复性和可扩展性研究具有重要推动作用。
当前挑战
该数据集所应对的领域挑战,一方面来自单细胞基因组学数据处理的生态碎片化:不同测序平台、建库方案及文库布局(如等长读取与非等长读取)间存在显著差异,导致流程配置极易出错且难以比较,seqforge-benchmark 通过精心选择的跨技术数据集和异常文件名布局,致力于评估编译器在处理异构数据时的适应性与鲁棒性。另一方面,在构建过程中,面临的挑战主要涉及版权与数据共享的冲突:由于原始文献及配套图像受版权保护,无法直接分发,研究团队只能提取文本信息并运用 seqforge 的 preflight 与 strip-fingerprint 机制,在确保代表性(保留前约 2000 条读取以刻画化学特征)与可重建性的同时,剔除任何可能涉及版权的内容,实现合规的开放共享。此外,如何在不暴露完整生物信息的前提下,保证指纹包足以驱动哈希一致性和 manifest 的精确再现,也是技术设计上的关键难题,这一平衡考验了数据压缩与信息冗余之间的权衡策略。
常用场景
经典使用场景
seqforge-benchmark数据集作为seqforge编译器的验证基准,其核心使用场景在于对单细胞基因组学数据处理流程的自动化编译与优化。该数据集通过提供真实公共数据集FASTQ文件的开头切片(每个文件约前2000条读段)以及完整的文件指纹,使研究人员无需原始大文件即可复现数据处理管线的构建过程。它涵盖了多种测序技术(如10x Genomics 3' v2/v3/v3.1和BD Rhapsody WTA)、不同组织来源(神经元、胶质细胞、生殖系、胚胎等)以及多样化的文库布局(等长读段、不规则文件名等),为评估编译器的通用性和鲁棒性提供了丰富的测试样本。研究者可利用这些指纹包测试seqforge在解析不同化学原理、样本制备方法和数据结构时的准确性,从而验证其生成manifest.yaml文件的能力。
解决学术问题
该数据集解决了单细胞基因组学研究中数据管理复杂性和可重复性不足的学术难题。传统的单细胞RNA测序数据处理依赖于手动配置多样化的软件工具链,且原始FASTQ文件体积庞大、存储和传输成本高昂,导致研究结果难以复现。seqforge-benchmark通过提供轻量级指纹包,使研究者能够在无需完整数据的情况下验证数据解析逻辑,极大降低了基准测试的准入门槛。它确保了数据处理流程的版本可控性和结果的一致性,解决了因测序平台差异、文库构建方案不同以及文件名布局不规则等带来的兼容性问题。该数据集的建立推动了数据管线编译器的规范化发展,为单细胞数据分析的可重复性研究提供了关键支撑。
实际应用
在实际应用中,seqforge-benchmark数据集被seqforge项目的评估系统所采用,通过自动拉取指定接入号的指纹包,运行编译器对切片数据进行处理,并将生成的结果与预注册的expected.yaml文件进行比对,以精确评估解析的正确性。这一机制使得数据科学家和生物信息学家能够在不接触大型原始数据的前提下,快速验证和迭代新的数据处理方法。同时,该数据集也被用于持续集成和回归测试,确保seqforge编译器在更新过程中不会引入功能退化。此外,由于数据包仅包含少量读取和文本信息,符合版权和共享要求,安全地促进了学术界和工业界的协作与知识传播,为单细胞数据管道的开发提供了实用的测试平台。
数据集最近研究
最新研究方向
基于seqforge编译器的验证基准数据集,聚焦于单细胞转录组数据的可复现性分析,通过轻量级指纹包技术实现无需原始FASTQ文件的实验流程复现。当前研究前沿在于利用该基准评估不同测序平台(如10x Genomics与BD Rhapsody)和文库构建方案(如单细胞核与全细胞)对数据解析的影响,尤其关注跨性别、跨发育阶段及不规则文件命名等复杂场景下的稳健性。该数据集支撑了seqforge编译器在真实公共数据上的验证,促进了单细胞基因组学中数据共享与可重复性标准的建立,为领域内大规模基准测试提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务