seqforge-benchmark
收藏资源简介:
seqforge 验证基准数据集是一个用于验证 seqforge 编译器的基准测试集。每个数据包(packages/<accession>.fingerprint.tar.gz)是真实公共数据集 FASTQ 文件的头部切片(每个文件约前2000条 reads),并附带一个包含整个文件身份的指纹,使得 seqforge 可以在没有原始 FASTQ 文件的情况下重现相同的 manifest.yaml(包括哈希值)。该数据集是编译器开发过程中不断增长的验证集,单独的 held-out 测试集将另行提供。数据包仅包含 reads 头切片(不足以重建生物学信息)以及从论文中提取的文本(info/text/ 目录),原始论文及其图表由于版权原因未重新分发。数据包通过 seqforge preflight --redistributable 构建或通过 seqforge strip-fingerprint 重新打包,因此可共享。数据集包含7个 C. elegans(taxid 6239)数据集,覆盖多种测序技术(10x 3' v2/v3/v3.1、BD Rhapsody WTA)、制备方法(单细胞核、全细胞、性腺等)和布局(常规长度、等长 reads),并针对已知回归问题设计。
The seqforge validation benchmark dataset is a benchmark test set for verifying the seqforge compiler. Each data package (packages/<accession>.fingerprint.tar.gz) is a header slice of real public dataset FASTQ files (approximately the first 2000 reads per file), accompanied by a fingerprint containing the identity of the entire file, allowing seqforge to reproduce the same manifest.yaml (including hash values) without the original FASTQ files. This dataset is a growing validation set during compiler development; a separate held-out test set will be provided later. The data packages contain only read header slices (insufficient to reconstruct biological information) and text extracted from papers (info/text/ directory); original papers and figures are not redistributed due to copyright. Data packages are built via seqforge preflight --redistributable or repackaged via seqforge strip-fingerprint, thus shareable. The dataset includes 7 C. elegans (taxid 6239) datasets, covering multiple sequencing technologies (10x 3 v2/v3/v3.1, BD Rhapsody WTA), preparation methods (single-cell nuclei, whole cells, gonads, etc.), and layouts (regular length, equal-length reads), and is designed for known regression problems.
数据集概述:seqforge validation benchmark
该数据集是 seqforge 项目的验证基准测试集,由 Byte-light 指纹包 组成。
核心内容
- 每个指纹包位于
packages/<accession>.fingerprint.tar.gz,是真实公共数据集 FASTQ 文件的头部切片(每个文件约前 2000 条 reads)以及携带文件整体身份信息的引脚。 - 该数据足以让 seqforge 复现相同哈希值的
manifest.yaml,而无需原始 FASTQ 文件。 - 该集合是编译器开发过程中持续增长的验证集;真正的留出测试集是独立的。
包含与不包含的内容
- 读取数据:仅为头部切片,不包含完整 FASTQ 文件,无法重建生物学信息。
- 文本内容:仅提取文本信息(
info/text/);原始论文及其图片因版权原因不在本数据集中重新分发。
使用方式
seqforge 的评估框架通过匿名方式按登录号拉取包(pooch 缓存,无需令牌),对切片运行编译器,并将解析后的库与预注册的 expected.yaml 进行比对评分。样本级别的事实依据归档中的 BioSample/SRA 记录进行评分。相关代码位于 seqforge 仓库的 evals/benchmark/ 目录。
数据集列表
所有数据集均为 C. elegans(taxid 6239),覆盖多种技术、制备方式、布局及已知回归问题,样本量适中:
| 登录号 | 化学方法 | 备注 |
|---|---|---|
| PRJNA1027859 | 10x 3 v3/v3.1 | 单核神经元(试点演示数据集) |
| GSE274290 | BD Rhapsody WTA | 唯一 BD 来源的数据集;生殖系 |
| GSE234962 | 10x 3 v3 | 运动神经元 |
| GSE256266 | 10x 3 v3/v3.1 | 跨性别的胶质细胞;文件名布局不规则 |
| PRJNA658829 | 10x 3 v3 | 全生物体;等长读段布局 |
| PRJNA1195922 | 10x 3 v3/v3.1 | 雄性单核神经元 |
| GSE126954 | 10x 3 v2 | 胚胎发育图谱 |
该集合会随着更多数据集的整理而不断扩充。




