sirna-data-grabber
收藏资源简介:
一个独立的siRNA敲低效率数据集,包含原始数据文件、完整的来源/许可证文档,以及一个小型可重用的Python包(sirna_data)用于加载数据。由于pip install sirna-data-grabber无法分发大部分非商业数据,还提供了一个捆绑的sirna-data-fetch命令,用于从原始来源重新获取数据。当前包含97个基因的16,178条siRNA记录。
An independent siRNA knockdown efficiency dataset. It includes raw data files, complete source and license documentation, plus a lightweight reusable Python package (`sirna_data`) for loading the dataset. Since most non-commercial data cannot be distributed via `pip install sirna-data-grabber`, a bundled `sirna-data-fetch` command is additionally provided to retrieve the data from its original sources. Currently, the dataset holds 16,178 siRNA records for 97 genes.
数据集概述
sirna-data-grabber 是一个独立的 siRNA 敲低效能数据集,包含原始数据文件、完整的来源与许可证文档,以及一个用于加载该数据集的轻量级 Python 包(sirna_data)。
核心数据规模
- 当前版本:包含 16,178 条 siRNA 记录,覆盖 97 个基因(使用
load_records()默认配置) - 可训练数据:在默认排除可选的大规模 CMsiRNAdb 全库检索后,包含 6,577 条可训练记录,覆盖 87 个基因,来自 4 个独立来源
数据来源
主要来源为 siRNAEfficacyDB(Zhang 等,2024,CC BY-NC 许可),其他来源包括:
- CMsiRNAdb(完整数据库或仅 PCSK9 子集)
- Shabalina 2006(补充数据)
- Monopoli 2023(补充数据)
每个来源均可通过独立的 include_* 参数单独启用或排除,实现灵活的数据组合。
基因覆盖详情
数据集涵盖 97 个基因,每个基因的 siRNA 记录数从 3 条(如 BACE1、SNCA)到 2,756 条(PCSK9)不等,并附有对应的转录本长度(以核苷酸计)。部分基因(如 HSD17B13 有 1,985 条记录,PNPLA3 有 2,066 条记录)贡献了大量记录,而多数 Shabalina 2006 来源的基因仅有 4-21 条记录。
许可证说明
- 代码(
sirna_data、tests/):MIT 许可证,可自由使用、修改和商业分发 - 数据(
data/raw/):不受 MIT 许可证覆盖,需遵守各原始来源的条款,其中大多数为仅限非商业用途(CC BY-NC 或 CC BY-NC-ND)
安装与使用
可通过 PyPI 安装:
bash pip install sirna-data-grabber
由于 PyPI 包不能直接包含大部分非商业数据,需使用 sirna-data-fetch 命令从原始来源重新获取数据:
bash sirna-data-fetch --dest ./my_data
核心 API
load_records():加载合并后的数据集记录fetch_mrna_by_gene():从 NCBI 实时查找基因的 RefSeq mRNA 转录本train_test_split():按基因分组的训练/测试集划分(防止同一基因跨分割)leave_n_genes_out():留 N 基因交叉验证生成器
已知数据质量注意事项
EGFP基因的 702 条记录映射到的 RefSeq 登录号实际为细菌基因组组装序列(~3.7 Mb),而非真实 EGFP 转录本,推测为实验室质粒污染,但靶位点仍可验证,仅转录本长度不具参考意义Firefly luciferase和FireflyLuc是同一报告基因在源数据中的两个不同字符串标签,数据集中保持独立分组




