遇见数据集

sirna-data-grabber

收藏
github2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

一个独立的siRNA敲低效率数据集,包含原始数据文件、完整的来源/许可证文档,以及一个小型可重用的Python包(sirna_data)用于加载数据。由于pip install sirna-data-grabber无法分发大部分非商业数据,还提供了一个捆绑的sirna-data-fetch命令,用于从原始来源重新获取数据。当前包含97个基因的16,178条siRNA记录。

An independent siRNA knockdown efficiency dataset. It includes raw data files, complete source and license documentation, plus a lightweight reusable Python package (`sirna_data`) for loading the dataset. Since most non-commercial data cannot be distributed via `pip install sirna-data-grabber`, a bundled `sirna-data-fetch` command is additionally provided to retrieve the data from its original sources. Currently, the dataset holds 16,178 siRNA records for 97 genes.

创建时间:
2026-08-11
原始信息汇总

数据集概述

sirna-data-grabber 是一个独立的 siRNA 敲低效能数据集,包含原始数据文件、完整的来源与许可证文档,以及一个用于加载该数据集的轻量级 Python 包(sirna_data)。

核心数据规模

  • 当前版本:包含 16,178 条 siRNA 记录,覆盖 97 个基因(使用 load_records() 默认配置)
  • 可训练数据:在默认排除可选的大规模 CMsiRNAdb 全库检索后,包含 6,577 条可训练记录,覆盖 87 个基因,来自 4 个独立来源

数据来源

主要来源为 siRNAEfficacyDB(Zhang 等,2024,CC BY-NC 许可),其他来源包括:

  • CMsiRNAdb(完整数据库或仅 PCSK9 子集)
  • Shabalina 2006(补充数据)
  • Monopoli 2023(补充数据)

每个来源均可通过独立的 include_* 参数单独启用或排除,实现灵活的数据组合。

基因覆盖详情

数据集涵盖 97 个基因,每个基因的 siRNA 记录数从 3 条(如 BACE1、SNCA)到 2,756 条(PCSK9)不等,并附有对应的转录本长度(以核苷酸计)。部分基因(如 HSD17B13 有 1,985 条记录,PNPLA3 有 2,066 条记录)贡献了大量记录,而多数 Shabalina 2006 来源的基因仅有 4-21 条记录。

许可证说明

  • 代码sirna_datatests/):MIT 许可证,可自由使用、修改和商业分发
  • 数据data/raw/):不受 MIT 许可证覆盖,需遵守各原始来源的条款,其中大多数为仅限非商业用途(CC BY-NC 或 CC BY-NC-ND)

安装与使用

可通过 PyPI 安装:

bash pip install sirna-data-grabber

由于 PyPI 包不能直接包含大部分非商业数据,需使用 sirna-data-fetch 命令从原始来源重新获取数据:

bash sirna-data-fetch --dest ./my_data

核心 API

  • load_records():加载合并后的数据集记录
  • fetch_mrna_by_gene():从 NCBI 实时查找基因的 RefSeq mRNA 转录本
  • train_test_split():按基因分组的训练/测试集划分(防止同一基因跨分割)
  • leave_n_genes_out():留 N 基因交叉验证生成器

已知数据质量注意事项

  • EGFP 基因的 702 条记录映射到的 RefSeq 登录号实际为细菌基因组组装序列(~3.7 Mb),而非真实 EGFP 转录本,推测为实验室质粒污染,但靶位点仍可验证,仅转录本长度不具参考意义
  • Firefly luciferaseFireflyLuc 是同一报告基因在源数据中的两个不同字符串标签,数据集中保持独立分组
搜集汇总
数据集介绍
sirna-data-grabber 数据集图片
构建方式
sirna-data-grabber数据集的构建基于对多个公开siRNA敲低实验数据库的系统整合与标准化处理。其核心数据源包括siRNAEfficacyDB、CMsiRNAdb全库检索、Shabalina 2006及Monopoli 2023的补充数据,通过自动抓取脚本从原始来源获取原始CSV和FASTA转录本文件,并经过严格的清洗与合并流程,形成包含16,178条siRNA记录、覆盖97个基因的综合性数据集。每条记录均包含引导序列、mRNA局部窗口、实验敲低百分比及来源标注,并通过可追溯的原始数据文件与完整的出处文档确保数据的可复现性与合规性。
特点
该数据集的特点在于其精细的层次化设计与灵活的模块化加载机制。基因覆盖广泛,从常见管家基因到特定疾病靶点均有涉及,且每条siRNA记录均关联真实mRNA转录本的靶标位置,便于研究靶向效率的序列特征。数据来源可独立开关,用户可根据研究需求选择性地包含或排除特定数据库,实现定制化分析。同时,数据集内置了基于基因分组的训练/测试划分工具,有效避免数据泄漏,支持严格的模型泛化性能评估,成为siRNA敲低功效预测研究中的宝贵资源。
使用方法
使用该数据集可通过Python包sirna_data进行便捷加载。首先通过pip安装sirna-data-grabber,并执行sirna-data-fetch命令从原始源获取数据至本地目录,或直接导入预置的data/raw文件。调用load_records()函数即可读取全部记录,同时支持通过include_*参数控制数据源。数据集提供了与sklearn风格一致的train_test_split函数,默认按基因分组划分,防止基因跨集,另支持留多基因交叉验证,适用于模型评估与超参数调优。此外,fetch_mrna_by_gene接口可实时获取任意基因的RefSeq转录本,便于扩展分析。
背景与挑战
背景概述
小干扰RNA(siRNA)作为基因沉默的关键工具,在功能基因组学与疾病治疗研究中占据举足轻重的地位。然而,siRNA设计及活性预测的准确性长期受限于高质量效能数据的匮乏。在此背景下,sirna-data-grabber数据集应运而生,由致力于整合异构来源的研究人员构建,旨在系统收集并标准化已发表的siRNA敲低实验数据。该数据集迄今涵盖16,178条siRNA记录,横跨97个基因,整合了包括siRNAEfficacyDB、Shabalina 2006、Monopoli 2023及CMsiRNAdb等主要来源,每个来源均附有详细溯源与许可证明。通过提供统一的Python接口与原始文件,该数据集为机器学习模型的训练与验证奠定了坚实基础,显著推动了siRNA效能预测领域的发展,已成为相关研究不可或缺的宝贵资源。
当前挑战
该数据集所面临的挑战多维且深刻。首要挑战在于数据异构性与质量参差:不同来源的实验条件、细胞类型、转染方法及读数定义各异,直接影响标签(如敲低百分比)的可比性与可靠性。其次,数据稀疏性问题突出,尽管覆盖97个基因,但部分基因仅有少量siRNA记录,限制了模型泛化能力。此外,许可限制严谨,多数来源为非商业用途(CC BY-NC),极大束缚了数据的广泛传播与商业应用。构建过程中,数据整合需克服基因标识符不一致、转录本异构体混淆及序列错误等难题,例如EGFP基因的污染序列问题。最后,模型评估时需谨慎设计训练/测试划分,避免因同一基因的多条siRNA泄漏而高估模型性能,这一挑战在sirna-data-grabber中通过按基因划分的策略予以应对。
常用场景
经典使用场景
sirna-data-grabber作为独立的小干扰RNA(siRNA)敲低功效数据集,其核心使用场景在于为RNA干扰(RNAi)领域的计算模型提供标准化的训练与评估基准。该数据集整合了16,178条siRNA记录,覆盖97个基因,并附带完整的来源溯源与许可证文档,使得研究者能够便捷地获取多源异构的siRNA功效数据。其内置的Python包与命令行工具简化了数据加载与再获取流程,支持按基因分组的数据划分(如train_test_split与leave_n_genes_out),为开发基于序列特征的siRNA活性预测模型提供了严谨的数据基础设施,尤其适用于需要跨基因泛化能力评估的机器学习研究。
解决学术问题
该数据集针对RNAi领域长期存在的实验数据分散、格式不一、难以复现的痛点,提供了一套整合多来源(如siRNAEfficacyDB、Shabalina 2006、Monopoli 2023等)的标准化siRNA敲低功效数据,并附有详细的来源溯源与许可证合规指南,解决了学术研究中数据可获取性与可重复性不足的难题。通过提供基因分组的划分工具,它支持严格的留一基因交叉验证等评估策略,有助于避免数据泄漏,从而更可靠地衡量模型对新基因的泛化能力,推动了siRNA设计规则及其靶向效率预测的学术进展。
衍生相关工作
该数据集的构建汲取了多项前期研究成果,包括Shabalina等人(2006)对siRNA脱靶效应的系统分析、Monopoli等人(2023)关于siRNA设计优化的数据,以及CMsiRNAdb数据库的大规模检索。其数据整合策略与构建理念,与DepMap项目中的DEMETER2等基因功能筛选工具形成互补,尽管后者未被纳入,但相关评估文档反映了对功能基因组学筛选数据源的深入考量。此外,该数据集可视为对siRNAEfficacyDB(Zhang等,2024)的扩展与增强,通过汇总多来源数据并强化溯源审计,为后续开发更精准的siRNA活性预测算法、研究与siRNA功效相关的序列特征,以及建立跨数据库的数据融合标准等工作奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务