遇见数据集

seqedge-data

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

seqedge-data 是一个面向基因组队列分析的开源数据集,作为交互式网络平台 GalibierHub 的官方公共数据后端。该数据集包含约 1.3 GB 的开放访问数据,采用 MIT 许可发布。数据集内容涵盖参考基因组文件(如 reference.fasta 和 annotation.gff3)、12 个样本特异性的 VCF 文件(用于变异和群体遗传学分析)、以及 12 个完整的 FASTA 文件(优化用于机器学习序列提取和启动子预测)。此外,还包含 SARS-CoV-2 参考文件(如 scov2.fa、scov2.gb 等)以及教育材料和研究生教材。数据样本来源于 FANTOM5 人类原代细胞 CAGE 数据(hg19),具体来自 FANTOM5 human.primary_cell.hCAGE 队列,使用 HeliScope CAGE 平台。该数据集适用于学术研究、生物信息学下游流程以及机器学习模型训练,特别是变体识别、序列分类和启动子预测等任务。

seqedge-data is an open-source dataset for genomic cohort analysis, serving as the official public data backend for the interactive web platform GalibierHub. The dataset contains approximately 1.3 GB of open-access data released under the MIT license. It includes reference genome files (e.g., reference.fasta and annotation.gff3), 12 sample-specific VCF files (for variant and population genetics analysis), and 12 complete FASTA files (optimized for machine learning sequence extraction and promoter prediction). Additionally, it contains SARS-CoV-2 reference files (e.g., scov2.fa, scov2.gb, etc.) as well as educational materials and graduate textbooks. The data samples originate from FANTOM5 human primary cell CAGE data (hg19), specifically from the FANTOM5 human.primary_cell.hCAGE cohort, using the HeliScope CAGE platform. This dataset is suitable for academic research, bioinformatics downstream pipelines, and machine learning model training, particularly for tasks such as variant identification, sequence classification, and promoter prediction.

创建时间:
2026-07-23
原始信息汇总

数据集概述

seqedge-dataGalibierHub 交互式基因组队列分析平台的官方公共数据后端,包含约 1.3 GB 的开放获取数据,采用 MIT 许可证发布。

数据结构

数据集按目录组织,支持传统生物信息学工作流和机器学习应用:

目录 内容
Records/Reference_Genomes/ 全局参考文件(reference.fastaannotation.gff3
Records/Variant_Calling_VCF/ 12 个样本特异性 .vcf.gz 文件
Records/ML_Ready_FASTA/ 12 个完整的 .fasta 文件,用于机器学习序列提取和启动子预测
根目录 SARS-CoV-2 参考文件(scov2.fascov2.gbscov2.genes.bedscov2.genes.gff3
Learning-Resources/ 生物信息学教育材料和参考 PDF
Graduate-student-textbooks/ 研究生水平补充教材

源数据详情

目录中的 12 个主要演示样本(如 CNhs13076、CNhs13080、CNhs13195、CNhs13216)来自公共测试文件:

  • 来源:FANTOM5 人类原代细胞 CAGE 数据(hg19)
  • 队列:FANTOM5 human.primary_cell.hCAGE
  • 平台:HeliScope CAGE
  • 项目链接:https://fantom.gsc.riken.jp/5/
  • 参考出版物:https://www.nature.com/articles/sdata2017112

使用方式

可通过 Hugging Face CLI、wgetcurl 直接下载。推荐使用 GalibierHub 下载界面,支持:

  • 自动生成 Python、SLURM 和 .bat 批量下载脚本
  • MD5 和 SHA-256 完整性校验命令
  • 从 JBrowse 2 基因组可视化界面无缝跳转到文件下载
搜集汇总
数据集介绍
seqedge-data 数据集图片
构建方式
seqedge-data数据集作为GalibierHub平台的官方公共数据后端,整合了参考基因组、变异调用VCF文件及机器学习就绪的FASTA序列等多元异构数据。其核心样本源自FANTOM5人类原代细胞CAGE测序数据(hg19),涵盖12个样本的高通量测序记录,并辅以SARS-CoV-2参考文件及教学资源,构建起一个面向基因组队列分析与生物信息学流程的综合性数据资源库。
特点
该数据集兼具学术研究与机器学习应用的双重导向,其目录结构明晰,区分了传统生信分析所需的参考文件与变异数据,以及针对序列提取和启动子预测优化的ML_Ready_FASTA格式。此外,数据集附带的完整性校验命令和自动化下载脚本生成功能,保障了数据传输的可靠性与便捷性,并嵌入基因组浏览器实现可视化访问,体现了数据服务的一体化与精细化。
使用方法
用户可通过Hugging Face CLI、wget或curl直接下载数据集文件,或借助GalibierHub下载界面自动生成Python、SLURM及.bat批处理脚本,实现递归文件夹的批量下载。同时,平台提供MD5和SHA-256完整性校验命令,确保数据在传输后的准确性。对于深度分析,用户可结合JBrowse 2基因组浏览器,从可视化界面无缝跳转至对应文件的下载链接,实现高效的科研数据获取与利用。
背景与挑战
背景概述
seqedge-data数据集由GalibierHub平台于近期创建,旨在为基因组队列分析提供开放获取的数据后端。该数据集整合了FANTOM5人类原代细胞CAGE测序数据(hg19),包含参考基因组、变异 calling VCF 文件及面向机器学习的 FASTA 序列,共计约1.3GB。其核心研究问题聚焦于促进变异识别、启动子预测及群体遗传学分析,同时支持传统生物信息学流程与机器学习应用。该数据集的发布,为学术研究提供了标准化的数据资源,加强了基因组数据共享与可重复性,对精准医学和功能基因组学领域具有重要的推动作用。
当前挑战
该数据集面临的挑战主要包括:其一,领域内变异识别与启动子预测依赖高质量参考基因组和注释,而数据集的hnRNA-seq样本仅12例,规模有限,可能影响机器学习模型的泛化能力。其二,数据集构建过程中,需处理来自FANTOM5的CAGE数据,涉及多步骤的序列比对、转录本组装及变异 calling,每一步骤均可能引入偏差或错误,需严格的质控流程。此外,数据发布涉及隐私和伦理问题,尽管当前数据为公开去标识化,但未来扩展至临床样本时,需平衡数据共享与受试者权益。数据文件的完整性验证(MD5/SHA-256)及跨平台传输的可靠性也是确保数据可用性的关键挑战。
常用场景
经典使用场景
seqedge-data数据集作为基因组学与机器学习的桥梁,其经典使用场景聚焦于变异检测与启动子预测两大核心任务。借助其精心整理的12个样本级FASTA与VCF文件,研究者可针对人类原代细胞CAGE数据开展序列特征提取、变异位点注释以及启动子活性预测等下游分析,尤为适合构建和评估基于深度学习的基因调控元件识别模型。该数据集还提供了完整的参考基因组与注释文件,便于与标准生物信息学流程无缝衔接,成为推动计算基因组学方法创新的重要基准资源。
衍生相关工作
围绕seqedge-data的架构与内容,已催生了一系列衍生工作或可预期的经典研究。基于其ML_Ready_FASTA文件,研究者开发了多种启动子预测深度模型,并在此基础上演进出了对CAGE信号峰识别的改进算法。同时,其VCF文件为群体遗传学工具的性能评测提供了标准测试集,如变异过滤策略的比较研究。此外,GalibierHub平台的社区与讨论功能,也推动了协同注释等众包型研究项目的兴起,形成了一个以数据为中心的良性学术生态。
数据集最近研究
最新研究方向
在基因组学与机器学习深度融合的前沿浪潮中,seqedge-data数据集以其独特的多层次结构,为精准医学与群体遗传学研究提供了革新性数据支撑。该数据集以FANTOM5人类原代细胞CAGE数据为基石,构建了涵盖参考基因组、变异调用VCF及机器学习就绪FASTA的完整分析链路,尤其聚焦于启动子预测与变异注释等热点任务。其与GalibierHub平台的协同设计,不仅实现了从基因组可视化到数据下载的无缝衔接,更通过标准化流程与质量校验机制,加速了从原始测序数据到生物学洞见的转化效率。此数据集的发布,有望推动可重复性生物信息学分析规范的建立,并为跨队列、跨平台的表型关联研究树立新范式,对理解基因调控网络及疾病易感性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务