遇见数据集

Database of virus genomes from ultra-deep sequencing of wastewater (WVDB)

收藏
Zenodo2026-05-19 更新2026-05-26 收录
官方服务:

资源简介:

A virus genome database representing 21,015 near-complete virus genomes collected from untargeted ultra-deep RNA/DNA combined sequencing of wastewater. Sequence data was provided by the CASPER consortium and raw data may be found on NCBI SRA under bioprojects PRJNA1247874 and PRJNA1198001. Data underwent read trimming, rRNA and human read removal, de novo assembly, and selection of high-quality viral contigs. Contigs were clustered at 95% identity and 85% query coverage to dereplicate. Chimera-checking required at least two independent assemblies of the same viral genome or presence of the genome in another reference database. Annotation made use of RdRpCATCH, geNomad, checkV, BLASTN against NCBI core-nt, and RNAVirHost. The RdRp fasta files contain representative RdRp sequences identified through homology to major RdRp reference databases and clustered at 90% sequence identity over 75% sequence coverage. Included sequences contain all three conserved RdRp motifs (A, B, and C) arranged in either the canonical ABC configuration or the permuted CAB configuration.

本病毒基因组数据库收录了21015条近乎完整的病毒基因组,这些基因组源自对污水开展的非靶向超深度RNA/DNA联合测序。序列数据由CASPER联盟提供,原始数据可在国家生物技术信息中心(National Center for Biotechnology Information, NCBI)的序列读取档案(Sequence Read Archive, SRA)中获取,对应的生物项目编号为PRJNA1247874与PRJNA1198001。 数据处理流程涵盖读段修剪、核糖体RNA(ribosomal RNA, rRNA)及人类宿主读段过滤、从头组装以及高质量病毒重叠群(contig)筛选步骤。为实现去冗余,重叠群按照95%序列一致性与85%查询覆盖度进行聚类。嵌合序列检测需满足以下任一条件:同一病毒基因组至少存在两份独立组装结果,或该基因组可在另一参考数据库中被检出。注释流程采用了RdRpCATCH、geNomad、checkV、针对NCBI核心核苷酸数据库(NCBI core-nt)的BLASTN比对以及RNAVirHost工具。 RNA依赖的RNA聚合酶(RNA-dependent RNA polymerase, RdRp)FASTA文件包含通过与主流RdRp参考数据库同源性比对鉴定得到的代表性RdRp序列,这些序列按照90%序列一致性与75%序列覆盖度完成聚类。收录的序列均包含A、B、C三个保守的RdRp结构基序,其排列方式可为经典的ABC构型或重排后的CAB构型。

提供机构:
Zenodo
创建时间:
2026-05-18
二维码
社区交流群
二维码
科研交流群
商业服务