遇见数据集

nosZ Clade Reference Database

收藏
github2026-06-24 更新2026-06-26 收录
官方服务:

资源简介:

一个全面的参考数据库,用于检测和系统发育分类属于分支I、II和III的氧化亚氮还原酶(nosZ)序列。该数据库包含11,747条经过筛选的NosZ蛋白序列,包括5,332条分支I序列、6,319条分支II序列和96条分支III序列。

A comprehensive reference database for detecting and phylogenetically classifying nitrous oxide reductase (nosZ) sequences belonging to clades I, II, and III. This database contains 11,747 curated NosZ protein sequences, including 5,332 clade I sequences, 6,319 clade II sequences, and 96 clade III sequences.

创建时间:
2026-06-24
原始信息汇总

数据集概述

数据集名称: nosZ Clade Reference Database

数据集地址: https://github.com/ZhenruiZhao/nosZ_clade_reference_database

数据集版本: v1.0.0

发布日期: 2026-06-24

数据集核心内容

该数据库是一个用于检测和系统发育分类氧化亚氮还原酶(nosZ)序列的综合参考数据库,覆盖三个进化分支(Clade I、Clade II、Clade III)。

  • 序列总数: 11,747 条经过筛选的 NosZ 蛋白质序列
    • Clade I 序列: 5,332 条
    • Clade II 序列: 6,319 条
    • Clade III 序列: 96 条

数据库文件内容

仓库包含以下文件/资源:

  • 全面的 nosZ 参考蛋白质序列
  • 多序列比对(Multiple-sequence alignment)
  • 参考系统发育树
  • 序列分支注释
  • 隐马尔可夫模型(HMM)和 DIAMOND 搜索数据库
  • 即用型 GraftM 包
  • 用于 reads、contig 和 MAG 级别分析的示例脚本

主要使用方法

该数据库推荐使用 GraftM 工具进行序列识别和分类。根据输入数据类型,工作流程如下:

输入数据类型 输入格式 GraftM 输入类型 推荐工作流程
双端测序 reads FASTQ/FASTQ.GZ nucleotide 直接分析双端 reads
单端 reads FASTQ/FASTQ.GZ nucleotide 直接分析 reads
宏基因组 contigs FASTA nucleotide 可直接分析
宏基因组 contigs 预测的 FAA aminoacid 推荐使用
MAG contigs FASTA nucleotide 可直接分析
MAG 蛋白质 预测的 FAA aminoacid 推荐使用
分离株基因组蛋白质 FAA aminoacid 推荐使用

输出文件

每个样本的分析结果存储在独立的 GraftM 输出目录中。输出目录通常包含:

  • 匹配 nosZ 参考包的序列
  • 分类或分支分配结果
  • 系统发育定位结果
  • 搜索和分类中间文件
  • 运行日志

注释与计数

  • 序列计数应标准化为每百万 reads 数(RPM)用于 reads 水平的比较。
  • 对于 contig 或 MAG 水平分析,通常报告 nosZ 的存在/缺失、基因数量、分支分配以及 MAG 的分类身份。

引用

使用该数据库时,请引用:

  • GraftM 软件: Boyd JA, Woodcroft BJ, Tyson GW. Nucleic Acids Research. 2018;46(10):e59.
  • 关联的 nosZ 数据库出版物(更新中)

联系信息

  • 维护者: Zhenrui Zhao
  • 邮箱: zhaozhr@mail2.sysu.edu.cn
  • 所属机构: 南方海洋科学与工程广东省实验室(珠海)海洋合成生态学研究中心,中山大学海洋科学学院
  • 问题反馈: 通过 GitHub Issues 提交
搜集汇总
数据集介绍
nosZ Clade Reference Database 数据集图片
构建方式
在微生物氮循环研究领域中,氧化亚氮还原酶(NosZ)是驱动温室气体一氧化二氮转化为无害氮气的关键酶类。为系统解析nosZ基因的多样性和进化关系,本研究构建了涵盖三个进化枝的综合参考数据库。该数据库基于对公共序列数据库中已发表和未发表的NosZ蛋白序列进行严格筛选与人工校验,最终整合了11,747条高质量序列,其中Clade I占5,332条、Clade II占6,319条、Clade III占96条。通过多序列比对构建参考系统发育树,并基于序列相似性与系统发育信号为每条序列精确标注进化枝归属。在此基础上,分别生成隐马尔可夫模型(HMM)和DIAMOND格式的搜索数据库,并将所有数据封装为即用型GraftM软件包,支持从宏基因组中高效鉴定和分类nosZ基因。
使用方法
用户可通过标准Git命令克隆仓库获取数据库软件包,并建议在独立Conda环境中安装GraftM以确保依赖关系兼容。对于不同类型输入数据,数据库提供了阶梯式分析方案:双端宏基因组测序读段可直接以核苷酸模式分析;组装的叠连群和宏基因组组装基因组(MAG)既支持直接核苷酸分析,更推荐先用Prodigal进行蛋白质预测后再以氨基酸模式搜索,后者能显著提高远程同源序列的检测能力。每个样本需指定独立的输出目录,通过--evalue参数设置1e-5的显著性阈值,利用--threads参数并行计算加速。结果输出目录包含匹配序列、进化枝分配及系统发育位置信息,最终可通过内附脚本统计各进化枝序列数,并依据每个百万读段中的序列数(RPM)进行样本间丰度标准化,为不同环境样品间的nosZ基因比较提供量化基础。
背景与挑战
背景概述
氧化亚氮(N₂O)作为强效温室气体,其微生物还原过程主要由nosZ基因编码的氧化亚氮还原酶驱动。然而,传统研究中nosZ基因的检测与分类常局限于单一分支,难以全面反映环境微生物群落中该基因的多样性与生态功能。为突破这一瓶颈,中山大学海洋科学学院马丽华课题组与南方海洋科学与工程广东省实验室的赵振睿等人于2026年创建了nosZ Clade Reference Database。该数据库整合了11,747条经过精细筛选的NosZ蛋白序列,涵盖三大分支(Clade I、II和III),并配套提供GraftM软件包,实现了从宏基因组数据中高效、准确地识别与分类nosZ基因。这一开源资源为探究N₂O还原微生物的生态分布、进化关系及全球氮循环调控机制提供了权威参考数据,显著推动了环境微生物组学研究。
当前挑战
该数据库构建面临的核心挑战在于解决nosZ基因在复杂环境样品中被低估或误分类的领域难题,特别是传统引物对非典型分支(如Clade II)的扩增偏好性导致Clade III等稀有分支难以捕获。数据构建过程中,首先需从海量公共序列中甄别出完整且功能保守的NosZ序列,剔除假基因与片段化序列,这需跨数据库(如NCBI、IMG/M)进行同源性搜索与手动校验。其次,Clade III序列高度保守且数量稀少(仅96条),给多序列比对与隐马尔可夫模型训练带来统计偏差风险。此外,不同分支间的序列相似性较低,需通过构建最大似然系统发育树并迭代优化分类阈值,方可确保各分支注释的可靠性。整合GraftM流程时,还需平衡搜索灵敏度与计算效率,针对宏基因组读段、基因组草图及预测蛋白等多种输入类型设计差异化分析参数,这要求对大量测试样本进行反复调试以验证准确率。
常用场景
经典使用场景
在微生物生态学与地球化学循环研究中,氧化亚氮还原酶(NosZ)作为反硝化途径末端的关键酶,其编码基因nosZ的检测与分类是评估微生物群落N₂O还原潜力的核心手段。nosZ Clade Reference Database为宏基因组学研究提供了全面且经过精心筛选的参考序列集合,涵盖I、II、III三个分支的11,747条NosZ蛋白序列。该数据库最经典的使用场景包括从双端宏基因组测序读段、拼接的宏基因组重叠群、宏基因组组装基因组(MAG)以及预测蛋白序列中高效识别和系统发育分类nosZ基因。通过配套的GraftM软件包,研究人员能够以核苷酸或氨基酸序列为输入,利用隐马尔可夫模型或DIAMOND搜索策略,对海量环境样本中的nosZ序列进行高灵敏度的检测和分支归属判定,从而揭示不同生态系统中N₂O还原菌群的组成与分布格局。
解决学术问题
该数据库系统性地解决了环境微生物组研究中nosZ基因检测准确性与分类粒度不足这一长期困扰学界的难题。传统方法因缺乏广泛覆盖的参考数据集,常导致对nosZ序列的检出率偏低,尤其难以有效区分功能与结构各异的clade I、II及新近发现的clade III分支。通过整合11,747条经过人工校验的序列并构建高分辨率的系统发育框架,该数据库使研究者能够精准评估反硝化微生物群落对强效温室气体N₂O的还原能力。其关键学术贡献在于为解析N₂O排放热点与冷点区域的微生物学机制提供了可靠的工具,推动了从土壤、海洋到污水处理系统等生态系统N₂O通量调控机理的认识深入,并促进了全球变化背景下微生物源N₂O减排策略的理论基础构建。
实际应用
在实际环境监测与生物工程领域,该数据库展现出广泛的应用价值。在污水处理厂和农业土壤改良场景中,通过追踪nosZ分支的丰度变化,可实时评估反硝化菌群的N₂O减排效率,为优化脱氮工艺参数提供微生物学依据。在海洋与淡水生态系统健康评价中,利用该数据库分析沉积物或水柱宏基因组数据,能够揭示富营养化区域N₂O释放风险的微生物学指标。尤为重要的是,该数据库支持从低生物量样本(如深海热液、极地冰芯)的宏转录组数据中检测nosZ表达活性,使研究人员能够直接评估极端环境下微生物N₂O代谢的实时功能状态。此外,在合成生物学菌株改造中,该数据库为设计高效N₂O还原工程菌提供了明确的序列模板与分支分类指南。
数据集最近研究
最新研究方向
在全球气候变化与温室气体减排的紧迫背景下,氧化亚氮(N₂O)作为强效温室气体和臭氧层破坏物质,其微生物消减机制成为生态与环境微生物组研究的前沿热点。该数据库聚焦于编码氧化亚氮还原酶(NosZ)的序列,创新性地整合了三大分支(Clade I、II、III)共计11,747条精心筛选的蛋白质序列,并以GraftM工具包形式提供了从宏基因组读段、拼接片段到宏基因组组装基因组(MAGs)的多层级分析流程。这一资源极大推动了N₂O还原菌群在自然生态系统与人工生物反应器中的高通量检测与系统发育精准分类,为解析不同分支NosZ的生态位分化、功能冗余及环境响应机制奠定了方法论基础。该数据库的发布,不仅强化了基于序列的N₂O减排潜力评估能力,更为后续耦合宏转录组与稳定同位素探针技术的微观生态网络研究提供了可靠参考框架,对指导农田氮素管理与污水处理厂温室气体控制具有实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务