plant_microbiome
收藏资源简介:
# Plant microbiome proteome corpus ## 数据集简介 本数据集是一个以植物微生物组为核心、同时包含环境对照和宿主植物参考序列的蛋白质序列语料库。它不是从蛋白数据库中随机汇总得到的独立蛋白集合,而是从经过筛选的基因组或宿主染色体出发,提取官方注释蛋白或采用统一流程预测蛋白。因此,每个蛋白组记录都可以通过 `canonical_genome_id` 追溯到对应的基因组/染色体、来源队列、生态位、宿主和质量控制信息。 数据收集的主要目标是覆盖植物相关微生物从根际土壤到植物组织内部的生态连续体,同时保留土壤、海洋和人肠道来源数据作为非植物环境参照。数据主体包括细菌、真菌和病毒,并加入少量宿主植物参考染色体蛋白,以支持植物—微生物比较、生态适应研究、蛋白表示学习、功能注释和跨模态建模。 当前仓库默认保持为**私有数据集**,直到所有组成来源的再分发条款完成逐项核验。 ## 总体规模 | 指标 | 数量 | |---|---:| | 基因组/染色体记录 | 59,135 | | 蛋白序列 | 246,090,533 | | 氨基酸残基 | 80,510,360,081 | | 压缩 FASTA 大小 | 51,473,111,351 bytes | | FASTA bundles | 7 | | 缺失蛋白组 | 0 | | 含内部终止符的蛋白 | 0 | 本发布包只包含冻结训练集合中的记录,不包含验证、测试或候选发现集合。不同基因组之间未进行全局蛋白去重,因此同源蛋白、菌株间相近蛋白和保守蛋白家族会按其原始基因组背景保留。 ## 基因组和蛋白数据的搜集来源 ### 1. 公共植物微生物组 公共植物微生物部分包含 37,494 个基因组记录、174,809,542 条蛋白和 54,013,821,939 个氨基酸残基,是本数据集的主体。 基因组候选最初依据宿主、分离来源、组织、环境介质和研究项目等元数据进行搜集。核心装配来自 NCBI Assembly/BioSample,并通过 ENA、GTDB、BioSample XML、跨数据库宿主—生态位证据和少量文献关联记录补充。候选记录随后经过 accession 归一化、RefSeq/GenBank 对应关系处理、FASTA 可用性检查、质量控制、精确序列去重和生态位证据复核。 最终进入本发布包的 37,494 条公共植物微生物记录按互斥的整合/证据路径组成如下。这些路径描述记录如何进入冻结清单,不代表可以为全部数据指定一个统一许可。 | 整合或证据路径 | 记录数 | 说明 | |---|---:|---| | NCBI core | 18,430 | 由 NCBI Assembly/BioSample 的植物宿主或植物组织/环境证据筛选得到的核心记录 | | ENA supplement | 11,475 | 利用 ENA 样本、研究和环境元数据补充的可用装配 | | Cross-source host/niche backfill | 4,261 | 合并 NCBI 与 ENA 等来源的宿主和生态位证据后恢复的记录 | | GTDB + BioSample XML rescreen | 2,480 | 结合 GTDB 候选与 BioSample XML 属性重新审核得到的记录 | | GTDB metadata supplement | 842 | 由 GTDB 分类和宿主/环境元数据补充的记录 | | PubMed-supported BioSample rescreen | 6 | 由文献关联和 BioSample 证据共同支持的补充记录 | 公共植物微生物数据包含分离培养基因组、参考基因组以及通过质量控制的 MAG。细菌蛋白主要来自 CheckM 工作流中的 Prodigal 结果;外部真菌优先使用 NCBI 官方蛋白,没有可用官方蛋白的基因组使用 GeneMark-ES 进行预测。 ### 2. 项目内部植物根系队列 三个内部队列在冻结元数据中均属于植物根系相关来源,但保留各自的来源标签,以避免把不同实验设计、类群和测序流程直接合并为一个生态位: | 来源队列 | 记录数 | 蛋白数 | 数据特征 | |---|---:|---:|---| | CRBC | 5,656 | 25,242,185 | 植物根系相关细菌,使用已有 Prodigal 蛋白 | | CRFC | 1,402 | 24,484,053 | 植物根系相关真菌,使用已有 GeneMark-ES 蛋白 | | CRVC | 6,293 | 412,922 | 植物根系相关病毒,使用已有 Prodigal 蛋白并按病毒基因组拆分 | 这些标签首先代表数据来源队列,而不是可以互换的标准化生态位标签。进行 rhizosphere、rhizoplane、endosphere 等更细粒度比较时,应回到记录级 metadata 和相应实验设计中核验。 ### 3. 非植物环境对照 为区分植物相关信号与普遍的分类学、GC 含量或环境背景信号,数据集中加入了两个明确的非植物环境参照: | 来源 | 记录数 | 蛋白数 | 用途 | |---|---:|---:|---| | MGnify human-gut species representatives | 4,626 | 10,370,331 | 人肠道微生物环境对照 | | OceanMicrobiomicsDB representative bacteria | 3,560 | 10,449,827 | 海洋细菌环境对照 | 两类数据均经过基因组质量控制和代表性选择,蛋白主要来自 CheckM/Prodigal 工作流。它们适合用于环境 OOD、植物相关性判别和表示空间分析,不应被解释为植物微生物样本。 ### 4. 宿主植物参考蛋白 发布包包含来自 10 套宿主植物参考装配的 104 条训练染色体记录,共 321,673 条蛋白。宿主标签覆盖 Arabidopsis、barrel medic、ginseng、maize、rice、soybean、wild soybean、tomato 和 wheat。 NCBI 注释和 GWH/SGN 官方注释均按“每个基因保留最长蛋白异构体”的规则整理。植物记录的单位是染色体,而不是相互独立的物种或独立基因组,因此不能直接用 104 作为宿主物种数量。 ## 生态位(Niche)组成 ### 冻结训练分层 | 训练分层 | 记录数 | 蛋白数 | 生态学含义 | |---|---:|---:|---| | Soil | 14,490 | 57,012,319 | 土壤来源微生物;作为植物根系邻近环境及背景土壤层 | | Other plant | 10,619 | 48,398,897 | 叶、茎、种子、花、果实、植物内生及泛植物来源 | | Root/Rhizosphere | 9,249 | 47,442,339 | 明确标注为 root 或 rhizosphere 的公共基因组 | | CRVC | 6,293 | 412,922 | 内部植物根系病毒队列 | | CRBC | 5,656 | 25,242,185 | 内部植物根系细菌队列 | | Human gut | 4,626 | 10,370,331 | 非植物人肠道对照 | | Ocean | 3,560 | 10,449,827 | 非植物海洋对照 | | Other root | 3,136 | 21,955,987 | 根瘤、块茎、根茎和菌根等地下植物生态位 | | CRFC | 1,402 | 24,484,053 | 内部植物根系真菌队列 | | Host plant | 104 | 321,673 | 宿主植物参考染色体蛋白 | ### 公共植物微生物的细分 Niche 公共植物微生物记录使用以下细分标签: - 根与根际:Rhizosphere 5,081;Root 4,168。 - 特殊地下组织:Nodule 2,979;Tuber 148;Rhizome 6;Mycorrhiza 3。 - 地上与泛植物来源:Leaf 5,056;Plant microbiome/general 3,155;Plant unspecified 999;Seed 504;Stem 373;Fruit 206;Endophyte 161;Flower 121;Shoot 44。 - 土壤背景:Soil 14,490。 这些 Niche 来自宿主字段、isolation source、组织、environmental biome/feature/material、BioSample 属性以及项目级证据的综合归一化。标签精度受原始公共元数据完整度限制;“Plant microbiome/general”和“Plant unspecified”表示有植物相关证据,但不能可靠细分到具体植物部位。 ## 生物类群组成 | 类群 | 记录数 | 蛋白数 | 氨基酸残基 | |---|---:|---:|---:| | Bacteria | 51,164 | 218,477,259 | 67,444,972,887 | | Fungi | 1,574 | 26,878,679 | 12,843,569,936 | | Virus | 6,293 | 412,922 | 88,598,288 | | Plant | 104 | 321,673 | 133,218,970 | 按记录数、蛋白数和氨基酸数观察组成会得到不同结论:真菌记录较少,但单个基因组通常包含更多且更长的蛋白;病毒记录较多,但单个病毒基因组贡献的蛋白和氨基酸较少。因此,训练或抽样时不应只依据基因组记录数决定各类群权重。 ## 蛋白序列生成与质量控制 本发布包综合使用以下蛋白来源: - CheckM 工作流中的 Prodigal 预测蛋白; - 内部细菌和病毒队列已有的 Prodigal 蛋白; - 内部真菌已有的 GeneMark-ES 蛋白; - 外部真菌的 NCBI 官方注释蛋白或 GeneMark-ES 预测蛋白; - 宿主植物的 NCBI、SGN ITAG4.0 和 GWH 官方注释,并按基因保留最长异构体。 每个蛋白组均完成序列字符、内部终止符、蛋白长度、文件大小和 SHA256 检查。蛋白 ID 统一为 `<canonical_genome_id>|pNNNNNNN`。当前标准化结果中缺失蛋白组、内部终止蛋白和非法残基均为 0。 ## 文件结构 - `bundles/*.faa.gz`:7 个拼接 gzip FASTA bundle。 - `bundles/bundle_manifest.tsv`:各 bundle 的记录数、蛋白数、文件大小和 SHA256。 - `metadata/proteome_metadata.tsv`:59,135 条记录级可移植 metadata。 - `metadata/bundle_members.tsv`:每个蛋白组在拼接 bundle 中的 member 序号、字节偏移、压缩长度和 SHA256。 - `metadata/*_composition.tsv`:来源、生态位、类群和蛋白生成方式的汇总表。 - `reports/`:数据构建、组成和发布前检查报告。 - `checksums.sha256`:发布包完整性校验清单。 七个 FASTA bundle 与审计通过的源数据逐字节一致。发布 metadata 已移除本地绝对路径,但保留 accession、来源、生态位、宿主、蛋白数量、序列长度统计和校验和等可追溯字段。 ## 推荐用途 - 植物微生物组蛋白语言模型训练或持续训练; - 细菌、真菌和病毒蛋白表示学习与比较; - root/rhizosphere、soil、plant aerial、ocean 和 human gut 等环境对比; - 蛋白功能注释、远缘同源检索和基因组上下文分析; - DNA—蛋白跨模态对齐和生态功能区域研究; - 宿主植物与相关微生物蛋白的比较分析。 ## 使用限制 - 仓库内全部记录均属于训练集合,不能直接作为独立验证集或最终测试集。 - 不同基因组之间未进行全局蛋白去重;构建严格评估集时应执行 protein-family 或 sequence-identity 分组。 - 公共来源的宿主字段仍存在缺失、同义词和粒度不一致;严格宿主预测前需要进一步标准化。 - 内部队列名称表示来源,不应在缺少实验 metadata 的情况下直接当作标准生态位类别。 - 不同类群使用的蛋白注释/预测工具并不完全相同,跨类群比较时需考虑注释流程带来的批次效应。 - 数据集混合了公共来源和项目内部资产。在完成逐来源许可审核前,请保持仓库私有;`license: other` 不代表所有组成数据共享同一种宽松许可。



