遇见数据集

Global SARS-CoV-2 Proteome Mutation Burden Atlas Derived From 103 Million Amino Acid Sequences Covering S, N, M, E, ORF1a, ORF1b, ORF3a, ORF6, ORF7a, ORF7b, and ORF8 Proteins Spanning 2020 to Q3-2025

收藏
Figshare2025-11-19 更新2026-04-28 收录
官方服务:

资源简介:

This dataset presents the largest known per-protein amino acid mutation burden analysis of SARS-CoV-2 to date, encompassing 103,378,188 high-quality translated sequences from global surveillance.For each of the 11 canonical SARS-CoV-2 proteins (structural, replicase, and accessory), we provide:Per-sequence mutation burden vs. Wuhan-Hu-1 referenceYear-stratified evolutionary statistics (where metadata available)Chunked, analysis-ready records in JSON.zst and TSV.zst formatsSARS-CoV-2 Mutation Burden Summary ==================================================S: 9398268 seqs, mean burden = 113.66N: 9397174 seqs, mean burden = 37.83M: 9398092 seqs, mean burden = 12.10E: 9398041 seqs, mean burden = 2.24ORF1a: 9398286 seqs, mean burden = 178.16ORF1b: 9398287 seqs, mean burden = 6940.96ORF3a: 9398086 seqs, mean burden = 5.92ORF6: 9397993 seqs, mean burden = 1.04ORF7a: 9397998 seqs, mean burden = 7.06ORF7b: 9397956 seqs, mean burden = 2.47ORF8: 9397712 seqs, mean burden = 4.93Note:ORF1b burden reflects alignment artifact due to frameshift-dependent expression; values not biologically comparable to other genes.Total Sequences: 103,378,188Please properly cite this dataset if you use it. This dataset is for my upcoming journal article. Also that, earlier i started this processing for 2025 but expanded to contain 2020 up to 2025 so even tough a few folders contain label 2025 but all has coverage span from 2020 up to quarter 3 of 2025 Study & Data Processed by: TahirHB@Hotmail.Com

本数据集为目前已知规模最大的新冠病毒(SARS-CoV-2)单蛋白氨基酸突变负荷分析数据集,涵盖来自全球监测的103,378,188条高质量翻译序列。针对11种经典新冠病毒蛋白(结构蛋白、复制酶蛋白及辅助蛋白),我们提供以下内容:每条序列与武汉-Hu-1参考株(Wuhan-Hu-1)的突变负荷对比;按年份分层的进化统计数据(若具备对应元数据);分块且可直接用于分析的JSON.zst与TSV.zst格式数据集文件。 新冠病毒突变负荷统计摘要================================================== 刺突蛋白(S):9398268条序列,平均突变负荷为113.66 核衣壳蛋白(N):9397174条序列,平均突变负荷为37.83 膜蛋白(M):9398092条序列,平均突变负荷为12.10 包膜蛋白(E):9398041条序列,平均突变负荷为2.24 开放阅读框1a(ORF1a):9398286条序列,平均突变负荷为178.16 开放阅读框1b(ORF1b):9398287条序列,平均突变负荷为6940.96 开放阅读框3a(ORF3a):9398086条序列,平均突变负荷为5.92 开放阅读框6(ORF6):9397993条序列,平均突变负荷为1.04 开放阅读框7a(ORF7a):9397998条序列,平均突变负荷为7.06 开放阅读框7b(ORF7b):9397956条序列,平均突变负荷为2.47 开放阅读框8(ORF8):9397712条序列,平均突变负荷为4.93 注意: 开放阅读框1b(ORF1b)的突变负荷数值源于移码依赖型表达导致的比对偏差,其数值与其他基因不具备生物学可比性。 总序列数:103,378,188 若您使用本数据集,请务必进行恰当引用。本数据集将用于我即将发表的期刊论文。此外,我最初于2025年启动该数据集的处理工作,后续将覆盖范围扩展至2020年至2025年——尽管部分文件夹标注为2025,但所有数据的实际覆盖时段均为2020年至2025年第三季度。 本研究与数据集处理由 TahirHB@Hotmail.Com 完成。

创建时间:
2025-11-19
二维码
社区交流群
二维码
科研交流群
商业服务