遇见数据集

my_personal_dna_results

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集是个人DNA祖先结果存档,仅供教育目的使用。数据包含Global25 (G25)主成分分析坐标(缩放和原始值,25个主成分)、GEDmatch多个计算器(MDLP、Eurogenes、Decoded、HarappaWorld、puntDNAL、Gedrosia)的混合分析结果,以及IllustrativeDNA历史时期分解。数据以Parquet格式存储,分为三个子集:g25(G25坐标,含样本名称、类型、PC1-PC25字段)、admixture(186行混合百分比,含工具、计算器、排名、种群、百分比字段)、population_shares(760行种群共享,含工具、计算器、模式、排名、主种群、百分比、次种群、距离等字段)。此外,还提供CSV格式的坐标和Markdown格式的详细结果报告。数据集可用于遗传计算器演示、G25建模、PCA可视化和祖先成分分析。

This dataset is an archive of personal DNA ancestry results for educational purposes only. It includes Global25 (G25) principal component analysis coordinates (scaled and raw values, 25 principal components), admixture results from multiple GEDmatch calculators (MDLP, Eurogenes, Decoded, HarappaWorld, puntDNAL, Gedrosia), and IllustrativeDNA historical period breakdowns. The data is stored in Parquet format, divided into three subsets: g25 (G25 coordinates with fields for sample name, type, PC1-PC25), admixture (186 rows of admixture percentages with fields for tool, calculator, rank, population, percentage), and population_shares (760 rows of population shares with fields for tool, calculator, mode, rank, main population, percentage, subpopulation, distance). Additionally, CSV-formatted coordinates and Markdown-formatted detailed result reports are provided. The dataset can be used for genetic calculator demonstrations, G25 modeling, PCA visualization, and ancestry component analysis.

创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集为个人DNA祖先结果存档,主要用于教育和研究目的,涵盖多种基因分析工具的输出结果。

核心内容

数据集包含三类机器可读文件(Parquet格式),以及对应的Markdown格式结果:

  1. G25坐标data/g25_coordinates.parquet):包含25个主成分(PC1–PC25)的PCA坐标,分为scaled(推荐用于建模)和raw两种类型。样本名为umay_samli,可直接用于Vahaduo、nMonte等标准G25工具。

  2. 混合物结果data/admixture_results.parquet,186行):汇总所有19个计算器的“Admix Results”表格,字段包括tool(来源工具)、calculator(计算器名称)、rankpopulation(种群成分)和percent(估计百分比)。示例:HarappaWorld计算器将Caucasian排在第一位(35.18%),Baloch次之(17.62%)。

  3. 种群共享data/population_shares.parquet,760行):包含每个计算器的“Single Population Sharing”和“Mixed Mode Population Sharing”表格,字段包括mode(single或mixed)、primary_populationprimary_percentsecondary_populationsecondary_percentdistance。示例:Decoded K7b计算器中,56.2% Turkmens + 43.8% Ashkenazy Jews,距离为2.92。

覆盖的计算工具

工具 包含计算器
MDLP K11 Modern、K16 Modern、K23b、World-22、World
Eurogenes K13、EUtest V2 K15、ANE K7、K9b–K12b、K36、HG vs Farmer、Jtest、EU Test
Decoded V3、World 9、K7b、K12b
HarappaWorld 全部
puntDNAL K10 Ancient、K12 Ancient/Modern、K13 Global、K15
Gedrosia K3、K12、Ancient Eurasia K6
IllustrativeDNA 坐标及历史时期拟合(青铜时代、铁器时代、晚古、中世纪等)

其他资源

  • PCA图:包含现代种群和历史时期(如奥斯曼安纳托利亚、罗马/拜占庭安纳托利亚、克里米亚鞑靼等)的PCA图。
  • 原始笔记raw_notes.md保留未经编辑的原始记录。
  • 视频:数据集页面提供深入解析视频链接(YouTube)。

许可与说明

  • 许可证:CC BY 4.0
  • 来源工具:GEDmatch计算器、Global25、IllustrativeDNA
  • 声明:该数据集为个人数据存档,用于教育目的;混合物计算器结果为统计估计,不构成临床或家谱证据。
搜集汇总
数据集介绍
my_personal_dna_results 数据集图片
构建方式
该数据集以个人DNA祖源分析为核心,系统整合了Global25(G25)主成分分析坐标、GEDmatch多种计算器的祖源成分结果及IllustrativeDNA历史时期断代数据。构建过程遵循机器可读与人类可读的双重标准,将G25坐标(25个主成分)、19个计算器的186条祖源成分记录及760条群体共享记录分别存储为Parquet格式,并辅以CSV与Markdown格式的冗余副本,确保数据的可移植性与可追溯性。原始笔记的保留进一步增强了数据集的溯源完整性。
特点
该数据集具有高度的结构化与多维度特征,涵盖了从全球参考群体PCA坐标到个体祖源成分的精细解析,既有G25高维坐标可供定量建模,又包含多种计算器的定性比较。数据整理规范,字段设计清晰(如工具、计算器、排名、群体、百分比等),便于直接调用。其个人化属性与跨工具整合的特色,为遗传学教育、算法验证及群体遗传学研究提供了不可多得的微观样本。
使用方法
数据集的使用方法灵活多样,既可直接加载Parquet文件进行程序化分析,也可通过Hugging Face内置查看器快速浏览各配置(g25、admixture、population_shares)。G25坐标可无缝对接Vahaduo、nMonte等标准工具进行PCA建模与距离计算。祖源成分与群体共享数据则可利用Pandas等工具进行筛选、排序与可视化,以验证不同计算器间的结果一致性。该数据集尤宜用于遗传系谱学教学示范、祖源推断算法的对比研究以及个人基因组数据开放共享的伦理探讨。
背景与挑战
背景概述
该数据集《My Personal DNA Results》由一位个人研究者于近期创建,旨在通过公开个人基因组数据,展示现代遗传学在祖源分析中的应用。数据集整合了Global25(G25)主成分分析坐标、GEDmatch多种计算器(如MDLP、Eurogenes等)的混合分析结果,以及IllustrativeDNA的时期断代数据,为遗传学、人类学和群体遗传学领域提供了珍贵的个人级参考样本。研究核心问题聚焦于如何利用公开工具解析个体遗传混合成分,并揭示其与历史种群迁移和地理分布的联系。该数据集的发布对群体遗传学教育和个性化祖源研究具有示范意义,促进了遗传数据共享和跨学科交流。
当前挑战
该数据集面临的挑战首先在于领域问题:遗传祖源分析依赖统计模型,其混合比例计算受参考种群选择、算法假设和样本偏差影响,结果存在不确定性和误差;同时,个体数据的隐私保护和伦理使用问题不容忽视,需确保匿名化和合规共享。构建过程中,数据整合难度尤甚,需协调多个工具(如GLOBAL25、GEDmatch)的输出格式、坐标系统及分型标准,确保数据一致性和可比性。此外,不同计算器对同一份DNA数据的解释可能相互矛盾,如何权衡和标注这些分歧,以及保证数据质量、完整性和可复现性,构成显著挑战。
常用场景
经典使用场景
该数据集以个人基因组数据为核心,集成了Global25主成分坐标、GEDmatch多种族源计算器结果以及IllustrativeDNA历史时期成分分析,构成了一个多维度的遗传信息档案。其经典使用场景在于群体遗传学与计算生物学领域,研究者可借助G25坐标进行主成分分析(PCA)投影,将个体样本映射至全球现代与古代人群的遗传空间中,从而直观评估其遗传亲缘关系。此外,该数据集提供的多种族源计算器输出(如MDLP、Eurogenes、HarappaWorld等)支持了基于最大似然或贝叶斯框架的祖源成分推断,为探索个体层面的遗传混合模式提供了标准化的数据基础。
解决学术问题
该数据集有效回应了遗传学研究中个体遗传结构与群体历史重建的若干关键问题。其一,它缓解了单一祖源计算器结果不一致的难题,通过整合19种独立计算器的输出,研究者能够交叉验证祖源推断的鲁棒性,并比较不同算法(如K-means聚类、主成分分析)在分辨率上的异同。其二,G25坐标的标准化格式支持与公开参考面板(如人类起源阵列)进行直接比对,助力于解析细粒度的遗传漂变与基因流事件。其三,IllustrativeDNA的历史时期分解为探究个体基因组中古代DNA的留存信号提供了契机,使古代迁徙与混血时间的估算成为可能,从而推动了历史人口学与分子人类学的交叉研究。
衍生相关工作
该数据集的发布催生了若干衍生研究方向。基于G25坐标,研究者可构建个体专属的遗传向量,并用以改进现有的nMonte模拟工具,实现更精细的混合比例反演,此类工作已延伸至表型预测与法医地理溯源领域。GEDmatch多计算器结果的整合模式,启发了开发统一祖源推断框架的研究,旨在通过元分析降低单一算法的偏差,相关成果可类比于群体遗传学中的集成学习方法。此外,IllustrativeDNA的历史时期成分数据被用于验证古代DNA时间序列中的连续性假设,推动了现代个体与古DNA样本(如青铜时代、铁器时代人群)之间的亲和力建模,此类比较工作已出现于讨论安纳托利亚遗传连续性的文献中。该数据集还常被用作教学型数据集,衍生出用于数据可视化竞赛与个性化基因组学工具的原型作品。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务