遇见数据集

prs-sample-scores

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集是“prs-sample-scores”数据集,由just-dna-seq组织发布,用于支持just-prs项目。数据集包含7个公共基因组的多基因风险评分(PRS)和目录证据,覆盖5337个PGS ID(来自PGS目录),包含62622个符合分析条件的运行时行和11816个性状摘要。数据以Parquet、JSON等格式组织,主要包含以下文件:运行时文件(如samples.parquet、runtime_results.parquet)、证据文件(如traits.parquet、papers.parquet、actionability.parquet)和集成文件(如model_analysis.parquet、trait_summaries.parquet)。提供了两个评分配置文件:grch38-wgs-pass-unrestored-v1(仅使用观察到的变异及安全解析的纯合参考缺失)和grch38-wgs-pass-restored-v1(额外将缺失的WGS位点分类为纯合参考)。祖先和百分位数基于1000基因组超级群体(AFR、AMR、EAS、EUR、SAS),每个样本选择置信度为1.0的EUR超级群体。质量指标包括匹配率(≥50%视为可用模型)和权重质量覆盖率。绝对风险基于z-score、患病率和OR/AUROC计算。数据集采用CC-BY-4.0许可证,并包含家庭样本(非独立观测)和隐私限制。提供Polars和DuckDB的加载示例。

This dataset is the prs-sample-scores dataset, published by the just-dna-seq organization to support the just-prs project. It contains polygenic risk scores (PRS) and catalog evidence for 7 public genomes, covering 5337 PGS IDs (from the PGS catalog), including 62622 runtime rows meeting analysis criteria and 11816 trait summaries. The data is organized in formats such as Parquet and JSON, mainly including the following files: runtime files (e.g., samples.parquet, runtime_results.parquet), evidence files (e.g., traits.parquet, papers.parquet, actionability.parquet), and integration files (e.g., model_analysis.parquet, trait_summaries.parquet). Two scoring configuration files are provided: grch38-wgs-pass-unrestored-v1 (only using observed variants and safely resolved homozygous reference deletions) and grch38-wgs-pass-restored-v1 (additionally classifying missing WGS sites as homozygous reference). Ancestry and percentiles are based on the 1000 Genomes super populations (AFR, AMR, EAS, EUR, SAS), with each sample selecting the EUR super population with confidence 1.0. Quality metrics include match rate (≥50% considered usable model) and weight quality coverage. Absolute risk is calculated based on z-score, prevalence, and OR/AUROC. The dataset is licensed under CC-BY-4.0 and includes family samples (non-independent observations) and privacy restrictions. Loading examples for Polars and DuckDB are provided.

创建时间:
2026-08-17
原始信息汇总

数据集概述

prs-sample-scores 是一个公开的个体多基因风险评分(PRS)数据集,包含已公开基因组的个体PRS分数及目录证据,服务于 just-prs 项目。

核心统计

  • 覆盖范围:7个公开基因组、5337个PGS ID、62622条可分析运行记录、11816个性状摘要
  • 发布时间:2026-08-19T13:20:54.904786+00:00
  • 许可证:CC-BY-4.0

数据文件结构

  • 数据清单data/manifest.json(固定修订版本、哈希、粒度、排除规则)
  • 性状摘要data/trait_summaries.parquet(按祖源选择的可用范围中位数)
  • 可行动性与上下文data/actionability.parquetdata/trait_contexts.parquet(证据而非评分)
  • 模型分析data/model_analysis.parquet(单个样本 × PGS × 画像的详细分析)
  • 原始运行结果data/runtime_results.parquet(不跨PGS ID比较原始分数)

证据表包括:traits.parquetscore_trait_links.parquetpapers.parquetscore_paper_links.parquetguidelines.parquetguideline_trait_links.parquetactionability.parquettrait_contexts.parquetrecord_search_terms.parquet

评分画像

  • grch38-wgs-pass-unrestored-v1:仅使用观察到的变异及可安全解析的纯合参考缺失
  • grch38-wgs-pass-restored-v1:额外将缺失WGS位点分类为纯合参考(基于固定参考等位基因库)

恢复不是基因型插补,也不从LD推断替代等位基因。两个画像仅在各自独立汇总后,对同一样本和PGS ID进行比较。

祖源与百分位数

  • 选定的百分位群体来自 sample_ancestry.parquet 中样本的广泛1000G超群体;当前发布中所有验证的公开基因组均以置信度1.0选择 EUR
  • CEU显示为“北欧/西欧”,IBS显示为“伊比利亚/西班牙”,仅为最近的1000G参考队列,不影响百分位或风险评估
  • model_analysis.population_metrics 始终包含五个条目(AFR、AMR、EAS、EUR、SAS),不可用条目为null加原因,不虚构零值
  • 无可靠选定群体分布的PGS ID(如PGS000011等)保留在 model_analysis 中但 analysis_eligible=false,不进入摘要

质量、风险与遗传力

  • 匹配率:使用的评分变异比例;权重质量覆盖:使用的绝对模型权重比例
  • 可用模型:匹配率≥50%
  • 绝对风险:基于选定群体z分数、固定患病率及OR/AUROC计算;风险比1代表群体平均值
  • :群体水平SNP遗传力,非个体“遗传百分比”、因果比例或疾病概率
  • 性状关联使用本体论ID,不按标签连接患病率或h²
  • not_assessed 表示证据未建立,而非“不可行动”

隐私与使用限制

  • 命名的公开基因组(Anton、Livia)有各自的源许可;匿名 o-* 家族样本仅在记录的同意基础上允许发布
  • 家族行非独立,不能估计遗传力、外显率、分离或临床传播
  • 数据集为研究/教育工件,不构成诊断、处方或临床建议

主要表结构示例

model_analysis.parquet 主键:sample_id, pgs_id, scoring_build, score_profile_id, scoring_fingerprint,包含状态、错误、分数、匹配率、权重覆盖、祖源信息、质量标签、群体指标、性状和论文等字段。

trait_summaries.parquet 主键:sample_id, trait_id, score_profile_id, percentile_population,包含中位数百分位、可用模型数、绝对风险、遗传力文本、可行动状态、配对画像差异等字段。

加载示例

  • Polars:使用 pl.read_json / pl.read_parquet 加载清单和分析数据
  • DuckDB:按 analysis_eligible 过滤后查询百分位或风险值
搜集汇总
数据集介绍
prs-sample-scores 数据集图片
构建方式
该数据集由just-dna-seq项目精心构建,旨在为公开基因组提供个体化的多基因风险评分(PRS)及其关联的目录证据。其构建过程整合了来自PGS Catalog的评分、文献、指南及表型本体等多元信息,通过严格的质量控制流程,将原始运行结果与证据分层管理,最终生成涵盖7个公开基因组、5337个PGS ID及62622条可分析运行行的综合性资源。数据采用Parquet格式存储,并辅以Java脚本及清单文件以固定版本,确保可追溯性与可复现性。
使用方法
使用者可借助Polars或DuckDB等现代数据处理工具,轻松加载并查询分析就绪的Parquet文件。推荐从ANALYSIS.md获取分析指引,深入了解特质卡片、模型分歧及家庭一致性等信息。通过过滤analysis_eligible字段,可获取可靠的百分位数与风险解读。数据集支持对特定样本、评分模型及人群进行精细的亚组分析,同时警告用户避免跨PGS ID直接比较原始分数,应正确理解百分位数的相对性,并注意家庭样本的非独立性,以谨慎得出科学结论。
背景与挑战
背景概述
prs-sample-scores数据集由just-dna-seq团队于2026年8月发布,旨在为公众基因组提供标准化的多基因风险评分(PRS)及其目录证据。该数据集整合了7个公开基因组、5337个PGS ID及超过6万条可分析运行记录,并通过细致的血缘分层、质量控制与绝对风险估计,为公民科学家和研究者提供了可复现的PRS分析框架。其核心研究问题在于如何将复杂的PRS计算与证据整合为透明、可审计且不误导用户的日常查询工具。该数据集通过引入“恢复”策略区分缺失位点,并强制要求分析资格筛选,显著提升了PRS解读的可信度,为个性化基因组学领域设立了新基准,影响深远。
当前挑战
该领域面临的首要挑战是PRS解读的多义性:原始分数不可跨PGS比较,需依赖超级群体特异百分位数,且绝对风险估计涉及不确定性,易被误用为临床诊断。构建过程中,团队需应对证据整合的复杂性,如PGS与表型的本体映射、指南与可行动性的关联,以及不同来源数据的许可与隐私约束。此外,样本量有限(仅7个公开基因组)及家族样本非独立性,限制了遗传力与传递模式的推断,而恢复策略与基因型插补的边界亦需严格区分,以免夸大结果。技术上,如何在不引入虚构零值的情况下处理缺失数据,并维持多资料表的一体化审计,也是持续挑战。
常用场景
经典使用场景
prs-sample-scores数据集为公众基因组的多基因风险评分(PRS)研究提供了一个标准化的计算与分析框架。它整合了来自PGS Catalog的5337个评分标识符,覆盖7个公共基因组,并生成超过6.2万条可供分析的运行记录。该数据集支持两种评分档案(restored与unrestored),分别对应不同的位点缺失处理策略,使得研究者能够在统一、可复现的流程下,对个体进行跨性状、跨模型的PRS分布评估,并以百分位数形式呈现结果,便于横向比较与纵向追踪。
解决学术问题
该数据集直面多基因评分研究中的关键挑战:原始评分跨模型不可比、缺乏统一的质量控制标准、以及祖先分层不明确等问题。通过引入分析资格筛选(analysis_eligible)、匹配率与权重覆盖度等质量指标,并基于1000G超级人群(AFR、AMR、EAS、EUR、SAS)计算百分位数,它确保了评分结果的相对可解释性。此外,数据集明确区分了绝对风险、风险比与遗传力等概念,避免了学术研究中常见的概念混淆,为建立稳健的PRS分析流程提供了方法论支撑。
实际应用
在实际应用中,该数据集可作为公民科学家与研究者探索自身基因组信息的可靠资源。它支持通过Polars或DuckDB等工具进行高效查询,便于用户快速获取特定样本在特定性状上的PRS百分位数、绝对风险评估及可行动性状态。此外,数据集提供的家庭一致性分析(如亲子间百分位数对比)可用于理解遗传共享的直观表现,但设计上明确提醒用户避免过度解读。其遵循CC-BY-4.0许可,并尊重个人基因组数据的隐私边界,为教育、科研及个人基因组解读服务提供了兼具开放性与伦理合规性的数据基础。
数据集最近研究
最新研究方向
该数据集聚焦于公共基因组多基因风险评分的标准化计算与透明度提升,融合了PGS Catalog的数千个评分模型与千人基因组超级种群的精细分层,在遗传流行病学领域引领着从原始评分向可解释临床风险转化的前沿浪潮。其最新研究方向在于构建一套严谨的质量控制体系,通过匹配率、权重覆盖度及绝对风险估算等核心指标,破解跨模型比较的异质性难题,并借助双评分画像的对比策略,探索基因型缺失位点的处理对风险预测稳定性的深层影响。此举不仅推动了公民科学家在个人基因组解读中的自主参与,更为精准医学中PRS的临床可操作性奠定了数据基石,促使多基因风险评分从科研工具向公共卫生应用迈出关键一步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务