prs-sample-scores
收藏资源简介:
该数据集是“prs-sample-scores”数据集,由just-dna-seq组织发布,用于支持just-prs项目。数据集包含7个公共基因组的多基因风险评分(PRS)和目录证据,覆盖5337个PGS ID(来自PGS目录),包含62622个符合分析条件的运行时行和11816个性状摘要。数据以Parquet、JSON等格式组织,主要包含以下文件:运行时文件(如samples.parquet、runtime_results.parquet)、证据文件(如traits.parquet、papers.parquet、actionability.parquet)和集成文件(如model_analysis.parquet、trait_summaries.parquet)。提供了两个评分配置文件:grch38-wgs-pass-unrestored-v1(仅使用观察到的变异及安全解析的纯合参考缺失)和grch38-wgs-pass-restored-v1(额外将缺失的WGS位点分类为纯合参考)。祖先和百分位数基于1000基因组超级群体(AFR、AMR、EAS、EUR、SAS),每个样本选择置信度为1.0的EUR超级群体。质量指标包括匹配率(≥50%视为可用模型)和权重质量覆盖率。绝对风险基于z-score、患病率和OR/AUROC计算。数据集采用CC-BY-4.0许可证,并包含家庭样本(非独立观测)和隐私限制。提供Polars和DuckDB的加载示例。
This dataset is the prs-sample-scores dataset, published by the just-dna-seq organization to support the just-prs project. It contains polygenic risk scores (PRS) and catalog evidence for 7 public genomes, covering 5337 PGS IDs (from the PGS catalog), including 62622 runtime rows meeting analysis criteria and 11816 trait summaries. The data is organized in formats such as Parquet and JSON, mainly including the following files: runtime files (e.g., samples.parquet, runtime_results.parquet), evidence files (e.g., traits.parquet, papers.parquet, actionability.parquet), and integration files (e.g., model_analysis.parquet, trait_summaries.parquet). Two scoring configuration files are provided: grch38-wgs-pass-unrestored-v1 (only using observed variants and safely resolved homozygous reference deletions) and grch38-wgs-pass-restored-v1 (additionally classifying missing WGS sites as homozygous reference). Ancestry and percentiles are based on the 1000 Genomes super populations (AFR, AMR, EAS, EUR, SAS), with each sample selecting the EUR super population with confidence 1.0. Quality metrics include match rate (≥50% considered usable model) and weight quality coverage. Absolute risk is calculated based on z-score, prevalence, and OR/AUROC. The dataset is licensed under CC-BY-4.0 and includes family samples (non-independent observations) and privacy restrictions. Loading examples for Polars and DuckDB are provided.
数据集概述
prs-sample-scores 是一个公开的个体多基因风险评分(PRS)数据集,包含已公开基因组的个体PRS分数及目录证据,服务于 just-prs 项目。
核心统计
- 覆盖范围:7个公开基因组、5337个PGS ID、62622条可分析运行记录、11816个性状摘要
- 发布时间:2026-08-19T13:20:54.904786+00:00
- 许可证:CC-BY-4.0
数据文件结构
- 数据清单:
data/manifest.json(固定修订版本、哈希、粒度、排除规则) - 性状摘要:
data/trait_summaries.parquet(按祖源选择的可用范围中位数) - 可行动性与上下文:
data/actionability.parquet、data/trait_contexts.parquet(证据而非评分) - 模型分析:
data/model_analysis.parquet(单个样本 × PGS × 画像的详细分析) - 原始运行结果:
data/runtime_results.parquet(不跨PGS ID比较原始分数)
证据表包括:traits.parquet、score_trait_links.parquet、papers.parquet、score_paper_links.parquet、guidelines.parquet、guideline_trait_links.parquet、actionability.parquet、trait_contexts.parquet、record_search_terms.parquet。
评分画像
- grch38-wgs-pass-unrestored-v1:仅使用观察到的变异及可安全解析的纯合参考缺失
- grch38-wgs-pass-restored-v1:额外将缺失WGS位点分类为纯合参考(基于固定参考等位基因库)
恢复不是基因型插补,也不从LD推断替代等位基因。两个画像仅在各自独立汇总后,对同一样本和PGS ID进行比较。
祖源与百分位数
- 选定的百分位群体来自
sample_ancestry.parquet中样本的广泛1000G超群体;当前发布中所有验证的公开基因组均以置信度1.0选择EUR - CEU显示为“北欧/西欧”,IBS显示为“伊比利亚/西班牙”,仅为最近的1000G参考队列,不影响百分位或风险评估
model_analysis.population_metrics始终包含五个条目(AFR、AMR、EAS、EUR、SAS),不可用条目为null加原因,不虚构零值- 无可靠选定群体分布的PGS ID(如PGS000011等)保留在
model_analysis中但analysis_eligible=false,不进入摘要
质量、风险与遗传力
- 匹配率:使用的评分变异比例;权重质量覆盖:使用的绝对模型权重比例
- 可用模型:匹配率≥50%
- 绝对风险:基于选定群体z分数、固定患病率及OR/AUROC计算;风险比1代表群体平均值
- h²:群体水平SNP遗传力,非个体“遗传百分比”、因果比例或疾病概率
- 性状关联使用本体论ID,不按标签连接患病率或h²
not_assessed表示证据未建立,而非“不可行动”
隐私与使用限制
- 命名的公开基因组(Anton、Livia)有各自的源许可;匿名
o-*家族样本仅在记录的同意基础上允许发布 - 家族行非独立,不能估计遗传力、外显率、分离或临床传播
- 数据集为研究/教育工件,不构成诊断、处方或临床建议
主要表结构示例
model_analysis.parquet 主键:sample_id, pgs_id, scoring_build, score_profile_id, scoring_fingerprint,包含状态、错误、分数、匹配率、权重覆盖、祖源信息、质量标签、群体指标、性状和论文等字段。
trait_summaries.parquet 主键:sample_id, trait_id, score_profile_id, percentile_population,包含中位数百分位、可用模型数、绝对风险、遗传力文本、可行动状态、配对画像差异等字段。
加载示例
- Polars:使用
pl.read_json/pl.read_parquet加载清单和分析数据 - DuckDB:按
analysis_eligible过滤后查询百分位或风险值




