遇见数据集

rareburden-commons-open-source-snapshots

收藏
Hugging Face2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

RareBurden Commons开源快照数据集是一个公开的、可再分发的数据集合,旨在为罕见病负担研究提供稳定的公共数据源。该快照包含多个精确绑定哈希值的源文件,每个文件均采用允许再分发的许可条款。具体内容包括:Orphadata 2026年7月版的关联与流行病学文件(CC BY 4.0)、Mondo v2026-08-04本体构件(CC BY 4.0)、联合国世界人口展望2024年人口指标工作簿(CC BY 3.0 IGO,不含第三方分类)、以及世界银行指标API的有限响应(CC BY 4.0)。数据集附带一个notices/目录,提供各来源的归属、范围和不背书声明,以及SHA256SUMS校验和文件以确保完整性。需要强调的是,该快照不包含WHO全球健康估计、HPO待定条款数据、PanelApp、UMLS、OMIM、SNOMED CT、受控环境数据或其他缺乏明确再分发证据的来源。该数据集本身不激活RareBurden估计量,也不做出任何临床、诊断、完整性、代表性或背书声明。

The RareBurden Commons Open Source Snapshot Dataset is a publicly available, redistributable data collection aimed at providing a stable public data source for rare disease burden research. The snapshot contains multiple source files with precise hash bindings, each licensed under permissive redistribution terms. Specific contents include: Orphadata July 2026 release association and epidemiology files (CC BY 4.0), Mondo v2026-08-04 ontology components (CC BY 4.0), United Nations World Population Prospects 2024 population indicators workbook (CC BY 3.0 IGO, excluding third-party classifications), and limited responses from the World Bank Indicators API (CC BY 4.0). The dataset includes a notices/ directory providing attribution, scope, and non-endorsement statements for each source, as well as a SHA256SUMS checksum file for integrity. It is emphasized that the snapshot does not contain WHO Global Health Estimates, HPO pending terms data, PanelApp, UMLS, OMIM, SNOMED CT, controlled environment data, or other sources lacking clear redistribution evidence. The dataset itself does not activate RareBurden estimators and makes no clinical, diagnostic, completeness, representativeness, or endorsement claims.

创建时间:
2026-08-15
原始信息汇总

数据集概述:RareBurden Commons 开源快照

基本信息

  • 数据集名称:RareBurden Commons Open Source Snapshots
  • 数据集页面:https://huggingface.co/datasets/edithatogo/rareburden-commons-open-source-snapshots
  • 许可证other(因集合包含多种独立许可证,未使用统一许可证)
  • 任务类别:其他(other

标签

  • 罕见疾病(rare-disease)
  • 本体论(ontology)
  • 公共卫生(public-health)
  • 人口统计学(population)

内容构成

该数据集为公开的保存投影,包含经过哈希绑定的原始源文件,所有源文件均已确认允许再分发。具体包含以下内容:

  1. Orphadata 2026年7月对齐与流行病学文件(许可证:CC BY 4.0)
  2. Mondo v2026-08-04 制品(许可证:CC BY 4.0)
  3. 联合国世界人口展望2024年人口指标工作簿(许可证:CC BY 3.0 IGO,排除第三方分类)
  4. 受限的世界银行指标API响应(许可证:CC BY 4.0,作为探针保留,不替代WPP)

附加文件

  • notices/ 目录:包含各源文件的归属、范围及无背书声明。
  • SHA256SUMS 文件:用于绑定所有数据载荷的完整性校验。

使用与声明

  • 包含范围:仅包含经确认具有再分发许可的文件。
  • 排除内容:WHO GHE数据、HPO待定精确可访问术语、任何国家PanelApp数据集、UMLS、OMIM、SNOMED CT、受控环境数据及任何无明确再分发证据的源文件。
  • 重要声明:数据集的包含不激活RareBurden估算,不构成临床、诊断、完整性、代表性或背书声明。

治理与溯源

  • 权威治理与出处:https://github.com/edithatogo/rareburden-commons
  • 私有资源:混合权利的 hpo-licensed-ontology-archive 保持私有,不得整体公开。
搜集汇总
数据集介绍
rareburden-commons-open-source-snapshots 数据集图片
构建方式
罕见病研究常受数据分散与许可限制掣肘,该数据集以可验证的再分发证据为筛选准则,构建了一个精确且哈希绑定的公开保全投影。其构建过程围绕逐项审查来源文件的许可条款展开,仅纳入明确允许再分发的记录,并以SHA-256摘要绑定原始投影及后续批次,确保字节级可追溯。数据来源涵盖Orphadata与MONDO本体发布资产、联合国世界人口展望人口指标工作簿及世界银行指标API响应,且每项来源保留自身许可,故整体以混合许可模式呈现。
特点
该数据集的核心特点在于强约束的许可合规性与边界声明,而非追求覆盖广度。其收录内容限定于具备肯定性再分发证据的源文件,并通过notices目录提供逐源归属、范围、变更状态及不背书声明。MONDO资产仅覆盖一个明确的历史片段,属于有界前沿而非完整性主张;纳入行为本身不激活任何患病率估计量,亦不作出临床、诊断、完整性或代表性承诺。受限来源如WHO GHE、UMLS、OMIM及SNOMED CT等均被排除在外。
使用方法
使用该数据集时,研究者应首先查阅notices目录中的源特定许可与归属信息,并核验SHA256SUMS及治理仓库中的逐对象摘要,以确认所用文件的来源与版本。由于各源许可互异,下游应用须遵循原始来源的条款,不得将混合许可集合整体视为统一授权。该数据适用于罕见病本体对齐、流行病学文件比对及人口背景指标提取等场景,但不可将其作为临床诊断或代表性估计的依据,亦不得将受限的hpo-licensed-ontology-archive整体公开。
背景与挑战
背景概述
罕见病负担的精准评估与公共卫生决策长期受困于数据碎片化与可复现性不足。RareBurden Commons开源快照数据集由Edith Atogo团队于2026年前后构建,旨在为罕见病流行病学与本体对齐研究提供许可明确、哈希绑定的可复现数据基线。该数据集整合了Orphadata流行病学文件、MONDO本体版本资产、联合国世界人口展望2024人口指标及世界银行指标API响应,其核心研究问题在于如何在混合许可框架下实现有限范围的公开数据保全与溯源。该数据集对罕见病数据治理、本体互操作及全球疾病负担估计领域具有重要的方法学示范意义。
当前挑战
该数据集所应对的领域问题在于罕见病数据生态的许可壁垒与版本碎片化,导致跨源数据整合与结果复现面临根本性障碍。构建过程中遭遇的挑战包括:精确筛选具有明确再分发许可的源文件,避免混入WHO GHE、HPO受限资产、OMIM等无法公开的字节流;在混合许可框架下维持各源的独立授权边界,并通过SHA-256收据与治理仓库实现逐对象绑定;同时需明确声明有限前沿而非完整覆盖,规避临床、诊断与代表性等方面的过度承诺。这些挑战共同构成了罕见病公共数据基础设施建设的核心难点。
常用场景
经典使用场景
在罕见病流行病学与健康负担研究领域,罕见病疾病负担的精准量化长期受制于数据碎片化与本体不一致等瓶颈。该数据集汇聚Orphadata流行病学对齐文件、MONDO本体发布资产、联合国世界人口展望人口指标以及世界银行指标探针等多源权威快照,为研究人员构建了一个可复现、可追溯的开放数据基线。其经典使用场景在于支撑罕见病患病率与发病率的人群归因估计,并借助标准化本体实现跨数据库的疾病术语映射与对齐。
实际应用
在实际应用层面,该数据集服务于公共卫生机构、罕见病登记系统及医药研发团队。公共卫生部门可借助其人口与流行病学快照估算区域罕见病负担,优化资源配置;登记系统可利用MONDO本体对齐实现病例标准化归类;制药企业则可在真实世界证据研究中将其作为外部对照数据源。需注意的是,数据集本身不激活任何估计量,亦不作出临床或代表性声明,应用时须结合具体研究设计审慎解读。
衍生相关工作
围绕该数据集已衍生出一系列与罕见病数据治理和开放科学相关的工作。其治理仓库rareburden-commons提供了来源追踪与哈希收据机制,启发了后续对混合许可数据集的合规发布研究。MONDO本体资产被广泛用于疾病语义相似度计算与表型关联分析,而世界人口展望快照则支撑了罕见病全球负担建模的衍生研究。这些工作共同推动了罕见病数据生态在可重复性与伦理合规方面的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务