遇见数据集

PhenoNormBench

收藏
arXiv2026-09-09 更新2026-09-11 收录
官方服务:

资源简介:

PhenoNormBench是由四川大学和成都医学院构建的统一基准数据集,专为评估生物医学本体归一化任务而设计。该数据集整合了七个不同来源的人类表型本体(HPO)子集,共计13,390个样本,覆盖多样的表型描述短语及其对应的标准化概念。其创建过程通过系统收集现有HPO标注数据并统一版本和ID映射规则实现。该数据集主要服务于解决自由文本到本体概念映射的挑战,为评估本体对齐、语义检索和层次引导排序等方法提供标准化评测平台,助力生物医学数据整合与分析。

PhenoNormBench is a unified benchmark dataset constructed by Sichuan University and Chengdu Medical College, specifically designed for evaluating biomedical ontology normalization tasks. This dataset integrates subsets of the Human Phenotype Ontology (HPO) from seven distinct sources, totaling 13,390 samples, covering diverse phenotypic description phrases and their corresponding standardized concepts. Its development is accomplished by systematically collecting existing HPO annotated data and unifying version and ID mapping rules. This dataset primarily addresses the challenge of mapping free text to ontology concepts, providing a standardized evaluation platform for assessing methods such as ontology alignment, semantic retrieval, and hierarchy-guided ranking, and facilitating biomedical data integration and analysis.

创建时间:
2026-09-09
原始信息汇总

OntologyAligner 数据集总结

一、数据集概述

  • 名称:OntologyAligner
  • 任务目标:将自由文本的生物医学表型表达映射到标准化的人类表型本体(HPO)概念。
  • 核心方法:结合本体特定表示学习、语义候选比较和显式局部层级证据,构建可追溯的三阶段流程。
  • 关联论文:OntologyAligner: Ontology-Aligned Retrieval and Hierarchy-Guided Large Language Model Reranking for Biomedical Ontology Normalization(审稿中,2026)

二、三阶段流程

阶段 全称 功能
OAR Ontology-Aligned Retrieval(本体对齐检索) 通过概念级多正样本 InfoNCE 学习无偏投影,检索 Top-20 HPO 候选
LCR LLM Candidate Reranking(LLM 候选重排) 比较首选标签、同义词和定义,生成完整语义排序,可能返回 No Match
HGR Hierarchy-Guided Refinement(层级引导细化) 当 OAR 与 LCR 不一致时,利用父子与兄弟节点证据解决局部层级冲突,返回完整排序

三、PhenoNormBench 基准

PhenoNormBench 将七个 HPO 标准化数据集统一为通用提及级格式,共包含 13,390 条表型提及

数据集 提及数量 工作簿路径
GeneReviews-10 352 Dataset/GeneReviews-10/GeneReviews-10.xlsx
ID-68 866 Dataset/ID-68/ID-68.xlsx
GSC2017 2,773 Dataset/GSC2017/GSC2017.xlsx
GSC2024 2,910 Dataset/GSC2024/GSC2024.xlsx
CSC 1,783 Dataset/CSC/CSC.xlsx
FGDD 1,866 Dataset/FGDD/FGDD_Phenotype_Testset.xlsx
BC8-T3 2,840 Dataset/BC8_T3/BC8_T3.xlsx
合计 13,390

数据字段

字段 说明
Raw_Phenotype_Names 作为模型输入的原始自由文本表型提及
Standard_Phenotype_Names 标准化表型名称
HPO_id 参考 HPO 标识符
Accepted_HPO_ids 用于评估的当前或历史 HPO 标识符
Patient_IDpatient_idspmids 可用的来源元数据

消融子集

  • 路径:Dataset/Ablation_Subset/ablation_subset_seed42.xlsx
  • 构成:每个数据集 300 个样本,共 2,100 个样本,用于敏感性分析。

四、数据集与资源组成(Whats Included)

资源 内容
PhenoNormBench 七个标准化 HPO 归一化数据集及固定 2,100 样本消融子集
HPO 快照 工作流使用的 HPO 发布的 OBO、JSON、JSONL 格式
OAR 可训练的本体对齐投影、推理运行时及向量索引构建代码
LCR 与 HGR 完整提示词、响应验证、检查点及层级引导重排逻辑
实验 主七数据集运行器及组件与敏感性消融
Notebooks OAR 预计算 + LCR 与 HGR 的两步工作流

五、仓库结构

text . |-- README.md |-- LICENSE |-- requirements.txt |-- LLM_config.example.json |-- 01_run_precompute.ipynb # OAR 检索与 Top-20 预计算 |-- 02_run_LLM_rerank.ipynb # LCR 与选择性 HGR 重排 |-- run_main_experiment.py # 七数据集实验运行器 |-- run_ablation.py # 消融入口 |-- ontology_aligner_runtime.py # 共享工作流运行时 |-- ontology_aligner_oar.py # 正式 TE3L OAR 推理 |-- dataset_utils.py # 数据集与 HPO ID 工具 |-- test_main_experiment_contract.py # 工作流契约测试 |-- ablation/ | |-- config.py | |-- experiments.py | |-- oar.py # OAR 训练实现 | |-- runtime.py | -- report.py |-- Dataset/ | |-- Ablation_Subset/ | |-- BC8_T3/ | |-- CSC/ | |-- FGDD/ | |-- GeneReviews-10/ | |-- GSC2017/ | |-- GSC2024/ | -- ID-68/ |-- HPO/ | |-- hp260623.obo | |-- hp260623.json | |-- hp260623.jsonl | -- convert_obo.py -- imgs/ `-- ontologyaligner.jpg

六、快速开始

1. 创建环境

bash cd OntologyAligner conda create -n ontologyaligner python=3.10 conda activate ontologyaligner python -m pip install -r requirements.txt

  • 推荐使用支持 CUDA 的 GPU 进行 OAR 训练和本地 transformer 主干网络。

2. 配置 API 访问

bash cp LLM_config.example.json LLM_config.json

Windows PowerShell:

powershell Copy-Item LLM_config.example.json LLM_config.json

  • LLM_config.json 中设置模型名称、API 端点、密钥和并发限制。
  • 主工作流读取 embedding(用于 TE3L 嵌入)和 llm(用于 LCR 与 HGR)。

3. 选择工作流

工作流 入口 用途
Notebook 01_run_precompute.ipynb 后再运行 02_run_LLM_rerank.ipynb 交互式、逐步执行
命令行 run_main_experiment.py 复现单个或全部七个数据集
消融 run_ablation.py 运行组件与敏感性实验

七、复现流程

Notebook 工作流

  1. 打开 01_run_precompute.ipynb,配置数据集与嵌入设置。
  2. 构建所需 HPO 资源并生成 OAR Top-20 候选工作簿。
  3. 打开 02_run_LLM_rerank.ipynb,配置数据集与 LLM 设置。
  4. 运行 LCR 与选择性 HGR,生成最终重排工作簿。
  • LCR 与 HGR 的完整提示词存于 02_run_LLM_rerank.ipynb;命令行运行时直接读取这些定义,保持两种工作流同步。

命令行工作流

运行单个数据集:

bash python run_main_experiment.py --dataset fgdd --max-concurrency 10 --requests-per-minute 200

运行完整基准:

bash python run_main_experiment.py --dataset all --max-concurrency 10 --requests-per-minute 200

支持的数据集键:

text genereviews-10 id-68 gsc2017 gsc2024 csc fgdd bc8_t3

八、消融实验

实验 评估内容
E1 原始 TE3L 检索后接 LCR 与 HGR
E2 仅 OAR
E3 OAR 后接 LCR
E4 LLM 主干敏感性
E5 嵌入主干与 OAR 敏感性
E6 候选集大小:k = 1, 3, 5, 10, 20

bash

运行单个实验

python run_ablation.py --experiment E3

选择 LLM 或嵌入主干

python run_ablation.py --experiment E4 --llm-backbone claude-opus-5 python run_ablation.py --experiment E5 --backbone text_embedding_3_large

运行完整配置协议

python run_ablation.py --all

九、测试

bash python -m pytest test_main_experiment_contract.py -q

  • 契约测试覆盖共享的 Top-20 工作流、数据集/工作簿接口,以及 LCR/HGR 的 No Match 策略。

十、引用

  • 稿件正在审稿中。若使用 OntologyAligner 或 PhenoNormBench,请引用:

bibtex @article{song2026ontologyaligner, title = {OntologyAligner: Ontology-Aligned Retrieval and Hierarchy-Guided Large Language Model Reranking for Biomedical Ontology Normalization}, author = {Song, Jie and Xu, Zhichuan and Lu, Ziyu and Xiao, Meng and Bi, Cheng and Zhang, Yuxin and Zheng, Xin and Li, Xiaoran and Cao, Qiongfang and Yang, Hao and Shen, Bairong}, year = {2026}, note = {Manuscript under review} }

十一、许可证

  • 本仓库基于 MIT License 发布。

十二、联系方式

  • 技术问题请提交 issue 或联系:
  • Song Jie:songjie02_09@163.com
搜集汇总
数据集介绍
PhenoNormBench 数据集图片
构建方式
针对现有HPO规范化数据集在本体版本与标注规范上彼此割裂、难以横向比较的困境,PhenoNormBench将七个来源各异的表型规范化数据集进行统一整合。所有概念标识符被映射至最新HPO发布版本,并引入Accepted HPO IDs机制,将标准ID与官方alt_ids一并视为可接受答案,以消解版本差异带来的评估偏误。以独立表型短语为基本评价单元,各数据集被转化为包含短语、标准HPO ID与可接受ID集合的标准化结构,最终汇聚成涵盖13,390条样本的统一基准。
特点
该基准汇聚FGDD、CSC、GeneReviews-10、BC8-T3、GSC2017、GSC2024与ID-68共七个数据集,样本总量达13,390条,其中7,355条拥有多个可接受HPO ID。通过统一本体版本与ID归一化协议,它消弭了跨数据集的标注异质性,使不同方法可在同一评价框架下接受检验。其数据来源横跨面部表型、临床遗传学文献与表型抽取竞赛等多种场景,兼顾了表型表述的多样性与概念层级的复杂性,为细粒度语义判别提供了充分的评估空间。
使用方法
研究者可将PhenoNormBench作为HPO规范化的标准评测平台,以Top-1准确率为主指标,分别计算各数据集层面的准确率并汇总为等权Macro准确率与合并Micro准确率。借助内置的可接受ID集合,预测结果只要命中任一官方标识即判定为正确,从而规避版本迁移造成的假阴性。该基准同时支持按短语长度、词法重叠度与本体深度进行难度分层分析,亦可用于候选集规模、嵌入骨干与语言模型骨干的敏感性比较,并可通过训练本体专属投影扩展至MONDO、MEDIC与NCBITaxon等其它生物医学本体。
背景与挑战
背景概述
生物医学本体规范化旨在将自由文本表述映射至标准化概念,是临床表型注释、罕见病辅助诊断及多源数据整合的关键环节。PhenoNormBench由四川大学华西医院沈百荣教授团队于2026年构建,通过统一本体版本与可接受标识符标准,整合了FGDD、CSC、GeneReviews-10等七个来源的人类表型本体数据集,共包含13390条样本,为表型规范化方法提供了首个系统化、标准化的评测基准。该基准的建立回应了既有数据集本体版本与注释规范不一致、难以横向比较的困境,对推动可复现评估与跨方法性能比较具有重要价值。
当前挑战
PhenoNormBench所面对的领域挑战源于表型表述的词汇多样性与概念粒度的细微差异:同一本体概念可对应多种词形变体,部分表述与标准同义词几乎无词汇重叠,而父子或兄弟概念常在解剖部位、临床特征或语义精细度上仅有毫厘之别,致使单纯字典匹配或通用嵌入检索难以有效判别。在基准构建层面,七个来源数据集的本体版本与注释标准各异,需将全部标识符映射至最新人类表型本体版本,并引入可接受标识符机制以消解版本迁移带来的评估偏差,同时须保持各数据集权重平衡,避免评估结果被样本量较大的来源所主导。
常用场景
经典使用场景
在生物医学本体标准化研究中,PhenoNormBench 最为经典的用途是作为人类表型本体(HPO)概念识别的统一评测基准。该基准汇聚了 FGDD、CSC、GeneReviews-10、BC8-T3、GSC2017、GSC2024 与 ID-68 等七个来源各异的表型标准化数据集,共计 13,390 条样本,并统一映射至最新 HPO 版本。研究者可在此基准上系统比较规则匹配、稠密检索与大语言模型等不同范式的表型归一化方法,借助标准化的评测单元与可接受标识符规范,获得跨数据来源、可重复且具备统计效力的性能对比结果。
衍生相关工作
围绕该基准,研究者提出了 OntologyAligner 三阶段框架,融合本体对齐检索、基于大语言模型的候选重排与层次引导的精细化修正,在 PhenoNormBench 上取得 Macro 与 Micro Top-1 准确率 88.78% 与 86.75% 的当前最优表现。以此为基础,相关工作进一步将评测拓展至 MONDO、MEDIC 与 NCBITaxon 等本体,验证了疾病与物种实体归一化的可迁移性;同时 FastHPOCR、PhenoBERT、PhenoTagger、RAG-HPO 等基线方法亦在该基准上获得系统评估与增益改进。
数据集最近研究
最新研究方向
生物医学本体规范化作为连接非标准自由文本与结构化知识体系的关键环节,正受到日益广泛的关注。PhenoNormBench通过整合七个人类表型本体数据集、统一本体版本与可接受ID标准,构建了涵盖13,390个样本的标准化评测基准,为该领域提供了可复现的比较平台。当前研究前沿已从早期基于词典与规则的方法、通used神经稠密检索,转向本体对齐检索与大语言模型重排序相结合的混合范式。OntologyAligner以本体特异性投影学习、候选语义精排及层级引导修正三阶段框架,在HPO、MONDO、MEDIC及NCBITaxon等本体上展现出优越的跨本体迁移能力,同时通过显式利用父子与兄弟关系缓解语义相似概念的边界模糊问题。该基准的建立与相关方法学的推进,对表型注释、文献策展、队列构建及临床决策支持等下游应用具有重要的支撑意义。
相关研究论文
  • 1
    OntologyAligner: Ontology-Aligned Retrieval and Hierarchy-Guided Large Language Model Reranking for Biomedical Ontology Normalization四川大学; 成都医学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务