健康评估知识图谱构建与语义标注数据集
收藏官方服务:
资源简介:
数据清洗校验规则:剔除无效体检文本、实体边界标注错误、关系逻辑矛盾的不合格样本;全部人体相关数据完成脱敏去标识化;统一实体命名、关系语义定义、指标单位规范,保障标注样本统一复用、模型训练稳定。 结构化处理规则:按脱敏健康原始文本 — 健康实体词表与映射 — 多层语义关系标注 — 图谱三元组构建 — 图谱入库质控五级分层,每条样本标注人群类别、文本来源、标注批次标签;以脱敏文本编码为主键绑定全套标注、本体、入库记录,实现图谱构建全流程溯源检索。 算法模型应用:BERT、BiLSTM-CRF 完成实体抽取与语义关系识别;本体推理算法完成知识图谱冲突校验;图存储入库算法实现三元组批量构建;精确率、召回率、F1 值量化评价标注与模型效果;差分隐私算法保障文本数据隐私安全。 合规处理:全部文本数据经受试者知情同意与医学伦理审查,剔除所有可识别个人隐私信息,无第三方涉密、商用数据;文本采集、标注、图谱构建全流程遵守《数据安全法》《个人信息保护法》《基本医疗卫生与健康促进法》,原始文本、伦理审批文件完整留存备查。
提供机构:
王湘创建时间:
2026-06-16
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集面向智慧医疗知识工程与健康智能问答,通过脱敏处理、实体标注、多层语义关系标注构建健康评估知识图谱,并采用BERT、BiLSTM-CRF等算法实现自动实体抽取与关系识别。数据严格遵循《数据安全法》等法规,完成隐私脱敏与伦理审查,支持图谱构建全流程溯源与模型训练评估。
以上内容由遇见数据集搜集并总结生成



