Chinese HealthNER Corpus
收藏资源简介:
Chinese HealthNER Corpus是由NYCU NLP Lab收集和标注的医疗命名实体识别数据集。该数据集首先从提供医疗信息的网站、在线健康相关新闻和医疗问答论坛中爬取文章,然后去除所有HTML标签、图像、视频和嵌入的网络广告,并将剩余文本分割成多个句子。数据集包含了10种实体类型,如人体、症状、医疗器材等,并由三名中文专业的本科生进行标注,标注一致性达到84.1%。
The Chinese HealthNER Corpus is a medical named entity recognition dataset collected and annotated by the NYCU NLP Lab. The dataset was initially compiled by scraping articles from websites providing medical information, online health-related news, and medical Q&A forums. All HTML tags, images, videos, and embedded web advertisements were removed, and the remaining text was segmented into multiple sentences. The dataset encompasses 10 types of entities, such as human body parts, symptoms, and medical equipment, and was annotated by three undergraduate students majoring in Chinese, achieving an annotation consistency rate of 84.1%.
数据集概述
数据集名称
Chinese HealthNER Corpus
数据集描述
该数据集是由NYCU NLP Lab收集并标注的医疗领域命名实体识别(HealthNER)语料库。数据集首先从提供医疗信息的网站、在线健康相关新闻和医疗问答论坛中爬取文章,去除HTML标签、图片、视频和嵌入式网络广告后,将剩余文本分割成多个句子,并随机选择部分句子进行手动标注。
实体类型
数据集包含10种实体类型,具体如下:
| 实体类型 | 描述 | 示例 |
|---|---|---|
| Body (人體) | 人体的整体物理结构,包括生物细胞、组织、器官和系统。 | “細胞核” (nucleus), “神經組織” (nerve tissue) |
| Symptom (症狀) | 由特定疾病引起的任何疾病感或身体或精神变化。 | “流鼻水” (rhinorrhea), “咳嗽” (cough) |
| Instrument (醫療器材) | 用于执行特定医疗任务的工具或其他设备。 | “血壓計” (blood pressure meter), “達文西手臂” (DaVinci Robots) |
| Examination (檢驗) | 仔细检查以发现可能的疾病的行为。 | “聽力檢查” (hearing test), “腦電波圖” (electroencephalography;EEG) |
| Chemical (化學物質) | 通常在人体中发现的任何基本化学元素。 | “去氧核糖核酸” (deoxyribonucleic acid; DNA), “糖化血色素”(glycated hemoglobin) |
| Disease (疾病) | 由感染或健康失败而非事故引起的疾病。 | “小兒麻痺症” (poliomyelitis; polio), “帕金森氏症” (Parkinson’s disease) |
| Drug (藥品) | 用作药物的任何天然或人工制造的化学品。 | “阿斯匹靈” (aspirin), “普拿疼” (acetaminophen) |
| Supplement (營養品) | 添加到其他事物中以改善人类健康的东西。 | “維他命” (vitamin), “膠原蛋白” (collagen) |
| Treatment (治療) | 用于治疗疾病的行为方法。 | “藥物治療” (pharmacotherapy), “胃切除術” (gastrectomy) |
| Time (時間) | 以分钟、天、年为单位的存在元素。 | “嬰兒期” (infancy), “幼兒時期” (early childhood) |
数据集统计
- 训练集:28,161句,平均每句49.44字符或29.99词,2.17个命名实体。
- 测试集:2,531句,平均每句47.92字符或28.67词,2.89个命名实体。
- 总句数:30,692句,总字符数约150万,总词数91.7千。
数据格式
- id : <String> 句子标识符
- genre : <String> 文本类型,包括"ft"(正式文本)和"sm"(社交媒体)
- sentence : <String> 句子字符序列
- word : <List> 分词后的词序列
- word_label : <List> 对应的词标签序列
- character : <List> 分词后的字符序列
- character_label : <List> 对应的字符标签序列
示例
{ "id": "00002", "genre": "sm", "sentence": "如何治療胃食道逆流症?", "word": ["如何", "治療", "胃食道逆流症", "?"], "word_label": ["O", "O", "DISE", "O"], "character": ["如", "何", "治", "療", "胃", "食", "道", "逆", "流", "症", "?"], "character_label": ["O", "O", "O", "O", "B-DISE", "I-DISE", "I-DISE", "I-DISE", "I-DISE", "I-DISE", "O"] }




