asus-aics/ntcir_13_medweb
收藏资源简介:
NTCIR-13 MedWeb(医学自然语言处理用于网页文档)任务要求进行多标签分类,为每条伪推文分配八个疾病/症状的标签(正面或负面)。数据集包含三种语言(日语、英语和中文)的伪推文,并标注了八种疾病/症状的标签,如流感、腹泻/胃痛、花粉症、咳嗽/喉咙痛、头痛、发烧、流鼻涕和感冒。此外,该数据集还提供了英语、日语和中文之间的平行语料库,可用于训练这三种语言之间的翻译模型。
NTCIR-13 MedWeb(医学自然语言处理用于网页文档)任务要求进行多标签分类,为每条伪推文分配八个疾病/症状的标签(正面或负面)。数据集包含三种语言(日语、英语和中文)的伪推文,并标注了八种疾病/症状的标签,如流感、腹泻/胃痛、花粉症、咳嗽/喉咙痛、头痛、发烧、流鼻涕和感冒。此外,该数据集还提供了英语、日语和中文之间的平行语料库,可用于训练这三种语言之间的翻译模型。
数据集卡片:NTCIR-13 MedWeb
数据集描述
- 主页: http://research.nii.ac.jp/ntcir/permission/ntcir-13/perm-en-MedWeb.html
- 是否公开: 否
- 是否在PubMed上可用: 否
- 任务类型: 多标签分类、翻译
NTCIR-13 MedWeb任务要求对每条推文进行多标签分类,为八种疾病/症状分配标签。给定的伪推文输出为八种疾病/症状的正(p)或负(n)标签。该任务的成果几乎可以直接应用于实际应用的基本引擎。
此任务提供了一个跨语言和多标签语料库的伪Twitter消息,涵盖三种语言(日语、英语和中文),并标注了八种标签,如流感、腹泻/胃痛、花粉症、咳嗽/喉咙痛、头痛、发烧、流鼻涕和感冒。
此外,该数据集还提供了英语、日语和中文的伪推文平行语料库,可用于训练这三种语言之间的翻译模型。
引用信息
@article{wakamiya2017overview, author = {Shoko Wakamiya, Mizuki Morita, Yoshinobu Kano, Tomoko Ohkuma and Eiji Aramaki}, title = {Overview of the NTCIR-13 MedWeb Task}, journal = {Proceedings of the 13th NTCIR Conference on Evaluation of Information Access Technologies (NTCIR-13)}, year = {2017}, url = { http://research.nii.ac.jp/ntcir/workshop/OnlineProceedings13/pdf/ntcir/01-NTCIR13-OV-MEDWEB-WakamiyaS.pdf }, }




