遇见数据集

Medical online contents credibility dataset

收藏
github2024-01-02 更新2024-05-31 收录
官方服务:

资源简介:

该数据集收集了2019年12月至2020年2月间的医疗在线文章句子,包含由医疗专家提供的可信度标签,用于评估句子的可靠性。

This dataset comprises a collection of medical online article sentences from December 2019 to February 2020, including credibility labels provided by medical experts, aimed at assessing the reliability of the sentences.

创建时间:
2020-11-13
原始信息汇总

数据集概述

数据集名称

Medical online contents credibility dataset

收集时间

2019年12月至2020年2月

数据内容

  • 句子:从流行医学在线文章中提取的句子。
  • 可信度标签:由医学专家提供的对应句子的可信度标签。

标签类型

  • CRED (credible):句子可靠,不引起重大异议,包含可验证的医学领域信息。
  • NONCRED (non-credible):句子包含错误或不可验证的信息,与当前医学推荐相反的劝说,或过时信息。
  • NEU (neutral):句子不包含事实信息(例如,是问题),与医学无关。

数据集信息

  • sequence_nr:句子在相应文章中的位置。
  • body:句子的文本。
  • category:句子相关的类别(如儿童抗生素、精神病学、怀孕期间使用SSRI等)。
  • time_starttime_end:每次评估的时间。
  • context_window:理解句子评估所需周围句子的数量。
  • tags/reason:(可选)预定义标签或评估句子为不可信的自定义原因。

数据集文件结构

  • sentences.csv:包含sentence_id, article_id, sequence_nr, body, category, label, keywords, time_start, time_end, context_window, tags, reason等字段。
  • articles.csv:包含article_id, title, pub_date, access_date, url, keywords等字段。

数据集限制

  • sentences.csv 文件中约有5%的重复句子。
  • 重复句子可能因专家意见不同或不同上下文窗口而获得不同标签。
  • 可使用 sentences_cleaned_duplicates.csv 文件获取已清理的重复数据。

维护者和贡献者

  • 维护者:Aleksandra Nabożny
  • 贡献者:Aleksandra Nabożny, Kamil Warpechowski, Bartłomiej Balcerzak, 匿名医学专家

许可证

数据集遵循 Creative Commons CC-BY-NC 4.0 license

搜集汇总
数据集介绍
Medical online contents credibility dataset 数据集图片
构建方式
在医学信息可信度评估领域,Medical online contents credibility dataset的构建过程体现了严谨的科学方法。该数据集收集于2019年12月至2020年2月期间,从流行的医学在线文章中提取句子,并由医学领域的专家进行可信度标注。标注过程中,专家们根据句子的内容将其分为可信(CRED)、不可信(NONCRED)和中性(NEU)三类。此外,数据集还记录了句子的序列号、文本内容、所属类别、评估时间、上下文窗口等信息,确保了数据的全面性和可追溯性。
特点
该数据集的特点在于其标注的权威性和数据的丰富性。每个句子均由医学专家进行标注,确保了标注结果的可靠性。数据集不仅包含了句子的文本内容,还提供了句子的上下文信息、评估时间、类别等元数据,为研究者提供了多维度的分析视角。此外,数据集还特别处理了重复句子和短标题等问题,提供了清理后的版本,进一步提升了数据的质量。
使用方法
使用该数据集时,研究者可以通过分析句子及其标注结果,探索医学在线信息的可信度评估方法。数据集中的上下文窗口信息有助于理解句子的语境,而类别和关键词信息则便于进行特定领域的深入研究。研究者还可以利用清理后的数据集,避免重复句子对分析结果的影响。通过引用数据集的相关文献,研究者可以进一步了解数据集的构建细节和实验方法,从而更好地应用于实际研究中。
背景与挑战
背景概述
Medical online contents credibility dataset 是由波兰-日本信息技术学院的研究团队于2019年12月至2020年2月期间创建的一个数据集,旨在评估在线医疗信息的可信度。该数据集包含从流行医疗文章中提取的句子,并由医学专家进行标注,标注分为可信(CRED)、不可信(NONCRED)和中性(NEU)三类。该数据集的研究背景源于互联网上医疗信息的泛滥,其中不乏误导性或不准确的内容,这对公众健康构成了潜在威胁。通过构建这一数据集,研究团队希望为机器学习模型提供训练数据,以自动识别和过滤不可信的医疗信息,从而提升公众获取医疗信息的质量。该数据集在医疗信息可信度评估领域具有重要的应用价值,并为相关研究提供了宝贵的数据资源。
当前挑战
在构建Medical online contents credibility dataset过程中,研究团队面临了多重挑战。首先,数据收集阶段,由于网络爬虫的不完善,导致部分句子重复出现,约占数据集的5%。这些重复句子在标注过程中可能因专家意见不一致或上下文窗口不同而获得不同的标签,增加了数据处理的复杂性。其次,数据集中包含一些无意义的短句或标点符号,这些内容在预处理阶段需要被剔除,以确保数据的质量。此外,标注过程中,医学专家需要对大量句子进行细致评估,这不仅耗时耗力,还要求专家具备深厚的医学知识背景,以确保标注的准确性。这些挑战共同构成了该数据集构建过程中的主要难点,也为后续研究提供了改进的方向。
常用场景
经典使用场景
在医学信息可信度评估领域,Medical online contents credibility dataset 被广泛应用于训练和验证机器学习模型,特别是那些旨在自动识别和分类在线医学文章可信度的模型。通过提供由医学专家标注的句子级可信度标签,该数据集为研究者提供了一个标准化的基准,用于开发和测试自然语言处理算法。
实际应用
在实际应用中,Medical online contents credibility dataset 被广泛应用于医疗健康平台、搜索引擎优化以及医学教育领域。通过利用该数据集训练的模型,平台能够自动过滤和标记不可信的医学信息,帮助用户快速识别可靠的健康建议,从而减少因误导性信息导致的健康风险。
衍生相关工作
基于该数据集,研究者们已经开发了多项经典工作,包括基于深度学习的医学文本分类模型、可信度评估框架以及自动化标注工具。这些工作不仅推动了医学信息可信度评估技术的发展,还为其他领域的文本可信度研究提供了宝贵的参考和借鉴。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务