遇见数据集

copenlu/spiced

收藏
Hugging Face2024-07-01 更新2024-03-04 收录
官方服务:

资源简介:

SPICED(科学释义和信息变化数据集)是一个包含来自科学论文、新闻媒体和Twitter的配对科学发现的数据集。配对类型包括<论文, 新闻>和<论文, 推文>。每对句子都标注了信息相似度评分(IMS),评分范围为1到5。数据集从S2ORC中提取科学文本,并通过Altmetric匹配新闻文章和推文。实例由专家通过Prolific平台和Potato进行标注。数据集支持的任务是预测两个科学句子之间的IMS,优选指标为均方误差和皮尔逊相关系数。数据集的语言为英语,数据字段包括DOI、实例ID、新闻发现、论文发现、新闻上下文、论文上下文、评分、学术领域、数据集分割、最终评分、来源和新闻URL。数据集分为训练集(4721个实例)、验证集(664个实例)和测试集(640个实例)。

SPICED (Scientific Paraphrase and Information Change Dataset) is a dataset consisting of paired scientific discoveries sourced from scientific papers, news media, and Twitter. The pairing types include <paper, news> and <paper, tweet>. Each sentence pair is annotated with an Information Similarity Score (IMS) ranging from 1 to 5. Scientific texts are extracted from S2ORC, and news articles and tweets are matched via Altmetric. Instances are annotated by experts through the Prolific platform and Potato. The task supported by this dataset is predicting the IMS between two scientific sentences, with the preferred evaluation metrics being Mean Squared Error (MSE) and Pearson Correlation Coefficient. The dataset is in English, and its data fields include DOI, instance ID, news discovery, paper discovery, news context, paper context, score, academic field, dataset split, final score, source, and news URL. The dataset is divided into training set (4,721 instances), validation set (664 instances), and test set (640 instances).

提供机构:
copenlu
原始信息汇总

数据集概述:SPICED

数据集描述

数据集总结

  • 名称: SPICED (Scientific Paraphrase and Information ChangE Dataset)

  • 内容: 包含科学论文、新闻媒体和Twitter中的科学发现配对数据集。配对类型包括<paper, news>和<paper, tweet>。

  • 标注: 每个配对根据描述的发现信息相似度进行1-5分的标注,称为_Information Matching Score (IMS)_。

  • 来源: 数据来源于S2ORC,新闻文章和推文通过Altmetric匹配。

  • 使用指南: 使用时请引用以下文献:

    @article{modeling-information-change, title={{Modeling Information Change in Science Communication with Semantically Matched Paraphrases}}, author={Wright, Dustin and Pei, Jiaxin and Jurgens, David and Augenstein, Isabelle}, year={2022}, booktitle = {Proceedings of EMNLP}, publisher = {Association for Computational Linguistics}, year = 2022 }

支持的任务和排行榜

  • 任务: 预测两个科学句子之间的IMS,范围为1至5。
  • 评估指标: 均方误差和皮尔逊相关系数。

语言

  • 语言: 英语

数据集结构

数据字段

  • DOI: 原始科学文章的DOI
  • instance_id: 样本的唯一实例ID
  • News Finding: 新闻或推文发现的文本
  • Paper Finding: 论文发现的文本
  • News Context: 新闻实例的周围两句话,推文则为推文本身
  • Paper Context: 论文发现的周围两句话
  • scores: 移除低能力标注者后的标注者分数
  • field: 论文的学术领域(计算机科学、医学、生物学、心理学)
  • split: 数据集分割(训练、验证、测试)
  • final_score: 实例的IMS
  • source: 来源类型(新闻或推文)
  • News Url: 新闻实例的源文章URL或推文的推文ID

数据分割

  • 训练: 4721个实例
  • 验证: 664个实例
  • 测试: 640个实例

数据集创建

来源数据

  • 科学文本: S2ORC
  • 新闻文章和推文: 通过Altmetric收集
  • 语言生产者: 科学家、记者和Twitter用户

许可信息

  • 许可: MIT
搜集汇总
数据集介绍
copenlu/spiced 数据集图片
构建方式
SPICED数据集的构建始于对科学传播中信息演变过程的深入洞察。研究团队从S2ORC学术论文数据库中提取科学发现,并借助Altmetric平台匹配相关的新闻报道与推文,从而构建了<论文-新闻>与<论文-推文>两种类型的配对样本。每对样本由领域专家通过Prolific众包平台和Potato标注工具进行人工标注,以1至5分的信息匹配评分(IMS)量化两条表述中科学发现的信息相似程度。此外,部分样本还借助SBERT模型自动标注以扩充规模,形成了涵盖计算机科学、医学、生物学与心理学四个学科领域的结构化数据集。
使用方法
SPICED主要用于训练和评估能够预测信息匹配评分(IMS)的回归模型,其任务本质是量化两段科学表述之间的语义相似度。推荐采用均方误差与皮尔逊相关系数作为主要评价指标。研究者可将新闻或推文中的表述作为输入,与对应的论文摘要或结论进行比对,模型输出的IMS分数可揭示科学信息在传播过程中是否被扭曲、简化或夸大。该数据集适用于文本语义相似度评分、科学事实核查以及科学传播质量分析等下游任务,并可通过提供的DOI与原文链接获取更完整的上下文信息以深化分析。
背景与挑战
背景概述
科学传播是将高度专业化的科学语言转化为公众可理解的通俗表述的复杂过程,其质量直接影响公众健康与行为决策。在此背景下,哥本哈根大学自然语言处理实验室(Copenhagen University NLP Group)的研究人员Dustin Wright、Jiaxin Pei、David Jurgens和Isabelle Augenstein于2022年构建了SPICED(Scientific Paraphrase and Information ChangE Dataset)数据集,旨在量化科学信息在传播链条中的变异程度。该数据集基于S2ORC科学文献库,通过Altmetric平台匹配新闻与推文,形成<论文-新闻>与<论文-推文>的句子对,并由专家依据信息匹配评分(IMS)进行1至5级标注。SPICED为评估机器学习模型在科学传播中的信息保真度提供了标准化基准,对虚假信息检测与科学传播质量监控具有重要推动作用。
当前挑战
SPICED数据集所应对的核心挑战在于科学传播中信息失真问题的量化与建模——不同媒介(如论文、新闻、社交媒体)对同一科学发现的表述常存在语义偏移,而传统语义相似度指标难以捕捉这种信息层面的变化。数据构建过程中面临多重难点:首先,从海量科学文献中精准匹配同一发现的不同媒介报道需要跨领域对齐技术;其次,标注任务要求专家在缺乏完整上下文的情况下,对科学发现的信息一致性进行主观评分,这引入了标注者间一致性的控制难题;此外,数据集仅涵盖计算机科学、医学、生物学与心理学四个领域,限制了模型的泛化能力;同时,未提供论文与新闻的全文,可能遗漏有助于判断信息匹配的关键语境。
常用场景
经典使用场景
SPICED数据集专为科学传播中的语义文本相似度评估而构建,其核心任务在于精准量化科学论文发现与新闻媒体及社交媒体推文之间信息匹配的程度。该数据集通过引入信息匹配评分(IMS)这一1至5级的连续标度,为研究者提供了一个标准化的基准,用以训练和评估模型在跨体裁、跨平台科学文本间捕捉信息保留、扭曲或丢失的能力。经典使用场景包括构建回归模型预测IMS值,并采用均方误差和皮尔逊相关系数作为评价指标,从而推动自然语言处理技术在科学传播领域的深入应用。
解决学术问题
该数据集直面科学传播过程中信息失真这一关键学术挑战。科学知识从高度专业化的学术论文向公众可理解的新闻和推文转化时,信息常因简化、误解或语境缺失而发生显著变化。SPICED通过提供成对标注的语料,使得研究者能够系统性地建模这一信息变化过程,从而揭示不同传播阶段中语义保持与偏移的规律。其意义在于为事实核查、错误信息检测等研究提供了量化工具,有助于提升科学传播的准确性和可靠性,进而维护公共知识的真实性。
实际应用
在实际应用中,基于SPICED训练的模型可部署于自动化科学传播监测系统,用于大规模分析新闻报道和社交媒体中科学发现的呈现方式。例如,公共卫生机构可利用该技术实时追踪疫情相关研究在媒体中的表述是否忠实于原始发现,从而快速识别并纠正误导性信息。此外,科学新闻编辑和科普工作者可借助此类工具评估自身内容的信息保真度,优化传播策略,确保公众获取的科学信息既通俗易懂又不失准确性。
数据集最近研究
最新研究方向
SPICED数据集聚焦于科学传播中的信息变异研究,通过量化科学发现从学术论文到新闻媒体及社交媒体传播过程中的语义相似度(IMS评分),为自然语言处理领域提供了评估科学信息保真度的基准。当前前沿方向包括利用该数据集训练模型以自动检测科学传播中的信息扭曲与错误表述,结合事实核查技术识别虚假科学新闻,以及分析不同学科(如医学、计算机科学)在传播链条中信息变化的规律。该数据集与新冠疫情等公共卫生事件中科学信息的快速传播紧密相关,其意义在于推动构建更可靠的科学传播监测工具,提升公众对科学信息的理解与信任。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务