遇见数据集

DISAPERE

收藏
arXiv2022-11-07 更新2024-06-21 收录
官方服务:

资源简介:

DISAPERE数据集专注于学术同行评审中的话语结构,特别是审稿人与作者之间的互动。该数据集由马萨诸塞大学阿默斯特分校创建,包含506对审稿-反驳文本,总计超过20,000个句子,所有句子均由专家进行标注。数据集不仅关注核心论点,还对审稿和反驳中的每个句子进行标注,提供细粒度的非论点类型标签。DISAPERE旨在为研究者提供一个全面且高质量的测试集合,用于训练和微调模型,以帮助决策者如区域主席等更有效地理解和吸收他们必须阅读的讨论内容。

The DISAPERE dataset focuses on the discourse structure of academic peer review, particularly the interactions between reviewers and authors. Developed by the University of Massachusetts Amherst, it contains 506 pairs of reviewer-rebuttal texts, totaling over 20,000 sentences, all of which were annotated by domain experts. In addition to targeting core arguments, the dataset annotates every sentence in both reviews and rebuttals, providing fine-grained non-argument type labels. The DISAPERE dataset aims to provide researchers with a comprehensive and high-quality test collection for model training and fine-tuning, to help decision-makers such as area chairs more effectively understand and assimilate the discussion content they are required to review.

创建时间:
2021-10-16
搜集汇总
数据集介绍
构建方式
在学术同行评审的繁重任务中,理解评审与回复之间的语篇结构至关重要。DISAPERE数据集基于OpenReview平台,从ICLR 2019和2020会议中选取了506对英文评审-回复文本,共计超过2万条句子。每一条评审句子被标注了四个属性:评审行为、细粒度评审行为、方面和极性,这些标签综合了先前研究的分类体系并进行了扩展。回复句子则被标注了细粒度的语篇行为标签,并建立了与评审句子的上下文链接。所有标注均由经过培训的计算机科学研究生完成,耗时超过850人时,测试集部分为双重标注以确保质量。
特点
该数据集的核心特点在于其全面性与细粒度。不同于以往仅关注论证性语句的工作,DISAPERE对评审和回复中的每一条句子都进行了标注,覆盖了论证性与非论证性行为。回复句子的标注引入了新颖的语篇行为分类,包括赞同、反驳和非论证三类,并细分为14种具体行为,如回应问题、承认批评、拒绝请求等。此外,数据集还记录了回复句子的上下文在评审中的位置,揭示了作者如何选择性地回应评审意见。这种多层次的结构化标注为分析评审互动中的修辞策略提供了丰富信号。
使用方法
DISAPERE可用于多种自然语言处理任务。研究者可将其作为句子级分类任务的训练数据,预测评审句子的行为、方面和极性,或预测回复句子的语篇行为与立场。数据集还支持对齐任务,即根据回复句子预测其对应的评审上下文句子集。基线实验表明,基于BERT的分类模型在多数任务上表现合理,但方面识别和细粒度回复行为分类仍具挑战性。此外,数据集可用于分析评审质量,例如通过计算回复中的赞同比例来量化作者与评审者之间的一致性,为领域主席提供数据驱动的决策支持。
背景与挑战
背景概述
在学术交流的生态系统中,同行评审作为保障科学知识质量的核心环节,长久以来依赖评审者与作者之间密集的文本互动。随着学术产出量的激增,决策者(如领域主席与编辑)面临海量评审意见、反驳信函及讨论文本的阅读负担,亟需智能化工具辅助解析其中蕴含的论辩策略与意图。2022年,马萨诸塞大学阿默斯特分校的Neha Nayak Kennard等研究者发布了DISAPERE数据集,旨在填补同行评审语篇结构研究中评审与反驳之间话语关系的空白。该数据集包含506对英文评审-反驳文本(逾2万句子),由计算机科学专业研究生历经850小时以上精细标注,系统刻画了评审句子的四种属性(动作、细粒度动作、方面与极性)及反驳句子的语境关联与论辩行为。DISAPERE的发布为自动化分析评审互动模式、提升决策效率提供了高质量的训练与测试资源,对计算语言学与科学计量学领域产生了深远影响。
当前挑战
DISAPERE数据集所应对的核心挑战在于同行评审文本中话语结构的复杂性:首先,评审与反驳之间的论辩关系并非简单的顺序对应,作者常将评审中的评价性语句解读为隐含请求,或通过策略性回应模糊批评与认同的界限,这对模型准确捕捉语义意图构成显著障碍。其次,数据构建过程面临标注质量控制的难题——由于评审文本高度依赖领域知识,标准众包方法无法适用,需仰赖具备计算机科学背景的专家进行精细标注,即便如此,标注者间在反驳动作分类(如“接受批评”与“缓和批评”)上的Cohen's κ值仍仅达0.479,反映了语篇标签的固有歧义性。此外,现有模型在反驳句语境对齐任务中表现不佳,基于BM25的检索模型仅取得0.598的MRR,表明纯词汇匹配难以捕获深层的跨句参照关系,亟需融合篇章级语境信息的创新方法。
常用场景
经典使用场景
在学术同行评审的复杂话语结构分析中,DISAPERE数据集为研究者提供了首个同时标注审稿意见与作者回复的细粒度语料库,涵盖506对评审-回复文本中超过2万句子的多层次标注。其经典使用场景聚焦于建模审稿人与作者之间的论辩互动,通过标注审稿句子的行为类型、方面和极性,以及回复句子的立场与上下文链接,使得研究者能够系统性地解析评审对话中的话语策略、意图对齐与争议焦点。这一场景为理解科学评价中的语言博弈奠定了数据基础。
解决学术问题
该数据集解决了学术评审研究中长期存在的关键问题:缺乏同时涵盖审稿与回复话语结构的标准化标注资源。以往研究或仅关注审稿中的论点抽取,或忽略回复与审稿间的上下文关联,导致无法深入分析作者对批评的回应策略。DISAPERE通过统一前人分散的标签体系,并新增回复句子的立场分类(赞同、反驳、非论辩)及上下文对齐标注,使研究者能够量化审稿中的争议程度、识别隐性请求与回应模式,从而揭示评审质量与作者配合度之间的关联,为优化评审流程提供了可复现的分析范式。
衍生相关工作
基于DISAPERE衍生的经典工作包括两类:一是句子级分类任务,利用BERT等预训练模型预测审稿句子的行为类型、方面和极性,以及回复句子的立场与具体动作,为理解评审话语提供自动化基线;二是回复上下文对齐任务,通过信息检索模型(如BM25)或双塔Siamese-BERT模型,预测每条回复句子所回应的审稿句子集合,揭示作者对评审意见的选择性回应模式。这些工作不仅验证了数据集的挑战性(如修辞疑问句的歧义、非连续上下文对齐),还推动了论辩对抽取、立场检测等子领域的方法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务