遇见数据集

DFKI-SLT/argmicro

收藏
Hugging Face2025-03-10 更新2024-03-04 收录
官方服务:

资源简介:

argmicro数据集包含112篇短篇论证文本,这些文本最初用德语撰写,并已专业翻译成英语。数据集基于Freeman和Toulmin的论证理论,包含支持(pro)和反对(opp)组件以及六种关系类型:seg(段落)、add(补充)、exa(示例)、reb(反驳)、sup(支持)和und(削弱)。数据集还引入了基于段落的跨度,以覆盖整个文本。数据集支持的任务包括结构预测、关系识别、中心主张识别、角色分类和功能分类。数据集的创建过程包括文本的收集、校正和注释,所有文本均由专家注释者进行注释,并经过检查和讨论以确保准确性。

The argmicro dataset contains 112 short argumentative texts, which were originally written in German and professionally translated into English. Grounded in the argumentation theories of Freeman and Toulmin, the dataset includes support (pro) and opposition (opp) components, as well as six types of argumentative relations: seg (paragraph segment), add (supplementary relation), exa (exemplification), reb (refutation), sup (supportive relation), and und (undermining relation). The dataset also introduces paragraph-based spans to cover the full text of each document. Supported tasks include structure prediction, relation recognition, central claim identification, role classification and function classification. The dataset creation process includes text collection, correction and annotation: all texts were annotated by expert annotators, and underwent review and discussion to ensure annotation accuracy.

提供机构:
DFKI-SLT
原始信息汇总

数据集概述

数据集名称: argmicro

数据集描述: arg-microtexts corpus 包含112篇短的辩论性文本。所有文本最初以德语编写,并由专业翻译人员翻译成英语。该数据集基于Freeman的论证宏观结构理论和Toulmin的图解技术,包含pro(支持者)和opp(反对者)组件以及六种关系类型:seg(段落)、add(添加)、exa(例子)、reb(反驳)、sup(支持)和und(削弱)。

支持的任务:

  • 结构预测
  • 关系识别
  • 中心主张识别
  • 角色分类
  • 功能分类

语言:

  • 德语,附带英语翻译

数据集结构

数据实例:

  • 下载的数据集文件大小: 2.89 MB

数据字段:

  • id: 文档实例ID,字符串类型
  • topic_id: 文档主题,字符串类型
  • stance: 对主题的立场索引,整数类型
  • text: 文档内容,字符串类型
  • edus: 基本话语单元,文本分段跨度
    • id: EDUs实例ID,字符串列表
    • start: 跨度起始索引,整数列表
    • end: 跨度结束索引,整数列表
  • adus: 辩论性话语单元,基于EDUs的辩论相关主张
    • id: ADUs实例ID,字符串列表
    • type: ADU类型索引,整数列表
  • edges: adus之间的关联或adus与其他edges的关联
    • id: 边实例ID,字符串列表
    • src: 关系中的源元素ID,字符串列表
    • trg: 关系中的目标元素ID,字符串列表
    • type: 边类型索引,整数列表

数据分割:

  • 训练集: 112个实例
  • 平均每个实例的句子数: 5.1

数据标签:

立场

立场 计数 百分比
pro 46 41.1%
con 42 37.5%
unclear 1 0.9%
UNDEFINED 23 20.5%

ADUs

ADUs 计数 百分比
pro 451 78.3%
opp 125 21.7%

关系

关系 计数 百分比
支持: sup 281 55.2%
支持: exa 9 1.8%
攻击: und 65 12.8%
攻击: reb 110 21.6%
其他: joint 44 8.6%

数据集创建

源数据:

  • 23篇文本由作者Andreas Peldszus编写
  • 90篇文本通过控制文本生成实验收集

初始数据收集和规范化:

  • 112篇“微文本”响应触发问题编写
  • 文本经过拼写和语法错误校正

注释过程:

  • 所有文本均按照Peldszus & Stede提出的方案进行辩论结构注释
  • 注释由一位专家完成,争议实例由两位或更多专家讨论

注释者:

  • 信息待补充

个人和敏感信息:

  • 信息待补充

许可证信息

arg-microtexts corpus 根据Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License发布。

搜集汇总
数据集介绍
构建方式
该数据集由112篇短篇议论文构成,原文均为德语,并经由专业翻译人员译为英语。文本源自两项工作:23篇由作者作为概念验证撰写,其余90篇通过受控文本生成实验收集,受试者需针对“是否应该做某事”类触发问题撰写约五个语段长度的议论文,确保包含立场、论证及至少一项对反对意见的回应。所有文本经拼写与语法校正,并最小化修改以维持连贯性。标注遵循Peldszus与Stede提出的论证结构方案,由一名专家完成全部标注,争议案例经多位专家协商裁决,初始采用手工标注,后续借助GraPAT工具进行。
特点
该数据集基于Freeman的论证宏观结构理论与Toulmin的图示技术,引入了支持方与反对方两种角色,以及六种关系类型:语段、添加、例证、反驳、支持与削弱。其独特之处在于采用基于语段的跨度覆盖全文,包含非论证性部分。数据实例包含立场标签(支持、反对、不明确、未定义)、基本话语单元与论证话语单元及其类型,以及边结构以表征论证单元间的复杂关系。支持关系占比最高(55.2%),反驳与削弱攻击分别占21.6%与12.8%,体现了论证结构的多样性。
使用方法
数据集支持结构预测、关系识别、核心主张识别、角色分类及功能分类等任务。用户可通过HuggingFace平台直接加载,数据结构包含文档标识符、主题、立场、全文文本、基本话语单元(含起止索引)、论证话语单元(含类型)及边结构(含源、目标与关系类型)。示例数据展示了从垃圾分离主题文本到完整标注结构的映射。建议研究者结合官方标注指南与注释方案进行模型训练与评估,注意数据集规模较小(112例),适合作为论证分析系统的基准测试资源。
背景与挑战
背景概述
在计算论辩学领域,对自然语言中论证结构的自动识别与建模始终是制约智能文本分析发展的核心瓶颈。为突破这一困境,德国人工智能研究中心(DFKI)的语言技术实验室联合波茨坦大学,由Andreas Peldszus与Manfred Stede主导,于2015年发布了argmicro语料库。该数据集精心收录了112篇短小精悍的论辩性微文本,原文为德语并附有专业人工英译,旨在填补当时缺乏高质量、结构完整且注释精细的小规模论证资源的空白。其核心研究问题聚焦于如何基于Freeman的宏观论证理论与Toulmin的图示技术,对文本中主张方与反对方的论证单元及其六类语义关系(如支持、反驳、削弱等)进行系统性标注。argmicro的问世为论证结构预测、角色分类及关系识别等下游任务提供了黄金标准,极大地推动了论证挖掘领域的基准测试与模型评估,成为该方向不可替代的经典资源。
当前挑战
argmicro数据集所面临的挑战首先源于其解决的领域问题:论证结构的自动解析本身极具复杂性,论证单元边界模糊、关系类型多样(如支持、反驳、削弱之间的细微差异),且文本中常蕴含隐含前提与多步推理,使得模型难以精准捕获论证的宏观骨架。此外,数据集的构建过程亦充满艰辛——仅112篇文本的语料规模虽保证了注释质量,却限制了深度学习模型对数据多样性的学习;原始文本需通过受控实验从23名母语者处收集,并经历严格的拼写纠错、分割调整与连贯性修改,人工翻译还需在保留原有分段与线性顺序的前提下完成,这一系列精细的规范化流程虽确保了数据纯净度,却极大增加了构建成本与时间投入。同时,全部注释仅由一名专家完成并经多人核验,虽保证了内部一致性,但注释者的主观判断仍可能引入潜在偏差,且缺乏跨语言、跨领域的泛化能力评估。
常用场景
经典使用场景
在论证挖掘与计算论辩学领域,argmicro数据集因其精巧的微观文本设计而成为结构预测与关系识别的基准资源。该数据集包含112篇精心构建的短篇论辩文本,每篇均以完整的论证结构呈现,涵盖主张、支持与反驳等核心要素。研究者常利用其标注的论证话语单元、边缘关系类型以及立场标签,开展论证结构自动解析、中心主张识别及论辩角色分类等经典任务。其独特的基于片段的标注体系,将非论证性内容纳入考量,为全文本论证结构建模提供了细腻的监督信号,尤其适用于评估模型在有限上下文中的论证关系推理能力。
解决学术问题
argmicro数据集有效填补了论证分析领域中高质量、细粒度标注资源的空白,解决了以往语料库多聚焦于长文本或特定领域而缺乏简洁完整论证实例的困境。它使得研究者能够系统性地探究论证微结构的组成规律,如支持与攻击关系的分布特征、论证单元的类型判别以及立场倾向的自动判定。该数据集的引入推动了论证结构识别从粗粒度段落级分析向细粒度片段级推理的转变,为计算论辩学提供了可控的实验环境,显著促进了论证模式的形式化建模与评估方法的标准化。
衍生相关工作
argmicro数据集催生了一系列标志性研究工作,奠定了微观论证分析的方法论基础。Peldszus与Stede基于该语料提出了片段级论证结构识别框架,并验证了序列标注与图解析方法的有效性。后续工作如Lippi与Torroni的论证单元分类器、以及Eger等人的图神经网络论证解析模型,均以argmicro作为核心评测基准。此外,该数据集还启发了论证跨度检测、论辩关系类型细粒度分类等子任务的研究,并成为计算论辩学领域常用的小样本学习与迁移学习实验床,其标注方案亦被后续大型论辩语料库所借鉴与扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务