遇见数据集

davanstrien/gahd

收藏
Hugging Face2024-04-10 更新2024-06-11 收录
官方服务:

资源简介:

--- license: cc-by-4.0 task_categories: - text-classification language: - de pretty_name: GAHD configs: - config_name: default data_files: - split: train path: "data/gahd.csv" - config_name: gahd_disaggregated data_files: - split: train path: "data/gahd_disaggregated.csv" --- **NOTE** README copied from https://github.com/jagol/gahd This repository contains the dataset from our NAACL 2024 paper "Improving Adversarial Data Collection by Supporting Annotators: Lessons from GAHD, a German Hate Speech Dataset". `gahd.csv` contains the following columns: - `gahd_id`: unique identifier of the entry - `text`: text of the entry - `label`: `0` = "not-hate speech", `1` = "hate speech" - `round`: round in which the entry was created - `split`: "train", "dev", or "test" - `contrastive_gahd_id`: `gahd_id` of its contrastive example `gahd_disaggregated.csv` contains the following additional columns: - `source`: - if annotators entered the entry via the Dynabench interface: `dynabench` - if the entry was translated from the Vidgen et al. 2021 dataset: `translation` - if the entry stems from the Leipzit news corpus: `news` - `model_prediction`: label predicted by the target model, `0` or `1` - `annotator_id`: unique identifier of the annotator that created the entry - `annotator_labels`: a string containing a forward slash-separated list of all labels by annotators - `expert_labels`: `0` or `1` if an expert annotator annotated the entry, otherwise empty When using GAHD, please cite our preprint on Arxiv: ``` @misc{goldzycher2024improving, title={Improving Adversarial Data Collection by Supporting Annotators: Lessons from GAHD, a German Hate Speech Dataset}, author={Janis Goldzycher and Paul Röttger and Gerold Schneider}, year={2024}, eprint={2403.19559}, archivePrefix={arXiv}, primaryClass={cs.CL} } ```

许可证:CC BY 4.0 任务类别: - 文本分类 语言: - 德语 数据集展示名:GAHD 配置项: - 配置名称:默认 数据文件: - 拆分方式:训练集 路径:"data/gahd.csv" - 配置名称:gahd_disaggregated 数据文件: - 拆分方式:训练集 路径:"data/gahd_disaggregated.csv" **注意** 本README复制自https://github.com/jagol/gahd 本仓库包含我们发表于NAACL 2024年会的论文《通过支持标注者优化对抗数据采集:来自德语仇恨言论数据集GAHD的经验教训》中的数据集。 `gahd.csv`包含以下列: - `gahd_id`:数据条目的唯一标识符 - `text`:数据条目文本 - `label`:标签,`0`代表“非仇恨言论”,`1`代表“仇恨言论” - `round`:该条目创建的轮次 - `split`:数据集拆分类型,可选“train(训练集)”、“dev(开发集)”或“test(测试集)” - `contrastive_gahd_id`:其对比示例的`gahd_id` `gahd_disaggregated.csv`包含以下额外列: - `source`:数据来源: - 若标注者通过Dynabench界面录入该条目:取值为`dynabench` - 若该条目为Vidgen等人2021年数据集的翻译版本:取值为`translation` - 若该条目来自Leipzit新闻语料库:取值为`news` - `model_prediction`:目标模型预测的标签,取值为`0`或`1` - `annotator_id`:创建该条目的标注者的唯一标识符 - `annotator_labels`:由所有标注者的标签以正斜杠分隔组成的字符串 - `expert_labels`:若有专家标注者对该条目进行标注,则取值为`0`或`1`,否则为空字符串 使用GAHD数据集时,请引用我们在ArXiv上的预印本: bibtex @misc{goldzycher2024improving, title={Improving Adversarial Data Collection by Supporting Annotators: Lessons from GAHD, a German Hate Speech Dataset}, author={Janis Goldzycher and Paul Röttger and Gerold Schneider}, year={2024}, eprint={2403.19559}, archivePrefix={arXiv}, primaryClass={cs.CL} }

提供机构:
davanstrien
原始信息汇总

数据集概述

基本信息

  • 许可证: CC-BY-4.0
  • 任务类别: 文本分类
  • 语言: 德语
  • 数据集名称: GAHD

配置详情

  • 默认配置

    • 数据文件: data/gahd.csv
    • 分割: 训练
  • gahd_disaggregated配置

    • 数据文件: data/gahd_disaggregated.csv
    • 分割: 训练

数据集内容

  • gahd.csv

    • 列信息:
      • gahd_id: 唯一标识符
      • text: 文本内容
      • label: 标签 (0: "非仇恨言论", 1: "仇恨言论")
      • round: 创建轮次
      • split: 分割类型 ("train", "dev", "test")
      • contrastive_gahd_id: 对比示例的gahd_id
  • gahd_disaggregated.csv

    • 额外列信息:
      • source: 数据来源 (dynabench, translation, news)
      • model_prediction: 目标模型的预测标签 (0 或 1)
      • annotator_id: 标注者唯一标识符
      • annotator_labels: 标注者提供的标签列表,以斜杠分隔
      • expert_labels: 专家标注者提供的标签 (0 或 1),否则为空

引用信息

  • 论文: "Improving Adversarial Data Collection by Supporting Annotators: Lessons from GAHD, a German Hate Speech Dataset"
  • 作者: Janis Goldzycher, Paul Röttger, Gerold Schneider
  • 年份: 2024
  • 预印本: arXiv:2403.19559
  • 类别: cs.CL
搜集汇总
数据集介绍
davanstrien/gahd 数据集图片
构建方式
在仇恨言论检测领域,高质量对抗性数据集的构建对于提升模型鲁棒性至关重要。GAHD(German Adversarial Hate Speech Dataset)采用了一种创新的对抗性数据收集方法,通过支持标注者生成更具挑战性的样本。数据集包含两个配置:默认配置下,条目涵盖文本、标签(0为非仇恨言论,1为仇恨言论)、轮次及对比性示例ID;而细粒度版本则额外收录了数据来源(如Dynabench界面、翻译或新闻语料)、模型预测、标注者ID及专家标签。这一设计使得数据集不仅可用于标准分类,还能深入分析标注过程与模型行为。
特点
GAHD数据集的核心特点在于其对抗性与细粒度标注的结合。所有条目均通过多轮对抗性生成,确保样本能有效挑战现有模型,尤其聚焦于德语语境下的仇恨言论识别。数据集中包含对比性示例(contrastive_gahd_id),便于研究模型决策边界。此外,细粒度版本提供了标注者级别的标签分歧信息(annotator_labels)与专家验证(expert_labels),为分析标注一致性及数据质量提供了独特视角。这些特性使GAHD成为评估和提升德语仇恨言论检测系统鲁棒性的重要基准。
使用方法
使用GAHD数据集时,用户可通过HuggingFace Datasets库加载默认配置或细粒度版本,分别对应data/gahd.csv与data/gahd_disaggregated.csv文件。数据集已预划分训练、开发与测试集(split列),可直接用于文本分类任务的模型训练与评估。对于需要探究对抗性样本影响的实验,可利用contrastive_gahd_id字段匹配对比示例。细粒度版本中的source与annotator_labels字段则适用于标注过程分析或模型偏差研究。建议引用相关论文以确保学术规范。
背景与挑战
背景概述
在自然语言处理领域,仇恨言论检测是维护网络空间安全的重要任务,尤其针对德语等资源匮乏的语言。2024年,Janis Goldzycher、Paul Röttger和Gerold Schneider等研究者在NAACL会议上提出了GAHD(German Adversarial Hate Speech Dataset)数据集,旨在通过对抗性数据收集方法提升德语仇恨言论分类器的鲁棒性。该数据集由研究人员在Dynabench平台协作构建,包含约数千条标注文本,每条样本被标记为仇恨言论或非仇恨言论,并细分为训练、开发和测试集。GAHD的核心研究问题在于如何通过支持标注者来改进对抗性数据收集流程,从而生成更高质量、更具挑战性的对抗样本。这一工作不仅为德语仇恨言论检测提供了宝贵的基准资源,还推动了对抗性数据收集方法论的发展,对低资源语言的自然语言处理研究具有重要启示意义。
当前挑战
GAHD数据集面临的核心挑战源于其对抗性数据收集的本质。首先,在领域问题层面,仇恨言论检测本身具有高度主观性和语境依赖性,德语中复杂的语法结构和文化背景进一步加剧了分类难度,使得模型难以准确区分恶意言论与合法表达。其次,在构建过程中,研究人员需应对标注者偏差与数据质量之间的平衡难题:对抗性样本的生成依赖标注者的创造性攻击,但标注者可能因疲劳或偏见引入噪声,导致标签不一致或样本缺乏代表性。此外,数据集规模有限,且部分样本源自翻译或新闻语料,可能无法全面覆盖德语网络社区中的仇恨言论变体,从而限制了模型的泛化能力。这些挑战要求后续研究在标注流程优化、数据多样性扩展和跨语言迁移学习方面持续突破。
常用场景
经典使用场景
在自然语言处理领域,针对德语文本的仇恨言论检测任务中,GAHD数据集被广泛用于训练和评估文本分类模型。该数据集通过对抗性数据收集方法构建,特别强调在标注过程中引入对抗性样本以提升模型鲁棒性。研究者常将其作为基准测试集,用以衡量模型在德语仇恨言论识别上的泛化能力,尤其是在处理复杂、模糊或具有对抗性特征的文本时。
实际应用
在实际应用中,GAHD数据集可服务于德语社交平台的内容审核系统,帮助自动识别并过滤仇恨言论。通过集成该数据集训练的模型,平台能够更精准地应对用户生成的对抗性表述,如改写或隐晦表达。此外,该数据集还可用于德语新闻评论区的舆情监控工具,辅助人工审核团队提升效率,降低有害内容的传播风险。
衍生相关工作
GAHD数据集衍生了一系列经典工作,包括基于对抗性训练的鲁棒性增强方法研究,以及标注者行为分析对数据收集策略的优化。相关研究还探索了跨语言仇恨言论检测的迁移学习,利用GAHD的德语标注框架对比英语数据集(如Dynabench),揭示语言特异性对模型性能的影响。此外,该数据集推动了对抗性样本生成算法的改进,如动态对抗性文本生成与迭代标注流程的整合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务