遇见数据集

CATCH-ME

收藏
arXiv2026-06-18 更新2026-06-20 收录
官方服务:

资源简介:

CATCH-ME是由布鲁诺·凯斯勒基金会与天主教圣心大学联合构建的首个大规模、专家策划的多语言对话数据集,专注于应对仇恨言论与虚假信息的交叉领域。该数据集包含2015个虚构多轮对话,总计12,298轮交互,其中6,149轮为基于外部知识的反驳言论,覆盖英语、意大利语、马耳他语、波兰语和西班牙语五种语言,并针对穆斯林、犹太人、有色人种等七个边缘化群体。数据创建过程采用了四种人机协作策略,包括预编译、交互式、手动和自动翻译方法,并依托23名专家在18个月内完成,确保对话自然且基于事实核查文章与非政府组织报告进行外部知识锚定。该数据集旨在支持检索增强生成系统研究,为训练和评估更具说服力、事实依据的反驳言论模型提供资源,以解决在线仇恨与虚假信息交织传播的社会治理难题。

CATCH-ME is the first large-scale, expert-curated multilingual dialogue dataset jointly developed by the Bruno Kessler Foundation and the Catholic University of the Sacred Heart, focusing on the intersection of hate speech and misinformation. It encompasses 2015 fictional multi-turn dialogues, totaling 12,298 interaction turns, among which 6,149 are external knowledge-backed counterarguments. Covering five languages—English, Italian, Maltese, Polish and Spanish—the dataset targets seven marginalized groups including Muslims, Jews, and people of color. The dataset was constructed via four human-machine collaboration strategies: pre-compilation, interactive, manual and automatic translation methods, and was completed by 23 experts over an 18-month timeline. To guarantee natural dialogues and external knowledge grounding, all content is anchored to fact-checking articles and non-governmental organization (NGO) reports. This dataset aims to support research on retrieval-augmented generation (RAG) systems, offering resources for training and evaluating more persuasive, fact-based counterargument models to address the social governance challenge of the intertwined propagation of online hate speech and misinformation.

创建时间:
2026-06-18
原始信息汇总

数据集概述

该数据集与论文《Assisted Counterspeech Writing at the Crossroads of Hate Speech and Misinformation》相关,专注于针对仇恨言论和错误信息的自动反言论生成与专家修订。

数据条目结构

每条数据包含 13 个字段,具体如下:

  • pair_id:言论-反言论对的唯一标识符。
  • claim:包含错误信息的仇恨性言论。
  • CS_gen:针对该言论自动生成的反言论。
  • CS_ed:专家修订后的反言论版本。
  • generation_strategy:生成反言论所使用的策略,可选值为 Fact-CheckersNGOMixed
  • target:该言论所针对的边缘化群体。
  • antistereotype_id:作为外部知识使用的反刻板印象的唯一ID列表。
  • fc_article_id:作为外部知识使用的事实核查文章的唯一ID。
  • annotator_type:修订反言论的专家类型,为事实核查员(FC)或非政府组织运营者(NGO)。
  • fc_article_url:事实核查文章的来源URL。
  • antistereotype_url:所使用的反刻板印象的来源URL列表。
  • antistereotype_location:反刻板印象在对应来源URL中的具体位置(例如,数值 "2" 表示该页中的 Myth #2)。
  • HTER:使用 pyter3 库计算的 CS_genCS_ed 之间的 HTER 分数。HTER 值 ≥ 0.39 的配对被选中用于针对研究问题1(RQ1)的人工评估。
搜集汇总
数据集介绍
CATCH-ME 数据集图片
构建方式
CATCH-ME数据集的构建依托23位领域专家(包括事实核查员与非政府组织运营者),采用人机协作的四种策略进行多轮对话收集。专家依据事实核查文章与非政府组织报告等外部验证知识,撰写旨在同时回击仇恨言论与错误信息的对话语料,并为每轮反话语标注对应的文档及文本块级别的证据来源。数据涵盖英语、意大利语、马耳他语、波兰语和西班牙语五种语言,针对穆斯林、犹太人、有色人种、女性、LGBTQIA+群体、移民及残障人士七类边缘化群体。最终形成包含2015组对话、共计12298轮次的语料库,其中6149轮反话语具有外部知识支撑。
特点
该数据集的核心特色在于其首次大规模、多语言、多轮次地聚焦于仇恨与错误信息交织的复杂场景。所有反话语均严格锚定于事实核查文章与非政府组织报告等可验证外部知识,并通过文档级与文本块级注解实现细粒度溯源,使其天然适用于检索增强生成(RAG)系统研究。数据集覆盖五种语言与七类边缘化群体,提供了跨语言与跨领域的多样化语料,能够有效支撑更具说服力与事实依据的反话语模型训练与评估。此外,四类人机协作策略的引入不仅保障了语料的高质量与专业性,还为大规模语料构建提供了可复现的方法论范式。
使用方法
CATCH-ME数据集可直接用于检索与生成两大核心任务的基准测试。在检索任务中,研究者可利用对话历史、重写查询等不同配置,评估稠密检索模型在多语言或跨语言场景下对相关证据文本块的召回能力。在生成任务中,可基于零样本设定,分别输入仅含有害言论、结合金标准知识或采用检索到的top-k文本块等不同信号,评估模型在语义相似性、事实忠实度、逻辑蕴含及回帖相关性等多维度的反话语生成质量。该数据集还支持微调流程,用以优化多语言反话语模型的检索与生成能力,推动更安全在线对话环境的构建。
背景与挑战
背景概述
在线仇恨言论与虚假信息在网络空间中常常交织共生,然而自然语言处理领域以往的研究多将二者割裂开来,分别加以处理。针对这一重叠现象的应对性发言(Counterspeech)现有数据集极为匮乏,且局限于单轮英语对话,远不能反映真实世界中多轮次、多语言交互的复杂性。为填补这一空白,意大利布鲁诺·凯斯勒基金会的研究人员于2026年联合23位来自事实核查与非政府组织的一线专家,历经18个月精心构建了CATCH-ME数据集。该数据集首创性地收录了涵盖英语、意大利语、马耳他语、波兰语和西班牙语五种语言的2015篇多轮对话,聚焦穆斯林、犹太人、有色人种、女性、LGBTQIA+群体、移民及残障人士等七个易受攻击的群体。每一轮应答均锚定于经由事实核查文章与非政府组织报告验证的外部知识,并配有文档级与片段级的跨度标注,为基于检索增强生成(RAG)的模型训练与评估提供了前所未有的高质量资源,有力推动了更具说服力、基于事实的回应性发言模型的发展。
当前挑战
该数据集所应对的领域核心挑战在于仇恨言论与虚假信息的复杂交织:传统上被孤立处理的两种现象在实际互动中相互强化,要求应对性发言必须同时完成纠正错误信息与破除负面刻板印象的双重任务,而现有模型在零样本设定下常生成重复、模糊且缺乏建设性的回应。构建过程中的挑战亦十分艰巨:多语种覆盖需处理波兰语、马耳他语等低资源语言的翻译与后编辑质量波动,且针对犹太人与残障人士等高可靠性事实核查文章稀缺的群体,专家们只能优先选取有据可查的案例,导致目标群体分布不均。此外,人机协作策略虽提升了效率,但预编译与交互式策略生成的对话在词汇多样性上显著弱于人工撰写,后编辑工作虽能降低重复率却增加了人力负担,如何平衡自动化生成的质量与人工干预的成本成为贯穿始终的难题。
常用场景
经典使用场景
CATCH-ME数据集最经典的使用场景在于为检索增强生成(RAG)系统提供多轮、多语言、知识锚定的反言论对话训练与评估素材。研究者可基于该数据集构建或微调模型,使其在面对交织着仇恨言论与虚假信息的多轮交互时,能够从外部事实核查文章与非政府组织报告中精准检索相关片段,并生成既纠正错误信息又挑战刻板印象的、富有同理心的事实型回应。该场景直接服务于开发更具说服力、更少重复且严格基于事实的自动反言论生成系统。
解决学术问题
该数据集解决了当前自然语言处理领域中将仇恨言论与虚假信息割裂研究的学术困境。现有反言论语料库多聚焦单一议题或局限于单轮英语对话,无法反映真实网络交互中两类有害内容共现的复杂情境。CATCH-ME通过提供首个大规模、专家策展的多语言多轮对话资源,使研究者能够系统探究在检索增强框架下,模型如何在单一回应中同时完成事实纠正与偏见消解,从而为建立更鲁棒、更贴近现实的反言论评估基准奠定了方法论基础。
衍生相关工作
该数据集衍生了一系列围绕多语言、多轮反言论生成的经典工作,包括构建基于微调Llama等开源大语言模型的交互式生成策略,开发面向低资源语言的零样本与跨语言检索器对比基准,以及探索预编译、交互与手工标注三种人机协作范式对对话质量与标注效率的系统性影响。此外,基于CATCH-ME的检索任务实验催生了面向对话上下文的查询重写与稠密检索优化方法,推动了知识锚定反言论生成这一子领域的标准化评估框架形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务