遇见数据集

awesome-human-label-variation

收藏
github2026-06-02 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精选的数据集列表,专注于自然语言处理和计算机视觉领域中包含人类标签变异(未聚合标签)的数据集,旨在收集每个实例具有多个注释的数据集,以支持学习人类标签变异或分歧。该合集还包括相关倡议、关键参考文献和评估活动。

This is a curated list of datasets focused on the fields of natural language processing (NLP) and computer vision (CV), which includes datasets containing human label variation (unaggregated labels). This collection aims to compile datasets where each instance has multiple annotations, to support research on human label variation or annotation disagreement. Additionally, this compilation includes relevant initiatives, key references, and evaluation activities.

创建时间:
2022-10-12
原始信息汇总

数据集详情总结:Awesome Human Label Variation

该页面是一个精心整理的资源列表,专注于自然语言处理(NLP)和计算机视觉(CV)领域中包含人类标签变异性(即未聚合的原始标签)的数据集。其核心目标是收集那些每个实例都包含多个标注的数据集,以支持基于人类标签变异/分歧的学习研究。

核心资源:包含多标注的数据集

页面以表格形式列出了大量数据集,按领域分为NLP数据集和CV数据集。

NLP数据集(部分列举)

数据集名称/描述 关键信息
Part-of-Speech (POS) tagging (Plank et al., 2014) 500条推特的词性标注,包含多标注。
NLI (自然语言推理) 内在分歧数据集 (Pavlick and Kwiatkowski, 2019) 约500个RTE实例,由50名标注者重新标注。
ChaosNLI (Nie et al., 2020) 大规模NLI数据集,由100名标注者重新标注。
GoEmotions (Demszky et al., 2020) Reddit评论,标注为27种情绪类别或中性。
Hate speech detection (Kennedy et al., 2020) 仇恨言论检测数据集,包含多标注。
ConvAbuse (Cercas Curry et al., 2021) 针对对话式AI系统的辱骂语言数据集,也用于SemEval 2023共享任务。
DisaggregHateIt (Madeddu et al., 2023) 意大利语仇恨言论数据集,1.1k条推文,每个实例有1到13个标注。
ArMIS (Almanea and Poesio, 2022) 阿拉伯语推文,用于检测厌女言论,是SemEval 2023的新数据集。

计算机视觉(CV)数据集(部分列举)

数据集名称/描述 关键信息
LabelMe (Rodrigues et al., 2018) 图像分类数据集,8个类别,已重新标注。
Cifar10H (Peterson et al., 2019) 图像分类数据集,10个类别,已重新标注。
VinDR-CXR (Nguyen et al., 2020) 胸部X光图像目标检测数据集,每张训练图像由3名标注者标注。
TexBiG (Tschirschwitz et al., 2022) 历史版面分析实例分割数据集,每张训练图像由2-4名标注者标注。

相关倡议与重要参考文献

倡议、评估活动与研讨会

综述与关键参考文献

引用

如果该资源库对您有帮助,请引用原始论文:Plank, 2022 EMNLP (https://arxiv.org/abs/2211.02570)。

搜集汇总
数据集介绍
awesome-human-label-variation 数据集图片
构建方式
该数据集以系统化文献综述为基石,广泛搜集了自然语言处理与计算机视觉领域中包含多重标注(即未聚合的原始标注)的公开数据集。构建过程始于一篇EMNLP 2022主题论文的附录表格,并经由持续的人工筛选与社区贡献(通过Pull Request机制)不断扩充。最终汇聚成一个涵盖数十个数据集的精选列表,每个条目均提供参考论文、数据集名称、描述性说明以及直接的下载链接,并明确区分了NLP与CV两大领域。
特点
该数据集的独特之处在于其聚焦于“人类标注变异性”这一核心问题,专门收录那些为每个样本保留多个独立标注而非仅聚合为单一标签的数据。这不仅涵盖了传统的客观语言标注任务(如词性标注、命名实体识别),更大量包含主观性强的任务(如仇恨言论检测、情感分析、自然语言推理),从而为研究标注者间分歧的成因、建模与评估提供了宝贵的资源。列表中还特别标注了与相关研讨会、共享任务(如Le-Wi-Di)及重要综述文献的关联。
使用方法
使用者可直接通过表格中的URL链接访问各子数据集的原始仓库或权威托管平台(如GitHub、Zenodo、Hugging Face)以获取数据。该资源库本身作为一个导航索引,便于研究者快速定位并下载所需的多标注数据。建议结合列表中引用的核心文献(如Plank 2022、Uma et al. 2021)来理解数据集的设计背景与使用场景。对于未列出的资源,鼓励通过创建Pull Request的方式参与贡献,以持续丰富这一社区维护的精选列表。
背景与挑战
背景概述
在自然语言处理与计算机视觉领域,数据标注的可靠性长期依赖于标注者间的一致性,然而,主观性任务(如情感分析、仇恨言论检测、自然语言推理)中标注者之间的分歧并非噪声,而是反映了人类认知的多样性与社会文化背景的差异。由Barbara Plank于2022年EMNLP会议上提出的“人类标注变异”问题,系统性地挑战了传统“单一真实标签”范式,推动了数据透视主义(perspectivism)的兴起。该数据集资源列表由丹麦哥本哈根大学等机构主导,汇聚了涵盖词性标注、关系抽取、图像分类等任务的未聚合标注数据,旨在支持模型学习人类标注变异,其影响力已延伸至SemEval共享任务与多届学术研讨会,成为重新定义数据真实性与评估标准的重要基石。
当前挑战
当前核心挑战在于三方面:首先,领域问题层面,传统机器学习依赖聚合标签(如多数投票)会抹除标注者间的合理分歧,导致模型无法捕捉语义歧义或文化偏见,尤其在主观性任务上易产生系统性偏差;其次,构建过程中,收集多标注者数据面临成本高昂、标注者招募困难以及标注协议设计复杂等难题,如ChaosNLI需对每个实例招募百名标注者,而医疗影像数据还需处理领域专家稀缺的问题;此外,如何设计评估指标以量化模型对多样性的包容度,以及如何避免将分歧简单归因为错误,仍是亟待突破的瓶颈。
常用场景
经典使用场景
在自然语言处理与计算机视觉领域,标注数据是模型训练的基石,然而人类标注者之间的主观差异常被忽视。该数据集集合了涵盖情感分析、仇恨言论检测、自然语言推理、词性标注、医学影像分类等多任务的未聚合标签数据,为研究标注变异提供了丰富资源。其经典使用场景在于揭示标注不一致的普遍性,并推动从单一“黄金标准”向多元视角的范式转变,使模型能够学习并适应人类判断的天然多样性。
实际应用
在实际应用中,该数据集助力开发更鲁棒且公平的AI系统。例如,在内容审核场景中,模型通过吸纳不同群体的标注分歧,能更精准地识别跨文化背景下的仇恨言论或偏见,避免因单一标注视角导致的误判。在医疗影像诊断中,利用多位放射科医生的标注变异训练模型,可模拟临床中的诊断不一致性,从而提升辅助决策系统的可靠性与包容性。
衍生相关工作
该数据集衍生了多项开创性工作,包括SemEval-2021与SemEval-2023的“学习与分歧共存”共享任务,直接推动了标注变异建模的标准化评估。此外,ChaosNLI通过大规模重标注揭示了自然语言推理中的固有分歧,而Davani等人提出的多任务模型则证明了预测不确定性可有效关联标注者间的意见分布。这些工作共同构建了“数据视角主义”的理论框架,深刻影响了后续关于主观NLP任务与公平性研究的设计范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务