遇见数据集

NetEaseCrowd

收藏
arXiv2024-03-11 更新2024-06-21 收录
官方服务:

资源简介:

NetEaseCrowd是由网易公司基于其成熟的数据众包平台构建的大型数据集,旨在验证适用于在线部署的真相推理算法。该数据集包含约2413名工人、近100万项任务和600万条标注,数据收集历时约6个月。NetEaseCrowd不仅保留了每个标注的时间戳,还包含了多种类型的任务,这些任务根据工人的不同能力进行分类。数据集的构建过程精心设计,确保了数据的质量和多样性。NetEaseCrowd的应用领域广泛,主要用于解决在线真相推理问题,如任务分配和主动学习,旨在通过分析工人的能力随时间的变化,提高在线真相推理的效率和准确性。

NetEaseCrowd is a large-scale dataset constructed by NetEase based on its mature data crowdsourcing platform, aiming to validate truth inference algorithms suitable for online deployment. This dataset contains approximately 2413 workers, nearly 1 million tasks and 6 million annotations, with a data collection period of about 6 months. NetEaseCrowd not only retains the timestamp of each annotation but also includes multiple types of tasks classified according to the different abilities of workers. The dataset is meticulously designed during its construction to ensure data quality and diversity. NetEaseCrowd has a wide range of application scenarios, and is mainly used to solve online truth inference problems such as task assignment and active learning, with the goal of improving the efficiency and accuracy of online truth inference by analyzing the temporal changes of workers' abilities.

提供机构:
网易公司
创建时间:
2024-03-11
搜集汇总
数据集介绍
NetEaseCrowd 数据集图片
构建方式
在众包数据标注领域,现有数据集多局限于单一任务类型且忽略时间信息,难以支撑在线真值推理算法的长期部署。NetEaseCrowd数据集基于网易公司的实际众包平台构建,采集了自2022年6月至2023年2月约六个月间的标注记录。构建过程首先从平台中筛选出已完成且通过人工质检的任务集,每个三级能力类别最多保留100个近期完成的任务集,且每个任务均为三选一形式。随后,从数据库中提取每个任务的标注标签与推断真值,并随机保留每个任务不超过10条标注以模拟低标注量场景。最后,对工人ID进行匿名化处理,以保护隐私。该数据集最终包含2,413名工人、近100万个任务及超过600万条标注,且保留了每条标注的时间戳。
使用方法
NetEaseCrowd支持多种真值推理研究范式。研究者可将其划分为总体版本(整体推理)、任务集版本(按任务集独立推理)和能力版本(按能力类别独立推理),以探究任务集或能力信息对推理性能的影响。数据集中包含的时间戳可用于建模工人能力的时序变化,例如通过自相关函数分析能力演化的平稳性。此外,数据集提供了充足的带真值标注,支持监督学习场景:可按时间顺序划分训练集与测试集,评估模型在在线推理中的泛化能力与推理效率。实验表明,基于神经网络的监督方法在推理速度上具有优势,但泛化性仍需提升,这为后续研究指明了方向。
背景与挑战
背景概述
在众包数据标注领域,真值推理算法的有效性高度依赖于大规模、多类型、带时间戳的标注数据集。然而,现有公开数据集多局限于单一任务类型,且忽略了标注活动的时间信息,难以支撑长期在线场景下的算法验证与部署。为弥补这一不足,NetEaseCrowd数据集由网易公司与中国科学技术大学联合构建,于2024年发布。该数据集采集自真实众包平台,涵盖约六个月、近百万任务与六百万条标注,涉及六种三级能力类型的任务,并完整保留了每条标注的时间戳。其核心研究问题聚焦于如何利用时间维度和多任务类型信息,提升真值推理算法在动态环境下的准确性与效率。NetEaseCrowd的提出,为长期在线真值推理、工作者能力追踪及监督式推理等前沿方向提供了坚实的数据基础,显著推动了该领域从静态、单一任务向动态、多任务场景的演进。
当前挑战
NetEaseCrowd所应对的核心挑战包括:首先,在领域问题层面,现有真值推理算法多假设工作者能力恒定,难以适应众包平台中工作者能力随时间波动的现实,导致长期在线推理精度下降。其次,不同任务类型要求各异的能力,而传统方法以单一全局能力参数建模,忽略了能力维度的差异性,制约了细粒度推理的准确性。此外,在线部署对算法效率提出严苛要求,大规模任务流下,多数无监督方法因需反复优化而计算成本高昂。在数据集构建过程中,挑战同样显著:需从海量商业平台数据中筛选多类型、高质量任务集,并确保每个任务标注数适中以模拟真实低标注量场景;同时,必须对工作者ID进行匿名化处理以保护隐私,且因任务内容涉及数据请求者权益,无法公开任务文本,增加了算法仅依赖标注模式进行推理的难度。
常用场景
经典使用场景
NetEaseCrowd数据集的核心经典使用场景在于验证和评估面向在线部署的真值推断算法。在众包标注领域,该数据集通过提供跨越约六个月、涵盖两千余名工人与近百万任务的真实标注记录,为研究者构建了模拟长期在线众包平台动态环境的理想测试床。其独特之处在于保留了每条标注的时间戳,并包含了多种任务类型,使得研究者能够细致考察算法在工人能力随时间演变、任务类型多样化以及大规模在线数据流下的表现,从而推动真值推断技术从静态离线评估迈向动态在线验证。
解决学术问题
该数据集有效解决了现有众包真值推断研究中普遍存在的三大学术瓶颈:其一,突破了以往数据集仅包含单一任务类型、时间信息缺失的局限,使得追踪工人能力随时间动态变化成为可能,为建模能力演化提供了实证基础;其二,通过纳入层次化任务能力标签,揭示了不同任务类型对工人能力差异性的影响,从而推动了细粒度工人能力建模的研究;其三,凭借其百万级任务规模,为评估算法在在线环境下的计算效率提供了稀缺的大规模基准,直接回应了真值推断算法在实时部署中面临的效率挑战。
实际应用
在实际应用中,NetEaseCrowd数据集为商业众包平台的智能任务分配与在线质量控制提供了关键支撑。基于该数据集训练的算法能够实时评估工人的动态能力,从而将新发布的任务精准分配给最合适的标注者,显著提升标注效率与数据质量。同时,其蕴含的时间序列特征可用于构建在线真值推断系统,在任务持续涌入的背景下即时聚合标签并输出可靠结果,广泛应用于电商平台的图像审核、自然语言处理中的情感分析以及智能客服的意图识别等场景,极大降低了人工复核成本。
数据集最近研究
最新研究方向
在众包标注与真值推断领域,NetEaseCrowd数据集的出现标志着研究重心从静态、单任务场景向动态、多任务在线部署的深刻转变。该数据集收录了约六个月间两千余名工作者对上百万项任务进行的六百万次标注,并完整保留了每项活动的时间戳与任务类型层次结构,为追踪工作者能力随时间与任务类型的演化提供了前所未有的数据基础。前沿研究正围绕如何利用这些时序与能力维度信息构建细粒度的工作者能力动态模型展开,同时探索高时效性的在线真值推断算法,以应对众包平台大规模、持续型标注任务对推理效率与准确性的双重挑战。这一方向不仅推动了半监督与监督式真值推断方法的发展,也为任务分配、主动学习等应用场景开辟了新的可能性。
相关研究论文
  • 1
    A Dataset for the Validation of Truth Inference Algorithms Suitable for Online Deployment网易公司 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务