遇见数据集

DataPerf

收藏
arXiv2023-10-13 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

DataPerf是一个由社区驱动的基准套件,旨在评估机器学习数据集和以数据为中心的算法。该数据集通过竞争、可比性和可重复性来促进数据中心AI的创新。DataPerf允许机器学习社区迭代数据集,而不仅仅是架构,并提供一个开放的在线平台,支持这种迭代开发。首次迭代包含五个基准,涵盖视觉、语音、获取、调试和扩散提示中的数据中心技术、任务和模态的广泛范围,并支持社区贡献新的基准。这些基准、在线评估平台和基线实现都是开源的,MLCommons协会将维护DataPerf,以确保对学术界和工业界产生长期利益。

DataPerf is a community-driven benchmark suite designed to evaluate machine learning datasets and data-centric algorithms. It fosters innovation in data-centric AI through competition, comparability, and reproducibility. DataPerf enables the machine learning community to iterate on datasets, not just model architectures, and provides an open online platform to support such iterative development. The first iteration includes five benchmarks covering a broad spectrum of data-centric technologies, tasks, and modalities in vision, speech, data acquisition, debugging, and diffusion prompting, and supports community contributions of new benchmarks. All these benchmarks, the online evaluation platform, and baseline implementations are open-source, and the MLCommons Association will maintain DataPerf to deliver long-term benefits for both academia and industry.

提供机构:
哈佛大学
创建时间:
2022-07-21
搜集汇总
数据集介绍
构建方式
DataPerf的构建源于对现有机器学习研究过度聚焦模型而忽视数据质量的深刻反思。该数据集基准套件由MLCommons协会主导,联合哈佛大学、斯坦福大学、ETH Zurich等顶尖学术机构及工业界共同开发。其构建过程遵循社区驱动原则,首先通过早期数据-centric AI挑战赛验证可行性,随后在Dynabench在线平台上部署了五个覆盖视觉、语音、数据获取、调试及扩散模型提示等不同模态与任务的基准。每个基准均设定了固定的模型架构、超参数和评估指标,以确保对数据改进方案的公平比较。平台采用无服务器架构动态扩展资源,并提供了离线评估脚本供参与者本地迭代,最终通过在线提交与自动验证完成基准的持续演进。
特点
DataPerf的核心特点在于其开创性地将评估焦点从模型转向数据,填补了数据-centric AI领域系统性基准的空白。该套件包含五个差异化显著的基准:语音与视觉的训练集选择任务考验算法在有限样本下筛选高质量数据的能力;视觉调试任务模拟人工参与的数据清洗流程,评估方法以最少的数据修正达到目标精度;数据获取任务在模拟市场中优化多源数据采购策略;对抗性Nibbler挑战则聚焦生成式AI的安全盲区,收集能绕过文本过滤器的有害提示-图像对。所有基准均提供开源基线实现和持续更新的排行榜,支持社区贡献新基准,并通过MLCommons的长期维护确保其可持续性。
使用方法
使用DataPerf时,研究者可根据研究兴趣选择特定基准参与。参与者需遵循各基准的提交规则:对于训练集选择任务,需提交选定的样本ID列表;调试任务要求提交按危害程度排序的数据点优先级列表;数据获取任务则需提交从各数据卖方购买样本数量的策略。所有提交均通过Dynabench平台自动评估,平台会利用预计算的特征向量或固定模型流水线计算得分,并实时更新排行榜。参与者可利用提供的离线评估脚本和基线代码进行本地开发,待方案成熟后再上传至服务器进行正式评测。此外,社区成员可通过DataPerf工作组提案新增基准,扩展该套件的覆盖范围。
背景与挑战
背景概述
长期以来,机器学习研究过度聚焦于模型架构的革新,而忽视了数据质量对模型性能的根本性影响。诸如ImageNet等经典数据集虽推动了模型设计的进步,却因基准饱和、数据伪影泛滥及现实应用中的偏差与脆弱性而显露局限。为扭转这一局面,2023年,由哈佛大学、斯坦福大学、谷歌等顶尖机构联合发起的DataPerf数据集应运而生。该数据集由MLCommons协会维护,旨在通过社区驱动的基准测试套件,系统评估数据集及数据为中心算法的质量。DataPerf覆盖语音、视觉、数据清洗、数据获取及扩散模型提示等多元任务,首次将竞争机制引入数据集改进领域,推动了数据质量评估的标准化与可重复性,对数据为中心的AI发展具有里程碑式的影响力。
当前挑战
DataPerf面临的核心挑战首先在于解决领域问题:传统模型为中心的基准已难以反映真实世界的数据复杂性,数据偏差、标签噪声及长尾分布导致模型泛化能力不足,亟需通过数据选择、清洗与调试等策略提升数据质量。其次,构建过程中遭遇多重技术难题:如何在海量多语言语音语料中高效筛选低资源语言的高质量样本,如何在弱监督视觉数据中自动识别最具价值的训练子集,以及如何在数据市场中模拟不透明定价与预算约束下的最优购买策略。此外,调试基准需在有限人工审查下定位最有害的标注错误,而对抗性提示基准则需系统性地挖掘生成模型的安全盲区,这些均对评估平台的扩展性与计算效率提出了严苛要求。
常用场景
经典使用场景
在数据为中心的机器学习研究浪潮中,DataPerf作为首个由社区驱动的综合性基准套件,为评估数据集质量与数据驱动算法提供了标准化竞技场。其经典使用场景涵盖训练集选择、数据清洗调试、数据采集策略优化以及生成模型对抗性测试等核心环节。例如,在语音与视觉领域,研究者可借助DataPerf的固定模型架构与评估指标,专注于迭代训练样本子集的质量,从而在低资源语言关键词检测或长尾视觉概念分类中实现性能跃升。这种范式将研究焦点从模型架构创新转向数据质量的系统性改进,为数据科学社区确立了可复现、可比较的评估新标准。
衍生相关工作
DataPerf的推出激发了大量数据驱动研究的衍生工作。在方法论层面,其语音选择基准催生了结合交叉验证与Cleanlab框架的噪声感知采样算法,视觉调试任务则推动了基于Shapley值近似的DataScope等高效数据重要性评估工具的发展。在平台生态层面,DataPerf与Dynabench的深度整合启发了后续如DataComp(聚焦多模态数据筛选)和CATS4ML(挖掘对抗性测试集)等社区竞赛,形成了持续迭代的数据中心化基准网络。同时,其开放的工作组机制(隶属MLCommons)为学术界与企业界搭建了长期协作桥梁,促进了数据质量评估、主动学习策略及标注不确定性建模等前沿方向的系统性突破。
数据集最近研究
最新研究方向
DataPerf作为由MLCommons社区主导的数据中心AI基准测试套件,正引领机器学习领域从传统的模型中心范式向数据中心范式转型。当前前沿研究方向聚焦于通过标准化竞赛机制系统性评估和优化数据集质量,涵盖语音与视觉的训练集选择、数据清洗与调试、多源数据获取策略以及生成式模型对抗性提示攻击等关键环节。该基准套件直面现有数据集基准趋于饱和、模型过拟合及数据级联风险等紧迫挑战,通过冻结模型架构、强调数据迭代改进,推动AI系统在低资源语言处理、长尾视觉概念识别、大规模噪声标注清理及生成式AI安全防护等热点应用场景中的鲁棒性与公平性突破。DataPerf的开放平台与持续维护机制,为学术界与工业界协同攻克数据瓶颈提供了可复现的评估基石,对加速负责任的AI落地具有深远意义。
相关研究论文
  • 1
    DataPerf: Benchmarks for Data-Centric AI Development哈佛大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务