遇见数据集

penfever/JANuS_dataset

收藏
Hugging Face2023-08-09 更新2024-03-04 收录
官方服务:

资源简介:

JANuS数据集是一个用于视觉-语言模型实验的数据集,包含四个子数据集:ImageNet-100、OpenImages-100、LAION-100和YFCC-100。这些数据集都完全标注了真实标签,并且包含了从网页抓取的描述。数据集的设计目的是让研究人员能够比较不同标注策略对模型性能的影响。每个子数据集都至少包含两种标注来源:一种是整数形式的标签,映射到ImageNet-1k类别标签;另一种是自然语言描述,适合训练视觉-语言损失模型如CLIP。YFCC-100和LAION-100的标签是合成的,而ImageNet-100和OpenImages-100的标签是由人工标注的。

The JANuS dataset is a benchmark dataset for vision-language model experiments, consisting of four sub-datasets: ImageNet-100, OpenImages-100, LAION-100, and YFCC-100. All these sub-datasets are fully annotated with ground-truth labels and include descriptions scraped from the web. The dataset is designed to enable researchers to compare the impact of different annotation strategies on model performance. Each sub-dataset contains at least two types of annotation sources: one is integer-format labels that map to ImageNet-1k category labels, and the other is natural language descriptions suitable for training vision-language loss models such as CLIP. The labels for YFCC-100 and LAION-100 are synthetic, while those for ImageNet-100 and OpenImages-100 are manually annotated.

提供机构:
penfever
原始信息汇总

数据集概述

数据集名称

JANuS (Joint Annotations and Names)

数据集用途

  • 用于控制实验的视觉-语言模型。
  • 允许研究人员比较不同标签策略对模型性能的影响。

数据集内容

  • ImageNet-100: 包含超过50,000个新注释样本的ImageNet超集,包括flickr-captions和blip-captions。
  • OpenImages-100: OpenImages的子集,具有新的OpenImages到ImageNet类别的映射,恢复的原始flickr-captions和新的BLIP-captions。
  • LAION-100: LAION-15m的子集,通过子集匹配策略选择的样本。
  • YFCC-100: YFCC-15m的子集,通过子集匹配策略选择的样本。

数据集特点

  • 所有数据集均完全标注有地面实况标签,并完全配有网络爬取的标题。
  • 每个子集至少包含两种标签来源:
    • idx 标签:整数,映射到ImageNet-1k类标签。
    • caption 标签:自然语言标题,适用于训练如CLIP等视觉-语言损失模型。

数据集评估

  • 评估方法与ImageNet模型相同,但仅评估ImageNet类别的子集。

数据集大小

  • 数据集大小介于1M到10M之间。

相关任务

  • 零样本分类

引用信息

@article{ feuer2023distributionally, title={Distributionally Robust Classification on a Data Budget}, author={Benjamin Feuer and Ameya Joshi and Minh Pham and Chinmay Hegde}, journal={Transactions on Machine Learning Research}, issn={2835-8856}, year={2023}, url={https://openreview.net/forum?id=D5Z2E8CNsD}, note={} }

搜集汇总
数据集介绍
penfever/JANuS_dataset 数据集图片
构建方式
JANuS(Joint Annotations and Names)数据集由2023年发表于《Transactions on Machine Learning Research》的研究论文提出,旨在服务于视觉-语言模型的受控实验。该数据集整合了四个训练子集:ImageNet-100、OpenImages-100、LAION-100和YFCC-100。其中,ImageNet-100作为ImageNet的超集,新增了超过五万个人工标注样本,并附带了Flickr和BLIP生成的描述;OpenImages-100则是对OpenImages的子集进行类别映射重构,恢复了原始Flickr描述并补充了BLIP描述;LAION-100和YFCC-100则通过子集匹配策略从大规模数据池中筛选样本。每个子集均同时包含整数标签(映射至ImageNet-1k类别)和自然语言描述标签,前者部分源自人工标注,部分由子集匹配策略合成。
特点
JANuS数据集是当前唯一同时具备真实标注和网络抓取描述公开数据集,其核心特点在于支持对标签策略效果的对比研究。每个子集至少提供两种标签来源:整数标签便于传统分类任务,而描述标签则适用于CLIP等视觉-语言模型训练。ImageNet-100和OpenImages-100的整数标签由人工标注,确保了高可靠性;LAION-100和YFCC-100的标签则通过子集匹配策略自动生成,体现了数据高效性。此外,数据集仅聚焦于ImageNet-1000中的100个类别,便于在有限预算下进行分布鲁棒性分类实验。
使用方法
JANuS数据集的使用遵循ImageNet模型的评估范式,但仅针对其定义的100个类别子集进行性能评估。研究人员可通过VL Hub框架复现论文中的实验,该框架专为视觉-语言模型训练设计。数据集的元数据和图像链接以表格形式提供,各列含义需参考论文中的键值说明。使用时应首先根据需求选择子集,并明确标签类型(整数或描述)以匹配训练目标。评估时需加载metadata/in100_classes.txt文件获取类别列表,确保分类结果与子集一致。
背景与挑战
背景概述
JANuS(Joint Annotations and Names)数据集由Benjamin Feuer、Ameya Joshi、Minh Pham和Chinmay Hegde在2023年的论文《Distributionally Robust Classification on a Data Budget》中提出,是当前唯一同时具备真实标签和网络抓取标题的公开数据集。该数据集旨在支持视觉语言模型的受控实验,通过整合ImageNet-100、OpenImages-100、LAION-100和YFCC-100四个子集,为研究不同标注策略对模型性能的影响提供了标准化平台。其核心研究问题聚焦于在数据预算有限的情况下,如何实现分布鲁棒的分类,对多模态学习领域的数据效率和标注可靠性研究产生了重要影响。
当前挑战
JANuS面临的挑战包括:1)领域问题层面,视觉语言模型在数据稀缺场景下易受分布偏移影响,现有标注策略(如合成标签)难以平衡标注成本与模型鲁棒性,亟需系统性比较不同标注来源(人工标注、合成标签、自然语言标题)对分类性能的贡献;2)构建过程中,数据子集需跨异构数据集(如OpenImages与ImageNet的类别映射、LAION的噪声标题过滤)实现精准对齐,同时确保合成标签的生成策略(如子集匹配)不引入系统性偏差,这对标注一致性和数据质量提出了严苛要求。
常用场景
经典使用场景
JANuS数据集的核心经典应用场景在于为视觉-语言模型提供受控实验的基准平台。该数据集是唯一同时具备真实标注与网络爬取标题的公开资源,涵盖ImageNet-100、OpenImages-100、LAION-100和YFCC-100四个子集,每个子集均包含整数标签与自然语言标题两种标注来源。研究者可通过对比不同标注策略(如人工标注与合成标签)对模型性能的影响,系统性地探索分布鲁棒性分类问题。该设计尤其适用于预算受限场景下的数据效率研究,为评估视觉-语言模型在有限标注资源下的泛化能力提供了标准化测试框架。
实际应用
在实际应用层面,JANuS为工业界部署视觉-语言模型提供了数据效率优化的直接指导。例如,在医疗影像诊断或农业遥感监测等标注成本高昂的领域,开发者可参考该数据集的研究结论,权衡使用合成标签或弱监督标题替代昂贵的人工标注。数据集提供的VL Hub框架还能复现论文实验,便于企业快速评估不同数据策略在自有场景中的效果。此外,其子集匹配方法可直接迁移至其他大规模数据集(如LAION-15m)的筛选,帮助构建低成本的领域专用训练集。
衍生相关工作
JANuS数据集催生了多项后续研究工作。其核心思想——在数据预算约束下联合优化标注质量与分布鲁棒性——启发了若干关于合成标签置信度校准的研究,例如探索如何通过子集匹配策略生成的噪声标签进行鲁棒训练。同时,VL Hub框架的发布促进了视觉-语言模型训练流程的标准化,使得其他研究者能够便捷地复现并扩展其对比实验范式。此外,该数据集对多源标注(人工、合成、网络标题)的系统比较,为后续研究如何融合不同质量标注信号以提升模型泛化能力提供了方法论基础,相关成果已在迁移学习与低资源学习领域产生持续影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务