遇见数据集

actdan2016/sample1

收藏
Hugging Face2022-08-29 更新2024-03-04 收录
官方服务:

资源简介:

RedCaps是一个包含1200万张从Reddit收集的图像-文本对的大规模数据集。这些图像和文本描述了广泛的物体和场景,数据来自350个手动筛选的Reddit子版块。数据集的设计考虑了用户隐私和有害内容的过滤,主要语言为英语。数据集的创建过程完全自动化,无需人工标注。

RedCaps is a large-scale dataset containing 12 million image-text pairs collected from Reddit. These images and texts cover a wide range of objects and scenes, with the data sourced from 350 manually curated Reddit subreddits. The dataset is designed with user privacy and harmful content filtering in mind, and its primary language is English. Its creation process is fully automated without requiring manual annotation.

提供机构:
actdan2016
原始信息汇总

数据集概述

基本信息

  • 名称: RedCaps
  • 语言: 英语
  • 许可证: CC-BY-4.0
  • 多语言性: 单语种
  • 大小: 10M<n<100M
  • 数据来源: 原始数据
  • 任务类别: 图像到文本
  • 任务ID: 图像标题生成
  • 论文代码ID: redcaps
  • 美观名称: RedCaps

数据集内容

  • 内容类型: 图像
  • 描述: RedCaps是一个包含12M图像-文本对的大型数据集,数据来源于Reddit。图像和标题涵盖了广泛的物体和场景描述。数据集从350个手动筛选的子论坛中收集,这些子论坛提供了粗略的图像标签,使得数据集的组成可以被调整,而无需对单个实例进行标注。

数据集结构

  • 数据实例: 每个实例代表一个Reddit图像帖子,包含图像ID、作者、图像URL、原始标题、标题、子论坛、评分、创建时间、永久链接和跨帖子父级等信息。
  • 数据字段: 包括图像ID、作者、图像URL、原始标题、标题、子论坛、评分、创建时间、永久链接和跨帖子父级。
  • 数据分割: 所有数据包含在训练集中,训练集包含近12M实例。

数据集创建

  • 筛选理由: 数据集旨在用于预训练,以服务于一个或多个特定的下游任务。数据收集自手动筛选的子论坛,这些子论坛允许在不标注单个实例的情况下调整数据集的组成。
  • 源数据: 数据收集自2008年至2020年间选定的350个子论坛的图像帖子。帖子在创建至少六个月后被收集,以确保投票稳定。
  • 标注: 数据集使用自动数据收集管道构建,无需人工标注。
  • 个人和敏感信息: 数据集包含Reddit用户名,可能用于查找用户个人资料。此外,使用面部检测器移除可能包含人类面部的图像。

使用数据的考虑

  • 社会影响: 数据集未进行数据保护影响分析。
  • 偏见讨论: 数据集选择非NSFW子论坛进行数据收集,并使用模型过滤NSFW图像和潜在的贬义语言,以减少有害刻板印象。

附加信息

  • 数据集管理员: 未提供具体信息。
  • 许可信息: 数据集遵循CC-BY-4.0许可证。
  • 引用信息: 未提供具体信息。
  • 贡献: 未提供具体信息。
搜集汇总
数据集介绍
actdan2016/sample1 数据集图片
构建方式
RedCaps数据集源自社交媒体平台Reddit,通过系统化的自动采集流程构建而成。该流程首先手动筛选350个以图像分享为主的子版块,这些子版块涵盖动物、植物、物体、风景及活动等类别,并排除涉及人物、NSFW或违规内容。随后利用Pushshift及Reddit官方API,下载2008年至2020年间所有图像帖子,仅保留托管于Reddit、Imgur和Flickr域名上的图像,并过滤掉点赞数低于2或标记为NSFW的帖子。最后对帖子标题进行最小化文本清洗,包括小写化、去除表情符号及非拉丁字符、删除括号内非语义信息,并替换社交账号为[USR]令牌。整个流程无需人工标注,高效收集了约1340万实例,经隐私与有害内容过滤后,最终形成包含1200万图像-文本对的数据集。
特点
该数据集的核心特点在于其源自真实用户生成的社交媒体内容,具有高度多样性和自然性。图像与标题由Reddit用户自发创作,涵盖日常爱好、宠物、手工艺等丰富场景,标题常包含细粒度描述,如特定物种或地标。子版块名称本身提供粗粒度图像标签,即使标题不明确时也能提供语义引导。数据集规模庞大,包含1200万实例,且所有数据均用于训练,无需预定义验证集。此外,RedCaps在构建中注重伦理责任,通过手动筛选子版块、人脸检测及NSFW过滤显著减少人物图像与有害内容,同时提供用户退出机制,确保数据来源的合法性与可控性。
使用方法
使用RedCaps数据集时,用户可通过HuggingFace的datasets库加载,但默认不下载图像,仅暴露URL链接。需自行编写代码获取图像,例如利用concurrent.futures模块实现多线程下载,结合PIL库处理图像。对于包含多图像的链接,需先通过正则表达式解析URL,并采用datasets.Sequence特征表示图像列表。数据集主要用于图像描述生成、视觉-语言预训练及迁移学习任务,如分类、检测和分割。用户可根据下游任务需求,从训练集中采样验证集,并遵循与原始数据相同的子版块分布。所有图像需遵守Reddit、Imgur及Flickr的使用条款,且数据集采用CC-BY-4.0许可协议。
背景与挑战
背景概述
RedCaps数据集由密歇根大学的研究人员Karan Desai等人于2021年创建,旨在解决大规模图像-文本对数据集中数据质量与多样性之间的矛盾。该数据集从Reddit社交平台精心选取350个子版块,收集了约1200万对图像与标题,覆盖了从宠物、手工艺到自然风光等日常场景。与依赖搜索引擎或网页alt-text的现有数据集(如SBU Captions、Conceptual Captions)相比,RedCaps通过利用Reddit用户社区的自发创作意图,显著降低了数据噪声,提升了标注的语义丰富度。其核心研究问题在于探索社交平台作为数据源的可行性,以在保证伦理合规性的前提下,为图像描述、视觉表征学习等下游任务提供更自然、多样化的预训练资源。该数据集因其轻量级收集流程和对隐私风险的审慎处理,在视觉与语言领域产生了广泛影响。
当前挑战
RedCaps面临的首要挑战是解决图像描述任务中数据来源的固有偏差与隐私风险。Reddit用户群体以年轻、男性、高学历的英语使用者为主,导致数据在地域、文化和语言上缺乏代表性,可能强化性别或种族刻板印象。构建过程中,需应对多方面的技术难题:一是从RedditAPI收集的原始帖子中过滤低质量内容,包括去除NSFW图像、低点赞数帖子及包含人物面部的图片,以降低隐私泄露风险;二是清洗标题中的非语义信息(如括号内的相机参数、社交媒体标签),同时保留子版块名称作为弱监督标签;三是处理图像链接的失效与多图情况,需设计异步下载与URL解析流程以保障数据完整性。此外,如何在过滤噪声时不抑制边缘群体的合理表达,亦是伦理权衡中的关键挑战。
常用场景
经典使用场景
RedCaps数据集最经典的使用场景是作为图像描述(image captioning)任务的预训练语料。该数据集包含约1200万对从Reddit社区收集的图像与文本描述,覆盖了从宠物、手工艺到自然景观等丰富多样的日常场景。研究者通常利用RedCaps训练深度神经网络,使其学习如何将视觉内容转化为自然语言,从而为下游任务提供强大的视觉与语言联合表征。其独特的子版块标签机制(如r/shiba)为模型提供了粗粒度的语义监督,即使在描述文本本身模糊不清时,也能辅助模型理解图像类别。
衍生相关工作
RedCaps衍生了一系列经典工作,其中最突出的是其在图像描述领域的奠基性研究(Desai et al., 2021),该论文详细阐述了基于Reddit的轻量级数据采集流程。后续研究进一步拓展了其应用边界:例如,OscAR等人利用RedCaps预训练模型进行跨模态检索,证明了社区数据在零样本学习中的优势;此外,基于RedCaps的视觉表征学习方法(如CLIP的变体)在多个下游任务上刷新了记录。该数据集还催生了关于数据偏见的讨论,促使学界开发了针对Reddit用户群体偏差的缓解策略。
数据集最近研究
最新研究方向
RedCaps数据集聚焦于从社交媒体平台Reddit大规模收集图像-文本对,为视觉与语言模型提供预训练资源。该数据集以12M对高质量、多样化的日常场景描述为特色,涵盖动物、植物、物品、食物等类别,强调数据来源的社区驱动性和伦理责任。当前前沿研究方向包括利用其细粒度描述和子版块标签进行图像描述生成、迁移学习及多模态表征学习,同时探索如何平衡数据多样性与隐私保护,避免有害刻板印象,推动更公平、包容的视觉与语言模型发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务