遇见数据集

llizhx/sampled_coco2014_100_pink

收藏
Hugging Face2024-05-16 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question_id dtype: string - name: image dtype: image - name: question dtype: string - name: answer sequence: string - name: id dtype: int64 - name: license dtype: int8 - name: file_name dtype: string - name: coco_url dtype: string - name: height dtype: int32 - name: width dtype: int32 - name: date_captured dtype: string - name: instance sequence: string splits: - name: level4 num_bytes: 6411200.0 num_examples: 100 - name: level3 num_bytes: 6075833.0 num_examples: 100 - name: level2 num_bytes: 5809247.0 num_examples: 100 - name: level5 num_bytes: 6579360.0 num_examples: 100 - name: level9 num_bytes: 7446459.0 num_examples: 100 - name: level7 num_bytes: 7119527.0 num_examples: 100 - name: level6 num_bytes: 6821588.0 num_examples: 100 - name: level1 num_bytes: 5519686.0 num_examples: 100 - name: level8 num_bytes: 7321931.0 num_examples: 100 download_size: 58846188 dataset_size: 59104831.0 configs: - config_name: default data_files: - split: level4 path: data/level4-* - split: level3 path: data/level3-* - split: level2 path: data/level2-* - split: level5 path: data/level5-* - split: level9 path: data/level9-* - split: level7 path: data/level7-* - split: level6 path: data/level6-* - split: level1 path: data/level1-* - split: level8 path: data/level8-* ---

数据集信息: 特征: - 问题ID(question_id):数据类型为字符串 - 图像(image):数据类型为图像 - 问题(question):数据类型为字符串 - 答案(answer):数据类型为字符串序列 - 编号(id):数据类型为64位整型 - 许可证(license):数据类型为8位整型 - 文件名(file_name):数据类型为字符串 - COCO链接(coco_url):数据类型为字符串 - 高度(height):数据类型为32位整型 - 宽度(width):数据类型为32位整型 - 拍摄日期(date_captured):数据类型为字符串 - 实例(instance):数据类型为字符串序列 数据划分: - 等级4(level4):占用字节数6411200.0,样本量100 - 等级3(level3):占用字节数6075833.0,样本量100 - 等级2(level2):占用字节数5809247.0,样本量100 - 等级5(level5):占用字节数6579360.0,样本量100 - 等级9(level9):占用字节数7446459.0,样本量100 - 等级7(level7):占用字节数7119527.0,样本量100 - 等级6(level6):占用字节数6821588.0,样本量100 - 等级1(level1):占用字节数5519686.0,样本量100 - 等级8(level8):占用字节数7321931.0,样本量100 下载总大小:58846188字节,数据集总大小:59104831.0字节 配置: - 配置名称:默认配置(default),数据文件: - 等级4拆分:对应数据路径为data/level4-* - 等级3拆分:对应数据路径为data/level3-* - 等级2拆分:对应数据路径为data/level2-* - 等级5拆分:对应数据路径为data/level5-* - 等级9拆分:对应数据路径为data/level9-* - 等级7拆分:对应数据路径为data/level7-* - 等级6拆分:对应数据路径为data/level6-* - 等级1拆分:对应数据路径为data/level1-* - 等级8拆分:对应数据路径为data/level8-*

提供机构:
llizhx
原始信息汇总

数据集概述

数据集特征

  • question_id: 数据类型为字符串。
  • image: 数据类型为图像。
  • question: 数据类型为字符串。
  • answer: 数据类型为字符串序列。
  • id: 数据类型为整数64位。
  • license: 数据类型为整数8位。
  • file_name: 数据类型为字符串。
  • coco_url: 数据类型为字符串。
  • height: 数据类型为整数32位。
  • width: 数据类型为整数32位。
  • date_captured: 数据类型为字符串。
  • instance: 数据类型为字符串序列。

数据集分割

  • level4: 大小为6411200字节,包含100个样本。
  • level3: 大小为6075833字节,包含100个样本。
  • level2: 大小为5809247字节,包含100个样本。
  • level5: 大小为6579360字节,包含100个样本。
  • level9: 大小为7446459字节,包含100个样本。
  • level7: 大小为7119527字节,包含100个样本。
  • level6: 大小为6821588字节,包含100个样本。
  • level1: 大小为5519686字节,包含100个样本。
  • level8: 大小为7321931字节,包含100个样本。

数据集大小

  • 下载大小: 58846188字节。
  • 数据集总大小: 59104831.0字节。

配置文件

  • config_name: default
  • data_files:
    • split: 不同级别的分割对应的路径。
      • path: 数据文件路径,格式为data/level*-*
搜集汇总
数据集介绍
llizhx/sampled_coco2014_100_pink 数据集图片
构建方式
该数据集源自广泛使用的COCO 2014图像标注数据集,经过精细采样与重构,形成专注于视觉问答任务的子集。构建过程中,研究人员从原始数据中筛选出100张图像,并围绕每张图像设计多层次的问答对,涵盖从简单到复杂的认知难度等级。每个样本包含图像、问题、答案序列及丰富的元数据,如实例分割标注、图像文件信息等,确保了数据在视觉与语义维度上的完整性。数据集被划分为9个难度级别(level1至level9),每个级别包含100个样本,通过逐步递增的问题复杂度来模拟人类认知的递进过程。
特点
该数据集的核心特色在于其层次化的问题设计,将视觉问答任务细化为9个递进的认知层级,从基础物体识别到复杂场景推理,为评估模型在不同认知维度上的表现提供了标准化基准。每个样本均保留了COCO原生的实例标注信息,支持细粒度的视觉与语言对齐研究。此外,数据规模虽小但结构精炼,100张图像对应900个精心标注的问答对,兼顾了实验效率与任务挑战性,特别适合用于模型能力的快速诊断与对比实验。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,使用`load_dataset`函数指定配置名`default`即可获取所有9个分片的数据。每个分片对应一个难度级别,用户可根据评测需求选择特定层级进行模型测试。数据加载后以字典形式返回,包含图像、问题、答案序列及元数据字段,适用于视觉问答模型的训练与评估。推荐结合预训练视觉-语言模型进行层级化性能分析,通过对比不同难度下的准确率来洞察模型推理能力的边界。
背景与挑战
背景概述
在视觉与语言交叉领域的研究中,多模态数据集是推动模型理解图像与文本关系的基础。llizhx/sampled_coco2014_100_pink数据集由研究者于近期构建,基于经典的COCO 2014数据集进行采样与扩展,核心研究问题聚焦于如何通过细粒度的图像-问答对来评估多模态模型在复杂场景下的推理能力。该数据集包含100个样本,按九个难度等级(level1至level9)组织,每个等级对应不同的认知复杂度,旨在为多模态对话系统、视觉问答等任务提供基准测试资源。其影响力体现在为小样本学习与难度分层评估提供了标准化数据,促进了模型在真实场景中理解图像细节与语义关联的能力研究。
当前挑战
该数据集所解决的领域问题在于多模态模型在图像理解与语言生成中的一致性挑战,尤其是面对颜色、物体关系等细微特征时,模型易产生语义偏差。构建过程中,研究者需从COCO 2014中筛选出具有特定颜色属性(如粉色)的图像,并生成对应的多样化问答对,这要求人工标注者确保问题与答案的精确匹配,同时平衡各难度等级的样本分布。此外,数据集的规模较小(仅100例),在统计显著性上存在局限,可能影响模型泛化能力的评估,而难度分级的合理性也需通过跨模型验证来确认,以避免主观划分带来的偏差。
常用场景
经典使用场景
该数据集源自COCO 2014的采样子集,专注于视觉问答(VQA)任务,是评估多模态模型在图像理解与自然语言推理能力上的经典基准。其结构包含图像、问题及多候选答案,适用于训练和测试模型对复杂场景的语义解析能力。通过不同难度等级(level1至level9)的分割设计,研究者可系统性地探究模型在渐进式挑战下的表现,从而推动视觉语言联合表征的优化。
实际应用
在实际应用中,该数据集可用于训练智能客服系统中的图像问答模块,例如辅助视障人士通过拍照获取场景描述或物品信息。同时,它支持电商平台中基于用户上传图片的自动问答功能,如识别商品属性或推荐搭配。此外,在安防监控领域,该数据集可帮助构建能够理解监控画面并回答特定查询的智能系统,提升人机交互的便捷性与决策效率。
衍生相关工作
基于该数据集,衍生出一系列经典工作,如分层难度感知的视觉问答模型设计,通过自适应难度调整训练策略提升模型泛化能力。另有研究利用其多答案结构开发了基于投票机制的答案融合算法,显著增强了答案可靠性。此外,该数据集还被用于探索视觉语言预训练模型的零样本迁移能力,推动了如ViLBERT、LXMERT等跨模态架构在细粒度推理任务上的改进,并启发了后续数据集如VQA 2.0的构建理念。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务