遇见数据集

michelecafagna26/hl

收藏
Hugging Face2023-08-02 更新2024-03-04 收录
官方服务:

资源简介:

High-Level (HL)数据集结合了COCO数据集中的对象中心描述和通过众包收集的高层次描述,这些描述围绕三个轴:场景、动作和理由。数据集包含14997张COCO图像和134973条众包描述,每条描述都配有置信度评分,评分越高表示描述越接近常识。数据集支持的任务包括图像字幕生成、视觉问答、多模态文本评分和零样本评估。数据集的创建过程包括从COCO数据集中随机选择图像,并通过Amazon Mechanical Turk进行众包注释。数据集的结构包括图像和两个元数据jsonl文件,其中包含注释信息。数据集的创建者还讨论了数据集的一些局限性,如语法错误等。

High-Level (HL) Dataset combines object-centric descriptions from the COCO dataset with high-level descriptions collected via crowdsourcing, which are structured around three axes: scene, action, and rationale. The dataset contains 14,997 COCO images and 134,973 crowdsourced descriptions, each paired with a confidence score, where a higher score indicates the description is closer to common sense. Supported tasks of this dataset include image captioning, visual question answering (VQA), multimodal text scoring, and zero-shot evaluation. The dataset creation process involves randomly selecting images from the COCO dataset and conducting crowdsourced annotations via Amazon Mechanical Turk. The dataset structure consists of images and two metadata jsonl files that store annotation information. The dataset creators also discussed some limitations of the dataset, such as grammatical errors and other similar issues.

提供机构:
michelecafagna26
原始信息汇总

数据集概述

基本信息

  • 数据集名称:HL (High-Level) Dataset
  • 许可证:Apache-2.0
  • 语言:英语
  • 多语言性:单语种
  • 大小:10K<n<100K

任务与结构

  • 支持的任务
    • 图像到文本
    • 问答
    • 零样本分类
    • 文本评分
  • 数据结构
    • 数据实例:包含图像文件名、场景描述、动作描述、理由描述及对象描述。
    • 数据字段:包括文件名、描述文本、置信度评分、纯度评分和多样性评分。
    • 数据分割:训练集包含13498个实例,测试集包含1499个实例。

数据集创建

  • 来源数据:图像来自COCO,其他描述性数据通过众包方式收集。
  • 注释过程:通过Amazon Mechanical Turk进行众包注释,每个图像由三个不同的注释者进行注释。
  • 注释内容:包括场景、动作和理由的高级描述,每项描述附带一个置信度评分。

使用注意事项

  • 数据质量:部分文本存在语法错误,已由专家进行修正。
  • 版权与许可:图像和对象描述遵循COCO的使用条款,其他注释遵循Apache-2.0许可。

联系方式

  • 联系人:Michele Cafagna
  • 邮箱:michele.cafagna@um.edu.mt
搜集汇总
数据集介绍
michelecafagna26/hl 数据集图片
构建方式
HL数据集的构建根植于视觉与语言交叉领域中对高层次语义理解的迫切需求。该数据集从COCO 2014训练-验证集中精心挑选了14997张包含至少一个行人的图像,以确保对动作和意图的合理推断。通过Amazon Mechanical Turk众包平台,每张图像由三位独立标注者围绕场景、动作和意图三个维度进行开放式描述,每位标注者提供三条标注,最终汇聚成134973条高层次描述。同时,为每条描述额外收集了置信度评分,以区分常识性假设与主观解读。此外,还基于BLEURT和Self-BLEU指标自动计算了纯度与多样性分数,用以量化同一轴内描述的语义相似性与词汇多样性,从而构建了一个多维度、高信息密度的视觉语言资源。
特点
该数据集的核心特色在于其对视觉场景中高层语义的精细刻画。不同于传统数据集聚焦于物体层面的描述,HL数据集引导标注者从场景、动作与意图三个抽象维度进行解读,捕捉人类对图像的整体理解与推理。每条高层次描述均附有独立的置信度评分,使得模型能够区分客观事实与主观假设,增强了数据的鲁棒性与可解释性。此外,数据集还提供了基于语义相似度的纯度分数与基于词汇多样性的多样性分数,为研究者提供了量化描述质量与多样性的工具。整体而言,HL数据集以其多层次、多角度的标注体系,成为连接视觉感知与语言推理的桥梁。
使用方法
该数据集适用于多项视觉与语言任务,包括图像描述生成、视觉问答、多模态文本评分以及零样本评估。使用时,用户可通过HuggingFace数据集加载工具直接获取图像文件名与对应的多层次描述。每条数据实例包含场景、动作、意图三个轴的高层描述及其置信度,以及COCO原有的物体级描述。研究者可基于这些字段设计模型,例如训练模型根据图像生成高层描述,或利用置信度分数进行不确定性建模。数据集已划分为训练集(13498张图像)与测试集(1499张图像),便于进行标准化评估。此外,官方提供了数据集探索器与GitHub仓库,支持进一步的数据分析与定制化处理。
背景与挑战
背景概述
在视觉与语言(V&L)交叉领域,现有数据集如COCO主要聚焦于物体级别的描述,难以捕捉人类对图像的高层语义理解,如场景、动作意图与行为动机。为弥补这一鸿沟,Michele Cafagna等研究者于2023年构建了High-Level(HL)数据集。该数据集从COCO 2014中精选14997幅图像,通过亚马逊土耳其机器人(AMT)众包平台,沿“场景”、“动作”与“理由”三个维度收集了134973条高层描述,每条描述还附带置信度评分,以区分常识性与主观性解读。HL数据集不仅丰富了图像描述的多层次性,还为图像描述、视觉问答及零样本评估等任务提供了宝贵的资源,推动了V&L模型从感知层向认知层的跃迁。
当前挑战
HL数据集所解决的核心领域挑战在于如何系统性地将抽象的高层语义概念(如意图、情境)与视觉信息对齐,超越传统物体级标注的局限。在构建过程中,研究者面临多重挑战:首先,为确保动作与理由描述的有效性,需从COCO中筛选至少包含一个人物的图像,这限制了数据集的覆盖范围;其次,众包标注的质量控制是一大难题,通过预实验、分批次监控及人工审查来减少噪声;此外,标注者普遍出现介词误用、动词变位错误等语法问题,虽然仅5%的样本编辑距离超过10,但仍需专家修正。最后,高层描述的主观性导致置信度评分的一致性难以保证,需通过独立标注者交叉验证来平衡。
常用场景
经典使用场景
HL数据集的核心价值在于将视觉场景与人类高层次认知描述进行对齐,经典使用场景包括图像描述生成、视觉问答与零样本分类任务。研究者可借助该数据集训练模型,从场景、动作和动机三个维度生成超越物体列举的抽象化描述,例如判断图像拍摄地点、主体行为意图及其背后原因。这种多轴标注结构使得模型能够学习到人类对视觉信息的常识性解读,从而提升对复杂场景的理解与表达能力。
衍生相关工作
HL数据集的发布催生了一系列关于视觉常识推理与抽象语义对齐的后续研究。例如,基于该数据集的多模态文本评分任务推动了置信度感知的生成评估方法发展;零样本分类场景中,研究者利用其多轴标注探索了跨模态概念迁移机制。此外,该数据集与COCO的兼容性使其成为评估模型从物体级到事件级语义理解跃迁能力的基准资源,相关成果在自然语言生成与计算机视觉交叉领域产生了广泛影响。
数据集最近研究
最新研究方向
当前,多模态大模型的前沿研究正从浅层的物体识别与描述,向更深层次的场景理解与常识推理迈进。HL数据集正是这一转向的关键推手,它创新性地将COCO数据集的物体级描述,与通过众包获取的关于场景、动作和意图的高层语义描述对齐,为模型提供了超越物理对象的抽象概念学习资源。该数据集的核心价值在于,它通过引入置信度评分来区分常识性假设与主观解读,并利用纯度和多样性指标量化语义与词汇特征,从而为视觉-语言模型在图像描述、视觉问答及零样本评估等任务中,实现更接近人类认知的推理能力提供了坚实的训练与评测基础。这一工作紧密关联着当前大模型在可解释性和多模态常识理解方面的热点,其意义在于推动模型从“看见”向“理解”的质变,为构建真正具备常识推理能力的智能系统铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务