遇见数据集

ConverSeg-Training-Data

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

ConverSeg训练数据集是一个用于开放词汇和对话式图像分割任务的大规模训练数据集合。数据集包含两个主要阶段:第一阶段(stage1)包含开放词汇区域数据;第二阶段(stage2)进一步细分为对话式负样本数据、对话式正样本数据和开放词汇区域数据。每个子数据集由JSONL清单文件、PNG格式的源图像以及PNG格式的分割掩码组成。JSONL清单中的每一行都包含三个关键字段:指向源图像的相对路径(image)、指向分割掩码的相对路径(mask_merged)以及用于分割的自然语言提示(prompt)。数据集总计包含269,323个数据样本(对应清单行数),涉及大量独立的图像和掩码文件(具体数量见各子集统计)。整个数据集的本地导出大小约为19GB,包含4个JSONL清单文件和超过30万个PNG文件。该数据集专为训练能够理解自然语言提示并进行精确像素级分割的模型而设计,适用于开放词汇分割和对话式分割的研究与开发。

The ConverSeg training dataset is a large-scale training data collection for open vocabulary and conversational image segmentation tasks. The dataset consists of two main stages: the first stage (stage1) includes open vocabulary region data; the second stage (stage2) is further subdivided into conversational negative sample data, conversational positive sample data, and open vocabulary region data. Each sub-dataset comprises JSONL manifest files, source images in PNG format, and segmentation masks in PNG format. Each line in the JSONL manifest contains three key fields: the relative path to the source image (image), the relative path to the segmentation mask (mask_merged), and the natural language prompt for segmentation (prompt). The dataset totals 269,323 data samples (corresponding to the number of lines in the manifest), involving a large number of independent image and mask files (specific counts are provided in each subsets statistics). The entire dataset has a local export size of approximately 19GB, including 4 JSONL manifest files and over 300,000 PNG files. This dataset is designed for training models that can understand natural language prompts and perform precise pixel-level segmentation, suitable for research and development in open vocabulary segmentation and conversational segmentation.

创建时间:
2026-06-03
原始信息汇总

数据集概述

ConverSeg Training Data 是一个用于图像分割任务的数据集,专门面向开放词汇(open-vocabulary)和对话式(conversational)分割场景。数据集划分为两个训练阶段,每个阶段以 JSONL 清单文件配合 PNG 格式的原始图像和分割掩码存储。

任务类型与标签

  • 任务类别:图像分割(image-segmentation)
  • 语言:英语(en)
  • 标签:image-segmentation, conversational-segmentation, open-vocabulary-segmentation, segmentation-masks

数据规模

  • 总行数:269,323 条(每条对应一个提示-掩码-图像的三元组)
  • 图像数量:总计约 33,729 张(各子目录包含独立的图像文件)
  • 掩码数量:总计 269,323 个(与行数对应)
  • 文件类型:4 个 JSONL 清单文件 + 303,052 个 PNG 文件
  • 本地导出大小:约 19 GB

数据集结构

converseg_stage1_data/ open_vocabulary_regions_data/ (开放词汇区域数据,阶段1) open_vocabulary_regions_data.jsonl images/ masks/

converseg_stage2_data/ conversational_negative_data/ (对话负样本数据,阶段2) conversational_negative_data.jsonl images/ masks/ conversational_positive_data/ (对话正样本数据,阶段2) conversational_positive_data.jsonl images/ masks/ open_vocabulary_regions_data/ (开放词汇区域数据,阶段2) open_vocabulary_regions_data.jsonl images/ masks/

清单文件详情

每个 JSONL 文件中的一行包含三个字段:

  • image:源图像相对于阶段目录的路径
  • mask_merged:分割掩码相对于阶段目录的路径
  • prompt:自然语言分割提示
清单文件路径 行数 图像数 掩码数
converseg_stage1_data/open_vocabulary_regions_data/open_vocabulary_regions_data.jsonl 48,529 8,593 48,529
converseg_stage2_data/conversational_negative_data/conversational_negative_data.jsonl 106,125 11,037 106,125
converseg_stage2_data/conversational_positive_data/conversational_positive_data.jsonl 106,127 8,489 106,127
converseg_stage2_data/open_vocabulary_regions_data/open_vocabulary_regions_data.jsonl 8,542 5,610 8,542

补充说明

  • 路径均为相对路径,相对于各自的阶段目录(converseg_stage1_data/converseg_stage2_data/)。
  • 本地导出中未包含许可证信息。
搜集汇总
数据集介绍
ConverSeg-Training-Data 数据集图片
构建方式
ConverSeg-Training-Data数据集面向开放词汇与对话式图像分割任务,采用分阶段构建策略。其数据组织为两个核心阶段:阶段一包含开放词汇区域数据,阶段二则融合了对话式正负样本数据与开放词汇区域数据。每个子集均以JSONL清单文件为核心,记录图像路径、分割掩码路径及自然语言提示,图像与掩码以PNG格式存储。清单路径相对于各自阶段目录,总计生成269,323条数据行,覆盖约19GB的本地存储空间。
特点
该数据集兼具开放词汇与对话式分割的双重特性,通过正负样本的对话式设计增强模型对细粒度语义的理解。四个子清单分别针对不同场景,如阶段一提供基础开放词汇训练,阶段二引入对话上下文中的肯定与否定样本,总图像数超过33,000张,掩码数量高达269,323个。数据规模跨越十万至百万级别,为多模态模型的鲁棒性训练提供了丰富支撑。
使用方法
使用该数据集时,用户需依据JSONL清单文件加载对应的图像与掩码路径。首先解析清单中的image、mask_merged与prompt字段,将图像与掩码读取为张量或数组,并配合prompt作为监督信号进行训练。建议按阶段顺序使用,先以阶段一开放词汇数据预训练模型,再引入阶段二的对话式样本进行精调。注意清单路径是相对于stage目录的,需在代码中正确拼接基础路径。
背景与挑战
背景概述
ConverSeg-Training-Data数据集由研究团队于近期创建,旨在推动开放词汇与对话式图像分割任务的发展。该数据集聚焦于让模型能够依据自然语言提示精确分割图像中的目标区域,突破了传统分割任务受限于预定义类别的瓶颈。通过构建包含约27万条标注样本的多阶段训练数据,ConverSeg-Training-Data为多模态大模型在细粒度视觉理解领域的研究提供了关键支撑,显著提升了模型在开放场景下的泛化能力与交互性,对推动计算机视觉与自然语言处理的交叉融合具有重要影响。
当前挑战
该数据集主要面临两方面的挑战。在领域问题层面,如何使模型同时理解开放词汇的语义并执行精确的像素级分割是核心难点,传统分割方法难以泛化至未见类别或复杂描述。在数据构建过程中,需要精细设计覆盖正负样本的对话式指令,并确保大量图像与掩码的高质量对齐,手动标注成本极高;同时,多阶段数据之间提示风格的差异可能引发训练不稳定,如何平衡各阶段数据的分布以提升模型鲁棒性也是亟待解决的问题。
常用场景
经典使用场景
ConverSeg-Training-Data 数据集专为开放词汇与对话式图像分割任务而设计,其核心应用场景在于训练具备自然语言理解能力的智能分割模型。该数据集提供超过26万条(图像、掩码、提示)三元组,使模型能够根据任意自然语言描述精准定位并分割图像中的目标区域。经典使用方式包括两阶段训练:第一阶段利用开放词汇区域数据进行语义感知的预训练,第二阶段引入正负对话数据,让模型掌握基于交互式对话进行动态分割的能力。这种设计有效弥合了视觉感知与语言指令之间的语义鸿沟。
解决学术问题
该数据集系统性地解决了传统语义分割在类别预设和交互灵活性上的根本局限。传统分割方法通常依赖固定类别集合,无法处理开放世界中任意概念的细粒度分割,而 ConverSeg-Training-Data 通过大规模开放式语言描述与掩码配对,破解了类别依赖的瓶颈。此外,它创新性地引入对话式负样本(如否定与修正指令),让模型学会在含糊或歧义的语言指令下仍能精确收敛到目标区域,攻克了人机交互中自然语言不确定性导致的分割偏差问题。这些突破极大推动了视觉与语言跨模态对齐研究的前沿进展。
衍生相关工作
基于ConverSeg-Training-Data,学术界已衍生出多项具有影响力的经典工作。首先,大规模开放词汇分割模型如 LISA 与 SEEM 均借鉴了其对话式训练范式,通过融入正负样本对学习机制,显著提升了对模糊指令的鲁棒性。其次,研究者受该数据集启发,提出了面向增量学习场景的分割框架,使模型能在不遗忘旧类别的前提下持续学习新概念。此外,结合大语言模型的多轮对话分割模型也以此为训练基石,实现了端到端的视觉对话推理。这些衍生工作共同推动了多模态人机交互从静态指令执行向动态协同理解的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务