遇见数据集

dcvlm_pool_small

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

DCVLM-Pool (small) 是 DataComp-VLM 基准测试中 small 规模的原始候选数据池。这是一个大规模、多模态、多语言的数据集合,旨在为视觉语言模型(VLM)的训练数据筛选和混合实验提供原始输入。数据集包含来自 166 个不同源数据集的 120,940,134 个样本,总计约 187.5B tokens,数据量约 10.3 TB,以 WebDataset tar 分片格式组织。数据集内容未经任何筛选或混合,并非可直接用于训练的数据集,而是作为数据管理流程的起点。用户需要根据自身需求,结合单独发布的包含丰富注释(如质量、对齐度、语言、去重、困惑度等约170个字段)的数据集进行筛选和配比,以构建自定义的训练集。数据样本根据源数据的类型分为四种模式:instruction(包含对话文本和一张或多张图像)、text(仅包含对话文本)、captioning(包含图像及其标题)和 mmdoc(包含位置交错的文本和图像文档片段)。每个样本通常包含对话文本文件(conversations.txt)、图像文件(.jpg/.webp)以及包含基础注释的 filters.json 文件。对话文本采用 role:value 格式,由 <EOCL> 分隔,其中 <image> 占位符指向对应的图像成员。数据集适用于视觉问答、图像描述生成、多模态对话等视觉语言建模任务的训练数据构建与研究。

DCVLM-Pool (small) is the raw candidate pool for the small scale in the DataComp-VLM benchmark. It is a large-scale, multimodal, multilingual dataset collection designed to provide raw input for filtering and mixing experiments in training data for Vision-Language Models (VLMs). It contains 120,940,134 samples from 166 different source datasets, totaling approximately 187.5B tokens with a data volume of about 10.3 TB, organized in WebDataset tar shards. The dataset content is unfiltered and unmixed, not directly usable for training, but serves as a starting point for data management workflows. Users need to filter and mix based on their own requirements, using a separately released dataset with rich annotations (such as quality, alignment, language, deduplication, perplexity, etc., about 170 fields) to build custom training sets. Samples are categorized into four modes based on source data types: instruction (containing conversational text and one or more images), text (containing only conversational text), captioning (containing images and their captions), and mmdoc (containing interleaved text and image document fragments). Each sample typically includes a conversation text file (conversations.txt), image files (.jpg/.webp), and a filters.json file with basic annotations. The conversation text uses a role:value format separated by <EOCL> , where the <image> placeholder points to corresponding image members. The dataset is suitable for building and researching training data for vision-language modeling tasks such as visual question answering, image captioning, and multimodal dialogue.

创建时间:
2026-07-27
原始信息汇总

数据集概述

  • 数据集名称: DCVLM-Pool (small)
  • 发布机构: mlfoundations
  • 许可协议: 其他(未具体指定)
  • 数据集规模:
    • 样本数:120,940,134
    • 总token数:约187.5B
    • 总存储:10.3 TB
    • 数据源数量:166个
    • 分片数量:12,206个WebDataset tar分片
  • 任务类型: 图像-文本到文本、视觉问答
  • 语言: 包含英语、中文、德语、法语、日语、韩语、拉丁语、芬兰语、他加禄语、保加利亚语、西班牙语、荷兰语等多种语言
  • 标签: webdataset、多模态、视觉-语言、datacomp
  • 查看器: 不支持

数据组成与结构

  • 原始候选池: 本数据集是DataComp-VLM基准测试中“小”规模下的原始候选池,未经任何过滤或混合,是数据筛选实验的输入。
  • 仓库布局: 平坦结构,每个源数据集对应一个目录,目录内包含多个tar分片(如datacomp_1b/包含4,310个分片,flanv2/包含1,241个分片,ai2d/仅1个分片等)。每个源目录还附带三个元数据文件:
    • num_saved_samples.txt:该源的样本数
    • full_token_sum.txt:该源的总多模态token数
    • extracted_percentiles.json:每个注释字段的十分位数,用于便捷选择过滤阈值

样本模式

每个样本由一组共享键名的tar成员组成,根据源数据的data_type字段分为四种类型:

数据类型 数据源数量 成员组成
instruction 108 conversations.txt、一个或多个图像(.jpg)、filters.json
text 33 conversations.txtfilters.json(无图像)
captioning 15 图像(.jpg/.webp)、标题(.txt)、原始记录(.json)、filters.json
mmdoc 9 位置交错的分段:如.0.txt.1.jpg.2.txt等,按整数索引排序重组文档
  • 每条图像旁还附带以下计算产物:.sha256.txt.phash.txt(感知哈希)、.sscd_disc_mixup.pt(SSCD拷贝检测嵌入)。
  • filters.json 包含样本级注释子集(长度/token计数)。完整注释集在单独的注释仓库中。
  • conversations.txt 格式:每轮对话以"<EOCL> "分隔,格式为role:value,角色包括humangpt<image>占位符指向对应位置的图像。

使用与加载

  • 加载方式:建议逐个源下载,或直接通过URL流式读取分片。支持使用huggingface_hubsnapshot_downloadwebdataset库。
  • 数据集筛选:可拉取对应的注释文件(dcvlm_pool_small_annotations),根据170+个注释字段(质量、对齐、语言、去污染、困惑度等)进行阈值过滤,仅保留需要的样本键名,无需重新计算任何指标。

引用

bibtex @article{farina2026datacomp, title={DataComp-VLM: Improved Open Datasets for Vision-Language Models}, author={Farina, Matteo and Udandarao, Vishaal and Nguyen, Thao and Kuzucu, Selim and B{"o}ther, Maximilian and Hochlehnert, Andreas and Ghosh, Adhiraj and Nezhurina, Marianna and Roth, Karsten and Struber, Joschka and others}, journal={arXiv preprint arXiv:2606.28551}, year={2026} }

搜集汇总
数据集介绍
dcvlm_pool_small 数据集图片
构建方式
DCVLM-Pool (small) 是为 DataComp-VLM 基准测试所构建的原始候选池,旨在为数据策展实验提供未经任何过滤或混合处理的初始输入。该池汇聚了源自 166 个数据集的 120,940,134 个样本,涵盖多种数据类型,包括指令、纯文本、图像描述及多模态文档,并以 WebDataset 格式存储为 12,206 个 tar 分片。每个样本依据其来源的数据类型,以不同的成员组合存储在 tar 文件中,并附带 SHA256、感知哈希及 SSCD 嵌入等计算产物,便于研究者复现或自定义去污流程。
使用方法
鉴于数据集规模达 10.3 TB,推荐按来源目录逐一加载,以避免一次性拉取全量数据。用户可通过 huggingface_hub 的 snapshot_download 函数指定模式过滤,或利用 WebDataset 库直接从远程流式读取分片。为进行数据策展,建议同步拉取对应的标注仓库,依据标注字段(如图像去污评分、文本重叠检测)设定阈值,筛选出符合条件的样本键。示例代码展示了如何结合标注与 WebDataset 的选择功能,构建自定义训练子集,如复现基线数据集中的去污逻辑。
背景与挑战
背景概述
在视觉语言模型(VLM)迅猛发展的当下,数据质量已成为决定模型性能的核心瓶颈。2026年,由Matteo Farina、Vishaal Udandarao等来自多个研究机构的研究者发布了DataComp-VLM基准,旨在系统性地探究多模态数据筛选策略对模型训练的影响。作为该基准的核心资源,DCVLM-Pool Small数据集包含了约1.2亿个样本,横跨166个源头数据集,覆盖英文、中文、法文等多语种指令、图文配对及交错文档等多种模态格式。该数据集并非一个即用型训练集,而是一个未经过滤与混合的原始候选池,旨在为数据筛选实验提供标准化的输入平台。通过提供超过170种预计算注释字段,DCVLM-Pool Small为研究社区提供了探究数据质量、对齐度、语言分布与去污染等维度对VLM性能影响的实验基础,显著推动了开放多模态数据建设的方法论进展。
当前挑战
DCVLM-Pool Small面临的首要挑战在于所解决的领域问题——如何在海量多源异构数据中构建高效的筛选与混合策略。视觉语言数据的异质性极强,不同源数据的质量参差不齐,且存在风格偏移、多语言不平衡、内容重复与评测污染等问题,这使得设计通用且鲁棒的数据筛选管线变得异常困难。此外,数据集构建过程本身亦充满挑战:总计10.3 TB的数据被分存为12,206个tar分片,每个源目录在样本数量、文件大小与元数据格式上差异显著,且部分源数据为多轮对话或位置交错文档,对样本解析与注释对齐提出了高要求。研究者还需处理来自不同工具链(如img2dataset)导致的命名不一致问题,以确保注释与数据之间精确的一对一匹配,从而支撑可复现的数据筛选实验。
常用场景
经典使用场景
DCVLM-Pool Small数据集作为DataComp-VLM基准测试的原始候选池,其核心使用场景在于为多模态数据策展实验提供未经筛选的输入材料。研究者可利用该数据库中的约1.2亿条样本,涵盖图像-文本描述、多轮对话、指令跟随及交错文档等丰富格式,自由设计并评估各类数据过滤策略与混合比例。该数据集的设计哲学强调灵活性与可复现性,其所有过滤标注信息均独立发布,使得用户无需重新计算即可直接基于170余种质量、对齐、语言及去污染等维度的评估指标,精准定制符合特定研究需求的训练子集。这一特性使其成为探索数据质量对视觉语言模型性能影响机制的理想平台。
解决学术问题
该数据集系统性地解决了视觉语言模型训练中数据来源混杂、质量参差且缺乏统一比较基准的学术困境。通过对来自166个源数据集的海量样本提供标准化存储与细粒度标注,DCVLM-Pool Small使研究者能够剥离数据策展环节的变量影响,准确量化不同过滤阈值和混合策略对模型在下游任务中表现的真实贡献。其核心意义在于建立了一个可重复、可扩展的数据策展实验范式,推动领域从依赖直觉的粗放式数据筛选转向基于实证的精细化优化,最终为构建更高效、更鲁棒的开源视觉语言模型奠定了方法论基础。
实际应用
在实际应用中,该数据集可作为构建高性能多模态模型的训练数据生产流水线的起点。从业者能够利用其开放的标注信息,结合业务场景需求(如低资源语言支持、特定领域视觉问答或安全内容过滤),自主设计筛选管道生成定制化训练集。例如,通过语言去污染阈值控制避免评估数据泄漏,或通过图像质量与文本对齐分数的联合筛选提升指令跟随数据的有效性。这种可定制性使得该数据集尤其适用于工业界在资源受限条件下快速迭代高质量训练数据,同时为学术机构复现和比较最新数据策展方法提供了标准化参考基准。
数据集最近研究
最新研究方向
DCVLM-Pool (small)作为DataComp-VLM基准测试的原始候选池,汇聚了来自166个来源数据集的约1.21亿样本,成为多模态视觉-语言模型数据策展研究的核心实验平台。该数据集为探索数据过滤策略提供了前所未有的交互式环境,使研究者能够基于其配套发布的约170个标注字段(涵盖质量、对齐、语言、去污染、困惑度等多维度指标)自主设计过滤管线与混合比例,而非被动接受预训练集。当前前沿方向聚焦于利用这些丰富元数据进行精细化数据筛选与去污染实验,以提升视觉-语言模型的训练效率与鲁棒性,推动多模态数据集构建从手工整理向自动化、可复现的科学范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务