遇见数据集

dcvlm_pool_medium

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

DCVLM-Pool (medium) 是 DataComp-VLM 基准测试的原始候选池,属于 medium 规模版本。该数据集包含约 4.84 亿个样本,总大小约 41.1 TB,涵盖 166 个源数据集,以 WebDataset tar 分片形式存储。数据集未经任何过滤和混合,专为数据策展实验设计,用户可根据需要自行选择过滤器和混合比例来构建训练集。该 medium 池是 small 池的超集,需将两个仓库合并才能获得完整数据。数据内容覆盖多种模态:包括指令数据(含图像和对话)、纯文本数据、图像描述数据以及多模态文档数据。每个样本依据其 data_type 包含不同成员,如对话文件、图像文件、过滤信息 JSON 等。数据集的样本模式支持视觉问答、图像文本理解等任务,适用于多模态大语言模型的数据策展研究。

DCVLM-Pool (medium) is the raw candidate pool of the DataComp-VLM benchmark, belonging to the medium-scale version. The dataset contains approximately 484 million samples, with a total size of about 41.1 TB, covering 166 source datasets, stored in WebDataset tar shards. The dataset is unfiltered and unblended, designed specifically for data curation experiments, allowing users to choose filters and mixing ratios as needed to construct training sets. This medium pool is a superset of the small pool, and merging the two repositories is required to obtain the complete data. The data content covers multiple modalities: including instruction data (with images and dialogues), pure text data, image caption data, and multimodal document data. Each sample includes different members based on its data_type, such as dialogue files, image files, filtering information JSON, etc. The sample schema supports tasks like visual question answering and image-text understanding, suitable for data curation research on multimodal large language models.

创建时间:
2026-07-27
原始信息汇总

DCVLM-Pool (medium) 数据集详情

数据集概述

DCVLM-Pool (medium) 是 DataComp-VLM 基准测试中 medium 规模的原始候选池,包含 483,576,747 个样本 / 41.1 TB 数据,跨越 166 个源数据集,以 WebDataset tar 分片格式存储。该池的规模约为 small pool 的 4 倍,且未经过滤和混合,是数据整理实验的输入而非训练集。用户需自行选择过滤器与混合比例来构建训练集。

存储结构说明

该仓库是 small pool 的增量补充,medium pool 包含 small pool 的完整内容。为避免重复存储约 10 TB 数据,本仓库仅保存 medium 新增的 36,364 个分片(30.8 TB),其余 12,206 个分片(10.3 TB)已在 dcvlm_pool_small 中发布。

位置 分片数 大小
本仓库(medium 新增) 36,364 30.8 TB
small pool 12,206 10.3 TB
完整 medium pool 48,570 41.1 TB

使用方式:下载两个仓库并合并到同一目录。分片索引按源数据集连续编号且不重叠,合并后即为完整的 medium pool。

仓库布局

  • 每个源数据集一个目录,延续 small pool 的分片编号。
  • datacomp_1b 为嵌套目录(分片数超过 Hugging Face 每个目录 10,000 文件限制,按千分桶),下载后需执行扁平化命令。
  • 分片大小因源而异(文本约 20 MB 至交错文档约 4 GB)。
  • 每个源目录携带元数据文件 num_saved_samples.txt,记录该源在完整 medium pool 中的样本数(累计值,非增量值)。合并时用本仓库文件覆盖 small pool 版本,不可相加。

样本格式

每个样本由共享同一 key 的多个 tar 成员组成,根据源的 data_type 分为四类:

data_type 源数量 成员组成
instruction 108 <key>.conversations.txt,一张或多张图片(.jpg),<key>.filters.json
text 33 <key>.conversations.txt<key>.filters.json无图片
captioning 15 <key>.jpg/.webp<key>.txt(说明文字),<key>.json(img2dataset 原始记录),<key>.filters.json
mmdoc 9 位置交错的片段(如 .0.txt.1.jpg.2.txt),需按整数索引排序重建文档,无 conversations.txt

每张图片附带计算产物:<key>.sha256.txt<key>.phash.txt(感知哈希)和 <key>.sscd_disc_mixup.pt(SSCD 拷贝检测嵌入),可用于复现或重做去污染流程。<key>.filters.json 包含每样本的少量标注子集(长度/词元计数)。

命名注意:使用 img2dataset 构建的 captioning 源在产物扩展名前使用双点(如 <key>..phash.txt);relaion-*-unpacked-TEST 目录尽管带 TEST 后缀,仍是普通训练卷。

conversations.txt 格式

对话轮次为 role:value 格式,以 "<EOCL> " 分隔。角色为 humangpt<image> 占位符内联出现,第 N 个 <image> 对应第 N 个图片成员。代码示例展示了如何将文本解析为 ShareGPT 风格对话列表。

加载方式

由于池总量达 41.1 TB,建议逐源下载

  • 使用 snapshot_download 配合 allow_patterns 参数按源下载。
  • 或使用 WebDataset 配合 Hugging Face token 直接流式读取分片。
  • 注意:单个源的完整分片列表需跨越两个仓库(small 和 medium)。
  • 合并时小池的 full_token_sum.txtextracted_percentiles.json 不会被覆盖,它们仅描述 small pool。

引用

该数据集基于论文《DataComp-VLM: Improved Open Datasets for Vision-Language Models》(arXiv:2606.28551)。

搜集汇总
数据集介绍
dcvlm_pool_medium 数据集图片
构建方式
DCVLM-Pool (medium) 是 DataComp-VLM 基准测试中规模为 medium 的原始候选池,包含 483,576,747 个样本,总数据量达 41.1 TB,覆盖 166 个源数据集,以 WebDataset 格式的 tar 分片形式存储。该池为增量构建,仅包含在 small 池基础上新增的 36,364 个分片(30.8 TB),而 small 池中的 12,206 个分片(10.3 TB)需单独下载并合并。每个源目录包含元数据文件(如样本计数),样本结构根据 data_type 分为指令(instruction)、文本(text)、描述(captioning)和交错文档(mmdoc)四种类型,每个样本附带清晰度哈希、感知哈希及 SSCD 嵌入等去重相关的辅助文件。
特点
该数据集的最大特色在于其原始性和灵活性:它完全未经过滤和混合,作为数据整理实验的输入而存在,而非直接用于训练的训练集。研究者可根据需求自定义过滤规则和混合比例,从而构建个性化的训练集。数据集规模宏大,是 small 池的四倍,且样本来源多样,涵盖多语言(如英、中、德、法、日等)和多模态内容。此外,其分片设计支持流式加载,便于在有限存储下按需访问,且提供了详尽的元数据和去重工具,便于复现或改进数据清洗流程。
使用方法
使用该数据集时,首先需下载 small 和 medium 两个仓库并合并分片,注意 datacomp_1b 目录需扁平化处理。推荐按源数据集逐个下载或流式读取,可利用提供的 Python 代码通过 Hugging Face Hub 或 WebDataset 进行加载。样本中的对话采用 'conversations.txt' 文件存储,格式为 '角色:内容' 并以特殊分隔符连接,可解析为 ShareGPT 格式。对于 captioning 类型,需注意文件名中的双点符号等特殊命名规则。数据集的累积样本计数文件应直接覆盖 small 池中的对应文件,而无需相加。
背景与挑战
背景概述
DCVLM-Pool (medium) 是由多机构联合研究团队于2026年提出的 DataComp-VLM 基准的重要组成部分,旨在系统性地探索视觉-语言模型(VLM)数据策展的优化路径。该数据集汇集了来自166个源数据集的约4.84亿个样本,总容量达41.1TB,覆盖多语言、多模态内容,为大规模数据筛选与混合比例的研究提供了原始素材。其核心研究问题在于,如何通过数据策展提升VLM在下游任务上的泛化能力与鲁棒性。作为基准的中间规模版本,该池为研究者提供了灵活的实验平台,对推动开放、可复现的VLM数据研究具有里程碑意义,其发布促进了数据质量与模型性能关系的深入理解。
当前挑战
该数据集所面临的挑战多维且深刻。首先,在领域层面,视觉-语言模型的数据策展面临数据多样性、噪声控制、模态对齐等关键问题,如何在数十亿样本中平衡数据质量与覆盖度,同时避免分布偏差,是提升模型泛化能力的核心难题。其次,在构建过程中,需应对大规模数据存储与传输的工程挑战,如41.1TB的数据分片管理、跨存储库的增量合并,以及确保分片索引不重叠的复杂机制。此外,数据去重与去污染需依赖预计算的感知哈希与SSCD嵌入,计算成本高昂。最后,数据集的异构性要求研究者适配不同的数据模式(如指令、文本、图像描述、多模态文档),增加了预处理与利用的复杂性。
常用场景
经典使用场景
DCVLM-Pool (medium) 作为 DataComp-VLM 基准测试的原始候选池,其经典使用场景在于为视觉-语言模型(VLM)的数据策展研究提供一个大规模、多源、未经过滤的原始数据集合。研究者可基于此池,自主设计并实施数据过滤策略、混合配比方案,进而构建定制化的训练数据集。该池涵盖了指令跟随、纯文本、图像描述及多模态文档等多种数据类型,并提供了丰富的元数据(如感知哈希、SSCD 嵌入等),为系统性探究数据质量对 VLM 性能的影响提供了理想的实验平台。
解决学术问题
该数据集有效解决了视觉-语言模型研究中数据策展过程缺乏标准化、可复现实验平台的问题。相较于直接使用现成训练集,研究者得以剥离数据来源与模型训练的耦合,专注于量化不同过滤规则、去重算法及数据混合比例对模型下游任务性能的因果效应。其大规模的样本量(约4.84亿)和跨166个源数据集的广度,使得关于数据规模、多样性与模型泛化能力之间关系的统计推断成为可能,显著推动了数据-centric AI 领域方法论的发展。
衍生相关工作
该数据集及其基准框架(DataComp-VLM)衍生了一系列关于数据策展策略的对比研究,催生了诸如 'dcvlm-baseline-200b' 和 'dcvlm-balanced-200b' 等参考训练集,作为不同策展路线的具体实例。围绕该池,相关经典工作通常聚焦于对过滤阈值(如基于CLIP分数、图像质量或文本复杂度)的敏感性分析、去重算法(如图像感知哈希与SSCD嵌入)对模型鲁棒性的影响,以及跨源数据混合比例的最优化探索,这些工作共同构成了一个系统化评估数据价值的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务