遇见数据集

DataComp for VLMs (DCVLM)

收藏
arXiv2026-07-01 更新2026-07-04 收录
数据链接:
官方服务:

资源简介:

DCVLM是由多个研究机构联合构建的综合性视觉-语言模型训练基准,旨在系统化研究数据策展策略。该数据集整合了160个公开来源,涵盖图文对、多模态交错文档、纯文本及指令微调数据四种类型,总计包含6万亿多模态tokens,数据来源高度异构且覆盖超过20种语言。其构建过程通过标准化数据池汇集与去污染处理实现,确保训练与评估无重叠。该数据集主要应用于视觉-语言模型的预训练优化研究,重点解决多源数据混合策略、规模扩展效应及跨领域评估标准化等核心问题。

DCVLM is a comprehensive visual-language model training benchmark jointly constructed by multiple research institutions, aiming to systematically investigate data curation strategies. This dataset incorporates 160 public sources, encompassing four data types: image-text pairs, multimodal interleaved documents, plain text, and instruction-tuning data, with a total of 6 trillion multimodal tokens. Its data sources are highly heterogeneous and span over 20 languages. The construction of DCVLM adopts standardized dataset pool aggregation and decontamination processing to eliminate any overlap between training and evaluation datasets. This dataset is primarily utilized for research on pretraining optimization of visual-language models, focusing on addressing core challenges including multi-source data mixing strategies, scaling effects, and cross-domain evaluation standardization.

创建时间:
2026-06-27
搜集汇总
数据集介绍
DataComp for VLMs (DCVLM) 数据集图片
构建方式
DCVLM 数据集的构建遵循严谨的基准测试范式,旨在系统研究多模态大语言模型的数据策展策略。其核心在于构建一个标准化的数据池,该池整合了160个公开可用的数据集,涵盖图像-文本对、多模态交插文档、纯文本数据以及多模态指令微调数据四大类型,共计包含6万亿多模态tokens。研究者在此数据池基础上,通过控制过滤、混合、格式化和采样等策展变量,构建其数据集,随后在固定的模型架构和训练流程下进行训练,从而实现数据策展效果的隔离测量。
特点
DCVLM 数据集最显著的特点在于其提供了一个跨模型规模(1B至8B参数)和训练预算(6.25B至200B tokens)的规模化实验平台。基于超过1000次实验,其研究揭示了一个核心发现:对于现代多模态大语言模型,数据混合比数据过滤更能主导模型性能提升。具体而言,指令微调数据占比较高的混合策略展现出更优的扩展性,且该优势随模型规模和计算预算增加而放大。这使得DCVLM有别于以往仅关注单一数据类型的策展基准。
使用方法
使用DCVLM数据集时,研究者首先从提供的160个源数据池中,通过筛选、混合、格式化和采样等操作,构建出特定的训练集。随后,使用固定的模型架构(如InternViT-300M视觉编码器与Qwen2.5语言模型)和训练流程进行预训练。模型完成预训练后,即可在DCVLM集成的一套包含52个下游基准测试的评估协议中进行评测,该协议涵盖9大能力域,用于全面衡量模型性能。研究者的核心任务在于探索最优的数据策展策略,以获得最佳的下游任务表现。
背景与挑战
背景概述
DataComp for VLMs (DCVLM) 是一个系统化基准,旨在通过可控的数据中心实验改进视觉语言模型(VLM)的训练。该数据集由来自多所顶尖研究机构和大学(如斯坦福大学、剑桥大学、苏黎世联邦理工学院等)的研究人员于近期创建,核心研究问题在于探索如何通过数据筛选、混合、格式化与采样等策略优化VLM预训练数据的质量。DCVLM汇集了160个公开数据集,横跨图像-文本对、多模态交错文档、纯文本和指令微调数据四种类型,构成了6万亿多模态令牌的庞大数据池。该基准允许参与者在1B到8B参数规模的模型以及6.25B到200B令牌的训练预算下测试不同数据策展策略,并通过多达52个下游基准进行全面评估。DCVLM对相关领域产生了显著影响,特别是在揭示了数据混合而非筛选才是构建高质量训练数据集的关键因素方面,为开放VLM数据研究提供了可复现的测试平台。
当前挑战
DCVLM所面临的挑战主要体现在两个方面。首先,在领域问题层面,VLM数据策展面临独特困境:与现代语言模型直接训练原始网络爬取数据不同,现代VLM通常聚合来自多种数据类型的已有数据集,这些数据集已然经历了不同程度的预处理,导致传统基于质量筛选的方法效果甚微。实验发现,在已预筛选的数据池上应用额外过滤带来递减甚至负面的收益,而优化数据混合比例(特别是增加指令微调数据比例)则能在模型规模扩大时产生显著且可扩展的提升。其次,在构建过程中,DCVLM遭遇了多重挑战:不同数据类型与模型规模、训练预算之间的复杂交互使得设计空间过大,难以穷举实验;VLM评估缺乏标准化,不同论文使用各异的基准套件,使得数据集间的公平比较变得困难;此外,构建一个横跨四种数据类型、包含160个数据集并确保无训练-测试重叠的大规模数据池,在技术实现和资源消耗上都构成了严峻考验。
常用场景
经典使用场景
在视觉-语言模型(VLM)的研究领域中,数据集的构建策略长期以来缺乏系统性的评估基准。DCVLM 为研究人员提供了一个标准化的实验平台,使其能够在一个固定的模型架构和训练流程下,专注于探究数据层面的干预措施。该数据集最经典的使用场景是作为受控的数据中心实验平台,研究者可以在此框架内对来自160个不同来源、涵盖图像-文本对、多模态交错文档、纯文本以及指令微调数据的超大规模语料库进行灵活的过滤、混合、格式化和采样策略测试。通过在不同计算规模(从1B到8B参数模型,以及6.25B到200B token预算)上进行实验,DCVLM 使得评估数据策略的扩展性成为可能,从而深刻揭示了数据混合比例而非质量过滤在提升模型性能中的决定性作用。
实际应用
在真实的工业与学术应用场景中,DCVLM 的成果直接指导了高性能视觉-语言模型训练数据集的构建。其产出的基准数据集 DCVLM-BASELINE,通过采纳“指令数据为主”的混合策略(70%指令微调数据、10%图像-文本对等),在8B参数模型、200B token的预算下,于33项核心评测任务上达到了63.6%的平均准确率,显著超越了此前最优的开源训练集FineVision(+5.4个百分点)。值得注意的是,在DCVLM-BASELINE上训练的4B模型,其性能甚至能够媲美在FineVision上训练的8B模型,这相当于实现了约四倍的计算资源节省。这一成果表明,优化数据混合比例是比单纯增加模型参数量或训练数据量更为经济高效的实际路径,尤其适用于计算资源有限的团队。
衍生相关工作
作为数据策展研究的基准平台,DCVLM 催生了一系列探索性工作。在其框架下,研究者们展开了超过一千次受控实验,不仅验证了数据混合比优化(如指令数据与图像-文本数据的比例)对性能的显著影响,还深入探究了数据格式化(如多轮对话格式优于上下文内嵌格式)、合成标注与温度采样等辅助策略的有效性,并发现这些策略在DCVLM框架下的增益有限。此外,基于DCVLM的实验结论,多项后续工作开始关注跨规模的混合优化算法(如基于回归的RegMix方法和基于聚类的Nemotron-CLIMB),旨在自动寻找最优数据混合比。这些衍生工作共同指向一个核心结论:在视觉-语言模型的预训练时代,对于已经过初步策展的数据集,精细的数据混合策略远比繁琐的数据过滤更为有效。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务