遇见数据集

mvp-lab/LLaVA-OneVision-1.5-Mid-Training-85M

收藏
Hugging Face2026-07-16 更新2025-10-25 收录
官方服务:

资源简介:

LLaVA-One-Vision-1.5中期训练85M数据集正在上传中,包括已完成上传的ImageNet-21k、LAIONCN、DataComp-1B等数据集。该数据集是LLaVA-OneVision-1.5项目的一部分,但README文件中未提供详细的数据集描述。

The LLaVA-One-Vision-1.5-Mid-Training-85M dataset is currently being uploaded, including completed datasets such as ImageNet-21k, LAIONCN, DataComp-1B, etc. This dataset is part of the LLaVA-OneVision-1.5 project, but no detailed dataset description is provided in the README file.

提供机构:
mvp-lab
搜集汇总
数据集介绍
mvp-lab/LLaVA-OneVision-1.5-Mid-Training-85M 数据集图片
构建方式
LLaVA-OneVision-1.5-Mid-Training-85M数据集是面向多模态大模型中期训练阶段精心整合的大规模视觉-语言数据集。其构建过程汇聚了多个业界领先的公开数据源,包括ImageNet-21k、LAIONCN、DataComp-1B、Zero250M、COYO700M、SA-1B、MINT以及Obelics,涵盖了从自然图像、中文图文对到分割掩码与网页文档等多样化模态。通过系统化地筛选、清洗与融合这些异构数据,研究者旨在为模型提供丰富且均衡的多模态监督信号,从而强化视觉与语言表征的联合对齐能力。该数据集以Apache-2.0许可协议开放,致力于推动民主化多模态训练生态的发展。
特点
该数据集最显著的特征在于其超大规模的样本容量与跨数据集的多源异构性。汇集约8500万个样本,覆盖了图像分类、图文匹配、目标分割及视觉问答等多种任务场景,为中期训练阶段提供了前所未有的数据广度与深度。数据中融合了中文与英文语料,并整合了从高质量清理图像到原始网络爬取数据的多层次质量分布,有效平衡了数据多样性与训练稳定性。此外,依托LLaVA-OneVision框架的开放性,该数据集在设计时即考虑了与下游模型微调任务的兼容性,成为连接预训练与特定任务精调的关键桥梁。
使用方法
建议研究人员将该数据集作为多模态大模型中期训练的核心数据源,部署于视觉-语言联合表征的继续预训练阶段。使用时,可将其加载为标准的图文对数据集,配合Hugging Face Datasets库进行流式或批量处理。由于数据来源于多个异构子集,推荐根据下游任务需求,按比例混合采样以平衡各数据源的分布偏差。更具体地,该数据可直接用于LLaVA-OneVision系列模型的训练流程,参照配套论文中描述的数据组织与加载策略,实现视觉编码器与语言模型的深度对齐与泛化能力提升。
背景与挑战
背景概述
LLaVA-OneVision-1.5-Mid-Training-85M数据集由Xiang An、Yin Xie等研究团队于2025年创建,旨在推动多模态大模型的民主化训练。该数据集汇集了ImageNet-21k、LAIONCN、DataComp-1B、SA-1B等八个大规模视觉与多模态子集,共计约8500万样本,是LLaVA-OneVision-1.5框架中连接预训练与指令微调的关键中继环节。通过整合多样化的图像描述、分割掩码及多语言文本数据,该数据集着力解决多模态模型在视觉-语言对齐与语义理解上的核心挑战,为开放域多模态研究提供了标准化训练资源,对降低多模态模型构建门槛、提升泛化能力具有重要影响。
当前挑战
该数据集面临的挑战主要体现在两方面。领域问题层面,多模态模型常因视觉与语言模态间语义鸿沟导致跨模态对齐困难、细粒度理解不足,且大规模数据集的噪声和偏差易使模型学习到虚假相关性。构建过程层面,整合来自八个来源、格式各异的子集时,需解决数据标注不一致、分辨率差异及存储格式兼容性问题;同时,从COYO700M、DataComp-1B等海量资源中高效筛选高质量样本、平衡各子集分布以避免长尾效应,并在有限预算下完成85M样本的下载与预处理,均为工程实现带来了显著负担。
常用场景
经典使用场景
LLaVA-OneVision-1.5-Mid-Training-85M数据集汇聚了ImageNet-21k、LAIONCN、DataComp-1B、COYO700M等海量图文数据,专为多模态大语言模型(MLLM)的中间训练阶段设计。其经典使用场景在于为视觉语言模型提供跨领域、多分辨率的对齐训练,通过大规模图文对学习视觉特征与文本语义的深层关联,从而夯实模型从图像识别到复杂视觉推理的基础能力。
衍生相关工作
基于该数据集,研究社区衍生出多项经典工作,包括但不限于探索更优的图文数据混合策略、设计针对中低质量数据的高效清洗与增强方法,以及提出用于评估多模态模型中间训练效果的基准测试。此外,围绕该数据集还催生了关于跨模态对比学习与生成式预训练融合的若干前沿研究,进一步拓展了多模态学习的方法论体系。
数据集最近研究
最新研究方向
LLaVA-OneVision-1.5-Mid-Training-85M数据集整合了ImageNet-21k、LAIONCN、DataComp-1B、COYO700M等多个大规模图像与多模态语料库,标志着多模态大模型在开放、民主化训练路径上的重要迈进。该数据集聚焦于视觉-语言对齐的中期训练阶段,旨在弥合通用视觉表示与特定指令任务之间的鸿沟。当前,围绕该数据集的前沿研究集中于通过混合监督学习提升模型的跨模态泛化能力,并结合众包清洗策略优化数据质量,以缓解噪声标签与长尾分布问题。其发布恰逢多模态模型走向开源与可复现的热点时期,为低资源场景下的多模态系统构建提供了可复用的数据基础,并对推动视觉大模型在复杂场景理解与多轮对话任务中的性能跃迁具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务