遇见数据集

zlab-princeton/Vero-1.6M

收藏
Hugging Face2026-06-11 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多个子配置,主要用于图像理解和视觉语言任务,涵盖图像描述生成、图表OCR(包括图表、表格和图表)、计数与定位搜索等能力。每个子配置包含图像、文本提示(包含角色和内容)、能力标签、奖励模型信息(包括风格和真实值)以及额外元数据(如划分、索引、领域、问题、答案、奖励类型和容差)。数据集适用于训练和评估多模态AI模型,支持多种视觉问答和推理任务。

This dataset includes multiple sub-configurations designed for image understanding and vision-language tasks, covering capabilities such as image captioning, chart OCR (including charts, diagrams, and tables), counting, and grounding search. Each sub-configuration contains images, text prompts (with role and content), ability labels, reward model information (including style and ground truth), and extra metadata (e.g., split, index, domain, question, answer, reward type, tolerance). It is suitable for training and evaluating multimodal AI models, supporting various visual question answering and reasoning tasks.

提供机构:
zlab-princeton
搜集汇总
数据集介绍
zlab-princeton/Vero-1.6M 数据集图片
构建方式
Vero-1.6M是一个大规模多模态指令微调数据集,其构建融合了来自多个公开数据源的图像与文本对。数据集以配置(config)形式组织,每个配置对应一个特定的数据源或任务类型,例如图像描述(captioning_IF)、图表OCR(chart_ocr)和计数定位(counting_grounding_search)等。每个样本包含唯一的标识符、数据来源、多轮对话形式的提示(prompt)、能力标签、奖励模型(包括风格和真实值)以及额外信息(如领域、答案、问题和奖励类型)。数据被划分为训练集和验证集,旨在为多模态模型的指令跟随能力提供丰富的训练素材。
特点
该数据集的核心特点在于其多样化的任务覆盖和精细化的结构设计。它整合了超过1.6百万个样本,横跨自然图像描述、图表与表格的理解与OCR、目标计数与定位等视觉语言任务。每个样本均包含结构化的奖励模型信息,支持基于风格和真实值的评估,为可奖励驱动的模型训练提供了基础。此外,数据集的领域标签(domain)和容差参数(tolerance)进一步增强了其在细粒度评估和稳健性训练中的适用性,使其成为多模态指令微调领域的重要资源。
使用方法
使用Vero-1.6M时,可通过HuggingFace Datasets库加载所需的配置(config_name),例如加载'captioning_IF-flickr30k'配置下的训练或验证分片。每个样本中的'image'字段包含图像数据,'prompt'字段以角色-内容对形式存储对话历史,便于直接用于多模态模型的输入格式。研究者可利用'extra_info'中的'question'和'answer'字段进行监督学习,或借助'reward_model'字段进行基于奖励的对齐训练。数据集的模块化设计允许用户按需选择特定任务或来源的子集,灵活适配不同的训练场景。
背景与挑战
背景概述
Vero-1.6M数据集诞生于多模态大语言模型迅猛发展的时代浪潮中,由研究团队于近期构建并公开发布,旨在为视觉语言模型提供大规模、高质量的指令微调数据。该数据集汇聚了来自Flickr30k、CoSyn、ArxivQA、ChartQA、InfographicVQA等十余个知名数据源的图像与问答对,覆盖图像描述、图表理解、计数定位、OCR识别等多维度能力,总计超过160万条样本。其核心研究问题在于如何通过多样化、结构化的指令数据,系统性地提升多模态模型在细粒度视觉感知与复杂推理任务上的表现。Vero-1.6M的出现,为弥补现有数据集在能力覆盖与标注质量上的不足提供了重要资源,对推动多模态领域基础模型的泛化能力与鲁棒性研究具有深远影响。
当前挑战
Vero-1.6M所面对的领域挑战在于多模态大语言模型在细粒度视觉理解与跨域推理任务中的性能瓶颈,尤其是对图表、文档、遥感图像等非自然场景的认知与定位能力仍显薄弱。数据集构建过程面临诸多困难:首先,需从异构数据源中统一格式并确保图像、问答与奖励模型标签的兼容性,涉及海量数据清洗与格式转换;其次,为覆盖计数、定位、OCR等多样化能力,需设计精细的提示模板与奖励机制,避免标注偏差与语义歧义;最后,在超过1.6亿条数据的管理与分割中,如何维持训练集与验证集的分布一致性、避免类别不平衡,成为保证模型评估可靠性的关键挑战。
常用场景
经典使用场景
在视觉与语言交汇的研究领域,Vero-1.6M数据集凭借其海量的多模态指令跟随样本,成为训练和评估多模态大语言模型(MLLM)的标杆性资源。该数据集涵盖了图像描述、图表理解、视觉定位与计数等多样化任务,尤其适用于构建能够精准理解视觉内容并执行复杂指令的智能系统。研究者通常利用其丰富的指令-图像配对数据,对模型进行指令跟随能力的微调,从而提升模型在开放场景下的视觉问答和图像描述生成性能。
实际应用
在实际应用层面,Vero-1.6M所训练的模型可广泛部署于智能客服、辅助视觉系统、教育辅助工具和自动化图表分析平台。例如,基于该数据集微调的模型能够准确回答关于医学影像、地理遥感图像或商业图表的问题,助力文档智能化处理和无障碍技术开发。此外,其在视觉定位任务上的卓越表现,使得机器人导航和增强现实(AR)系统中的物体识别与交互变得更加精准可靠。
衍生相关工作
Vero-1.6M的出现催生了多项具有里程碑意义的后续工作。一方面,研究者基于其统一的指令跟随格式,开发了如LLaVA、InstructBLIP等先进的多模态对话模型,验证了大规模指令数据对模型性能的增益。另一方面,该数据集的分层奖励模型结构启发了后续关于偏好对齐和人类反馈强化学习(RLHF)在多模态场景下的探索。此外,针对其图表OCR与定位子集,衍生出如ChartLlama等专门面向图表推理的模型,推动了领域任务的精细化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务