zlab-princeton/Vero-1.6M
收藏资源简介:
该数据集包含多个子配置,主要用于图像理解和视觉语言任务,涵盖图像描述生成、图表OCR(包括图表、表格和图表)、计数与定位搜索等能力。每个子配置包含图像、文本提示(包含角色和内容)、能力标签、奖励模型信息(包括风格和真实值)以及额外元数据(如划分、索引、领域、问题、答案、奖励类型和容差)。数据集适用于训练和评估多模态AI模型,支持多种视觉问答和推理任务。
This dataset includes multiple sub-configurations designed for image understanding and vision-language tasks, covering capabilities such as image captioning, chart OCR (including charts, diagrams, and tables), counting, and grounding search. Each sub-configuration contains images, text prompts (with role and content), ability labels, reward model information (including style and ground truth), and extra metadata (e.g., split, index, domain, question, answer, reward type, tolerance). It is suitable for training and evaluating multimodal AI models, supporting various visual question answering and reasoning tasks.




