SI-Lab/StepCountQA-SFT
收藏资源简介:
StepCountQA-SFT是一个多模态的监督微调数据集,专门用于视觉对象计数,并包含逐步推理。该数据集基于PixMo-Count和PixMo-Points构建,用于微调视觉语言模型(如Qwen2.5-VL)进行视觉计数和链式推理。数据集包含1,005,633个训练条目,格式为ShareGPT格式(系统→人类→GPT),每个条目包含一个嵌入式JPEG图像。数据集的大小约为226 GB,计数范围分布为0-5(约400K条目)、6-10(约205K条目)和11-50(约400K条目)。数据集遵循ODC-BY-1.0许可证。
StepCountQA-SFT is a multimodal supervised fine-tuning (SFT) dataset for visual object counting with step-by-step reasoning. Built from PixMo-Count and PixMo-Points, it is used to fine-tune vision-language models (e.g., Qwen2.5-VL) on visual counting with chain-of-thought reasoning. The dataset contains 1,005,633 training entries in ShareGPT format (system → human → gpt), each with an embedded JPEG image. The dataset size is approximately 226 GB, with count range distributions of 0–5 (~400K entries), 6–10 (~205K entries), and 11–50 (~400K entries). The dataset is licensed under ODC-BY-1.0.




