zhanglx/TWN-training-data
收藏资源简介:
该数据集是Think When Needed(TWN)框架的训练数据,包含1,674,977个训练样本,覆盖25个子集,涉及图像分类、视觉问答、图像-文本检索、视觉文档检索和视频-文本检索等多模态任务。每个样本为查询-正例对,并增强了思维链推理,以支持自适应推理驱动的多模态嵌入学习。数据基于多个源数据集构建,包括MMEB-train、ShareGPTVideo、VisRAG In-domain、VisRAG Synthetic和ViDoRe(ColPali)等。
This dataset is the training data for the Think When Needed (TWN) framework, containing 1,674,977 training samples across 25 subsets spanning multimodal tasks such as image classification, visual QA, image-text retrieval, visual document retrieval, and video-text retrieval. Each sample is a query-positive pair augmented with chain-of-thought reasoning to support adaptive reasoning-driven multimodal embedding learning. The data is constructed on top of multiple source datasets, including MMEB-train, ShareGPTVideo, VisRAG In-domain, VisRAG Synthetic, and ViDoRe (ColPali).



