遇见数据集

zhanglx/TWN-training-data

收藏
Hugging Face2026-05-15 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是Think When Needed(TWN)框架的训练数据,包含1,674,977个训练样本,覆盖25个子集,涉及图像分类、视觉问答、图像-文本检索、视觉文档检索和视频-文本检索等多模态任务。每个样本为查询-正例对,并增强了思维链推理,以支持自适应推理驱动的多模态嵌入学习。数据基于多个源数据集构建,包括MMEB-train、ShareGPTVideo、VisRAG In-domain、VisRAG Synthetic和ViDoRe(ColPali)等。

This dataset is the training data for the Think When Needed (TWN) framework, containing 1,674,977 training samples across 25 subsets spanning multimodal tasks such as image classification, visual QA, image-text retrieval, visual document retrieval, and video-text retrieval. Each sample is a query-positive pair augmented with chain-of-thought reasoning to support adaptive reasoning-driven multimodal embedding learning. The data is constructed on top of multiple source datasets, including MMEB-train, ShareGPTVideo, VisRAG In-domain, VisRAG Synthetic, and ViDoRe (ColPali).

提供机构:
zhanglx
二维码
社区交流群
二维码
科研交流群
商业服务