TimeLens2-93K
收藏资源简介:
M3IT是一个用于多模态多语言指令调优的大规模数据集,从现有开源资源中收集整理而成。它包含约260万条图像-文本对,覆盖40个不同的任务类别和26种语言。每个数据样本采用指令-响应对的形式,包括图像、指令文本、输入文本和输出文本。数据集支持多种视觉语言任务,如视觉问答、图像描述、视觉推理、视觉对话和文本到图像生成等。语言多样性是其重要特点,涵盖英语、中文、日语、法语、德语、西班牙语、意大利语、韩语、阿拉伯语、俄语等多种语言。该数据集旨在解决当前指令调优数据集中多语言多模态数据稀缺的问题,为训练和评估多模态大语言模型提供丰富资源,以提升模型在跨语言跨模态任务中的理解和生成能力。
M3IT is a large-scale dataset for multimodal multilingual instruction tuning. It is collected and organized from existing open-source resources, containing approximately 2.6 million image-text pairs, covering 40 different task categories and 26 languages. Each data sample is in the form of instruction-response pairs, including images, instruction text, input text, and output text. The dataset supports various vision-language tasks, such as visual question answering, image captioning, visual reasoning, visual dialogue, and text-to-image generation. Language diversity is one of its key features, encompassing languages like English, Chinese, Japanese, French, German, Spanish, Italian, Korean, Arabic, Russian, and more. The dataset aims to address the scarcity of multilingual multimodal data in current instruction tuning datasets, providing rich resources for training and evaluating multimodal large language models to enhance their understanding and generation capabilities in cross-lingual and cross-modal tasks.
数据集概述:TimeLens2-93K
基本信息
- 数据集名称:TimeLens2-93K
- 许可证:Apache-2.0
- 语言:英语、中文、日语、韩语
- 任务类别:视频-文本到文本(video-text-to-text)
- 数据集规模:10K < n < 100K
数据集规模与组成
- 视频数量:23,793 个
- 文本-时间区间配对数量:93,232 对
- 视频时长范围:从短视频片段到接近 100 分钟的长视频
- 覆盖领域:涵盖娱乐、教育、体育、新闻、科技、游戏、旅行、交通工具、音乐、日常生活等多个网络领域
核心特点
- 长且多样化的视频:视频时长跨度大,覆盖多种真实世界领域
- 多区间标注:当证据在不相交的时刻重复出现时,标注可包含可变数量的时间区间
- 高置信度标签:通过跨智能体一致性验证、语义验证和边界细化等多个质量控制阶段
- 可直接用于训练:提供干净原始标注和多样化多轮 SFT 对话两种格式
数据文件
| 文件路径 | 说明 |
|---|---|
videos/videos-xxxxx-of-00018.tar |
视频存档,分为 18 个分片 |
TimeLens2-93K_raw_annotations.jsonl |
原始文本查询及其时间区间 |
TimeLens2-93K_conversations.jsonl |
多轮 SFT 对话,包含多样化的查询和回答格式 |
标注格式
原始标注格式
每条记录包含一个视频及其所有文本-时间戳标注:
- 字段:
video_id(视频ID)、annotations(标注列表) - 每个标注包含:
text(文本查询)、timestamps(时间区间数组,格式为 [开始秒数, 结束秒数])
对话格式
每条记录包含一个视频及其多轮对话:
- 字段:
video_id(视频ID)、messages(消息列表) - 每条消息包含:
role(角色,user 或 assistant)、content(内容) - 问题和答案使用多种自然语言和时间戳格式
数据集配置
raw_annotations:默认配置,对应TimeLens2-93K_raw_annotations.jsonlconversations:对应TimeLens2-93K_conversations.jsonl




