遇见数据集

TimeLens2-93K

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

M3IT是一个用于多模态多语言指令调优的大规模数据集,从现有开源资源中收集整理而成。它包含约260万条图像-文本对,覆盖40个不同的任务类别和26种语言。每个数据样本采用指令-响应对的形式,包括图像、指令文本、输入文本和输出文本。数据集支持多种视觉语言任务,如视觉问答、图像描述、视觉推理、视觉对话和文本到图像生成等。语言多样性是其重要特点,涵盖英语、中文、日语、法语、德语、西班牙语、意大利语、韩语、阿拉伯语、俄语等多种语言。该数据集旨在解决当前指令调优数据集中多语言多模态数据稀缺的问题,为训练和评估多模态大语言模型提供丰富资源,以提升模型在跨语言跨模态任务中的理解和生成能力。

M3IT is a large-scale dataset for multimodal multilingual instruction tuning. It is collected and organized from existing open-source resources, containing approximately 2.6 million image-text pairs, covering 40 different task categories and 26 languages. Each data sample is in the form of instruction-response pairs, including images, instruction text, input text, and output text. The dataset supports various vision-language tasks, such as visual question answering, image captioning, visual reasoning, visual dialogue, and text-to-image generation. Language diversity is one of its key features, encompassing languages like English, Chinese, Japanese, French, German, Spanish, Italian, Korean, Arabic, Russian, and more. The dataset aims to address the scarcity of multilingual multimodal data in current instruction tuning datasets, providing rich resources for training and evaluating multimodal large language models to enhance their understanding and generation capabilities in cross-lingual and cross-modal tasks.

创建时间:
2026-07-12
原始信息汇总

数据集概述:TimeLens2-93K

基本信息

  • 数据集名称:TimeLens2-93K
  • 许可证:Apache-2.0
  • 语言:英语、中文、日语、韩语
  • 任务类别:视频-文本到文本(video-text-to-text)
  • 数据集规模:10K < n < 100K

数据集规模与组成

  • 视频数量:23,793 个
  • 文本-时间区间配对数量:93,232 对
  • 视频时长范围:从短视频片段到接近 100 分钟的长视频
  • 覆盖领域:涵盖娱乐、教育、体育、新闻、科技、游戏、旅行、交通工具、音乐、日常生活等多个网络领域

核心特点

  1. 长且多样化的视频:视频时长跨度大,覆盖多种真实世界领域
  2. 多区间标注:当证据在不相交的时刻重复出现时,标注可包含可变数量的时间区间
  3. 高置信度标签:通过跨智能体一致性验证、语义验证和边界细化等多个质量控制阶段
  4. 可直接用于训练:提供干净原始标注和多样化多轮 SFT 对话两种格式

数据文件

文件路径 说明
videos/videos-xxxxx-of-00018.tar 视频存档,分为 18 个分片
TimeLens2-93K_raw_annotations.jsonl 原始文本查询及其时间区间
TimeLens2-93K_conversations.jsonl 多轮 SFT 对话,包含多样化的查询和回答格式

标注格式

原始标注格式

每条记录包含一个视频及其所有文本-时间戳标注:

  • 字段:video_id(视频ID)、annotations(标注列表)
  • 每个标注包含:text(文本查询)、timestamps(时间区间数组,格式为 [开始秒数, 结束秒数])

对话格式

每条记录包含一个视频及其多轮对话:

  • 字段:video_id(视频ID)、messages(消息列表)
  • 每条消息包含:role(角色,user 或 assistant)、content(内容)
  • 问题和答案使用多种自然语言和时间戳格式

数据集配置

  • raw_annotations:默认配置,对应 TimeLens2-93K_raw_annotations.jsonl
  • conversations:对应 TimeLens2-93K_conversations.jsonl
搜集汇总
数据集介绍
TimeLens2-93K 数据集图片
构建方式
TimeLens2-93K 是一个面向长视频时间定位任务的大规模数据集,其构建过程贯穿了精细化的质量控制策略。该数据集整合了23,793个视频与93,232组文本-时间区间对,视频时长从短片段延伸至近100分钟,覆盖娱乐、教育、体育、科技、游戏等多个真实世界领域。注释构建不仅支持单时间段定位,更设计了多时间段标注方案,以应对视频中证据片段重复出现于不连续时间点的情况。为确保标签高度可信,构建流程融合了跨智能体一致性校验、语义验证以及边界细化多重审查阶段,从而大幅提升注释的鲁棒性与准确性。最终,数据集以两种格式发布:一类为简洁的原始注释,另一类则构建为面向指令微调的多轮对话数据,注入多样化的查询表述、答案语法与时间戳表示方式。
使用方法
用户可通过 HuggingFace Datasets 库便捷加载本数据集。原始注释配置可直接调用 load_dataset('MCG-NJU/TimeLens2-93K', split='train') 获取,每行包含视频ID及所有文本-时间戳注释对;对话配置则需指定配置名 conversations,即 load_dataset('MCG-NJU/TimeLens2-93K', 'conversations', split='train'),获取多轮指令微调格式数据。视频文件以18个分卷压缩包形式提供,可通过 hf download 命令下载至本地目录,命令示例为:hf download MCG-NJU/TimeLens2-93K --repo-type dataset --include 'videos/*.tar' --local-dir TimeLens2-93K。此设计兼顾了数据访问的灵活性与存储管理的便利性,适用于训练与评估流程的集成。
背景与挑战
背景概述
TimeLens2-93K是由南京大学媒体计算组(MCG-NJU)于近期构建的大规模长视频时序定位数据集,包含23,793段视频与93,232条文本-时间区间对,视频时长从短片延伸至近100分钟,覆盖娱乐、教育、体育、新闻、科技、游戏、旅行、车辆、音乐及日常生活等广泛网络领域。该数据集的核心研究问题在于推动通用视频模型从短时片段理解迈向长时序检索与可验证证据回溯,其创新性地引入了多跨度标注机制,允许同一查询对应多个离散时间区间,并经过交叉验证与边界细化等多重质量控制流程,旨在为训练能够灵活响应多种定位指令的通用视频基础模型提供坚实的数据基石,对视频理解领域中时序定位任务的范式演进具有深远影响。
当前挑战
该数据集所解决的领域挑战主要源于长视频时序定位的固有复杂性:现有模型多聚焦于处理数十秒的短片段,而对长达分钟级甚至小时级视频中离散重复事件(多跨度)的精准捕获能力不足,且不同指令风格与时间戳格式间的泛化迁移成为瓶颈。在构建过程中,面临的挑战包括:海量长视频的采集与高效存储,及如何从多样化的网络视频中确保领域覆盖的均衡性;多跨度标注的标注员协同难题,即同一事件在视频中多次出现时需避免遗漏或重复;以及质量控制环节中的语义验证与边界精修,需设计跨代理一致性检查机制以消除噪声,同时保证训练数据兼容原始标注与多轮对话格式,从而兼顾任务专用性与指令微调的通用性。
常用场景
经典使用场景
TimeLens2-93K作为大规模长视频时序定位数据集,其最具代表性的应用场景在于训练能够精准检索长时域内事件片段的通用视频模型。具体而言,研究者利用其提供的93,232个文本-时间区间对,涵盖从数十秒至近百分钟的视频跨度,推动模型在娱乐、教育、体育、科技等多样化的网络领域视频中,依据自然语言描述定位单个或多个不连续的时间证据片段。该数据集通过设计交叉智能体验证与边界优化策略,确保了标注的高置信度,从而为视频时序理解任务提供了可靠的训练基础。
解决学术问题
该数据集有效解决了现有视频时序定位研究中普遍存在的两大瓶颈:一是视频长度受限,多数公开数据集仅支持短片段(通常数分钟以内),难以反映真实世界中视频时长复杂多变的特点;二是标注形式单一,通常仅包含单一时间区间,忽略了事件可能在视频中多次重复出现的真实场景。TimeLens2-93K通过提供时长近100分钟的视频及多时间跨度标注,使得研究者能够探索长视频下的时序定位模型泛化能力,并推动构建能够返回可审计证据、适应多样化指令格式的通用视频理解系统,对推动该领域从实验室短场景走向实际长视频应用具有重要的学术价值。
实际应用
在实际应用层面,TimeLens2-93K可直接服务于智能视频内容管理系统和交互式问答平台。例如,在教育视频中,用户可以通过自然语言查询快速定位特定知识点讲解片段;在体育赛事回放中,检索具有关键动作的多个得分时刻;在新闻档案中,高效提取某一事件在整部纪录片中出现的所有时间点。此外,该数据集还支持多轮对话格式的监督微调,可用于构建诸如视频助手、智能监控回放系统等产品,使得用户能够以交互式的方式完成从模糊描述到精确时间戳的检索任务,极大提升了视频内容的可访问性与使用效率。
数据集最近研究
最新研究方向
TimeLens2-93K数据集聚焦于长视频时序定位的前沿探索,其大规模、多跨度标注和严格质量审核机制,为构建通用视频模型提供了坚实基石。该数据集涵盖娱乐、教育、体育等多元领域,视频时长从短片延伸至近100分钟,重点攻克长时序中多段证据的精准检索与时间边界判定。当前研究热点包括利用该数据集训练具备跨指令泛化能力的视频基础模型,推动从简单时间戳记忆向可审计、可迁移的时序推理演进,这对视频理解在智能视频摘要、内容审核及长期事件追溯等现实应用中的突破具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务