遇见数据集

omnivideo-100k-final

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

omnivideo-100k-final是MiG-NJU/OmniVideo-100K数据集的最终处理版本,专为PAB-Spline及全模态视觉语言模型项目构建。该数据集将每个源视频的多种模态信息整合为单条记录,核心内容包括视频语义token、3D人体姿态token、环境音频token以及相关的问答对。数据集共包含5,213条记录,每条记录对应一个通过初步处理的源视频。其中,约15%(784条)的记录包含基于体育视频子集生成的3D姿态信息(<agent>块),而所有记录均包含环境音频信息(<listen>块)和QA对(总计99,983对,含70,017个开放式问题和29,966个多项选择题)。数据格式为每行一个JSON对象,包含video_id和text字段。text字段按24帧/30fps的视频块顺序组织,依次包含视频基础语义token(<seed2>)、视频高级语义token(<cosmos>,训练时按50%概率丢弃)、可选的姿态token(<agent>)以及音频token(<snac>),最后附属于该视频的所有QA对。每个模态token序列均使用明确的边界包装token(如<seed2>/</seed2>)进行标识,为模型提供清晰的模态跨度信号。数据集按分片划分训练集和测试集,使用随机种子42,约6%的数据作为测试集。该数据集适用于训练和理解多模态(视频、姿态、音频、文本)融合的视觉语言模型。

omnivideo-100k-final is the final processed version of the MiG-NJU/OmniVideo-100K dataset, built specifically for the PAB-Spline and full-modal vision-language model projects. This dataset integrates multimodal information of each source video into a single record, with core content including video semantic tokens, 3D human pose tokens, environmental audio tokens, and associated QA pairs. The dataset contains a total of 5,213 records, each corresponding to a pre-processed source video. Of these, approximately 15% (784 records) contain 3D pose information (the "<agent>" block) generated based on the sports video subset, while all records include environmental audio information (the "<listen>" block) and QA pairs, totaling 99,983 pairs, including 70,017 open-ended questions and 29,966 multiple-choice questions. The dataset is formatted as one JSON object per line, containing the "video_id" and "text" fields. The "text" field is organized in the order of video chunks at 24 frames/30fps, sequentially containing basic video semantic tokens (<seed2>), advanced video semantic tokens (<cosmos>, which are discarded with a 50% probability during training), optional pose tokens (<agent>), audio tokens (<snac>), and finally all QA pairs associated with the video. Each modal token sequence is identified with explicit boundary wrapper tokens (e.g., <seed2>/</seed2>), providing clear modal span signals for the model. The dataset is split into training and test sets using random seed 42, with approximately 6% of the data reserved as the test set. This dataset is suitable for training and understanding multimodal (video, pose, audio, text) fused vision-language models.

创建时间:
2026-07-20
原始信息汇总

数据集概述:omnivideo-100k-final

许可证:Apache-2.0

该数据集是 MiG-NJU/OmniVideo-100K 的精炼版本,专门为全模态 VLA(视觉-语言-动作)项目设计,将视频令牌、姿态智能体令牌与问答对融合为每条记录一条视频。

基本规模

  • 总行数:5,213 行(每个源视频对应一行)
  • 包含姿态信息:784 行(约 15%)包含 <agent> 块(3D 姿态数据,共 23,213 个窗口),覆盖体育子集(1,126 个视频)
  • 包含音频信息:全部 5,213 行均包含 <listen> 块(SNAC 环境音频,共 673,940 个音频块)
  • 问答对:全部 5,213 行均附带问答对,总计 99,983 对(70,017 个开放式问答 + 29,966 个多选题)

数据格式

每条记录结构为 {"video_id": ..., "text": ...}text 字段按 24 帧/30fps 的块顺序排列,格式如下:

<seed2> <seed2_N>... </seed2> [<caption> ... </caption>] <cosmos> <cosmos_N>... </cosmos> [<agent> <fps_30> <pelvis> ... </agent>] [<speech> ... </speech>] ...(每块重复)... Q: <问题> A: <答案> Reasoning: <跨模态推理提示> ...(该视频每对问答重复)...

  • <seed2><cosmos><agent> 为显式的跨度边界包装令牌
  • <agent> 块(3D 姿态,自适应 PCHIP 17 关节 xyz 坐标)仅出现在姿态管线产出干净窗口的视频块中,大部分视频没有此块
  • <cosmos_N> 以每块 50% 的丢弃率保留,<seed2_N> 始终保留

令牌总量

  • <seed2_N>:17,225,728 个
  • <cosmos_N>:300,790,624 个
  • 智能体关节令牌:约 7,379,928 个
  • <snac_N>:18,839,901 个

处理管线

  1. Step A:视频原始令牌化(seed2/cosmos/avc_lm)
  2. 扁平化:中间格式保存
  3. 姿态处理(Phase1-4 + Phase5):3D 姿态提取为智能体令牌(仅体育子集)
  4. SNAC 音频令牌化:全数据集 5,213 行音频令牌化
  5. Phase6 合并:将 <agent> 块注入 Step A 流
  6. Phase7 最终化:按 video_id 分组后附加问答对

训练/测试划分

按分片(而非按行)划分,随机种子 42,约 6% 保留为测试集。

搜集汇总
数据集介绍
omnivideo-100k-final 数据集图片
构建方式
OmniVideo-100k-Final数据集的构建基于一套多阶段的精细流水线。首先,通过Step A对原始视频进行种子标记和Cosmos标记的初步分词处理。随后,对运动子集进行三维姿态估计,利用自适应PCHIP插值生成包含17个关节点坐标的智能体令牌。同时,对全部视频执行SNAC音频分词,得到与环境音对齐的令牌序列。最终,通过合并脚本将智能体令牌、音频令牌与视频令牌按24帧段落对齐,并追加从源文件整理的问答对,形成每条记录包含完整多模态令牌序列与问答内容的最终格式。
特点
该数据集的核心特色在于其全模态融合架构,每条记录均整合了视频令牌、环境音频令牌及可选的姿态智能体令牌,并辅以开放式与多项选择混合的问答对。数据集包含5,213条记录,其中15%的条目因运动子集覆盖而包含三维姿态信息,而所有条目均配备音频令牌,共计约67万余个音频片段。令牌构成丰富,涵盖约1700万个种子标记、3亿个Cosmos标记以及约1884万个SNAC音频令牌,为跨模态理解与生成任务提供了高度结构化的数据基础。
使用方法
数据集的使用遵循预定义的结构化文本格式,每条数据包含视频ID与文本字段。文本字段按24帧片段顺序排列,每个片段包裹在明确的模态边界令牌内,如<seed2>、<cosmos>和<agent>,模型可据此区分不同模态的输入。问答部分以“Q:”和“A:”标识,并附有跨模态推理提示。数据已按分片随机划分为训练集与测试集,测试集约占6%,用户可直接加载并用于微调全模态视频语言模型,或提取特定模态的令牌序列进行独立研究。
背景与挑战
背景概述
OmniVideo-100K-final 数据集由南京大学 MiG 实验室于 2026 年构建完成,旨在推动全模态视频-语言-动作联合理解研究。该数据集以 5,213 个视频为核心,融合了视觉令牌、3D 姿态代理令牌、音频令牌及 99,983 个问答对,实现了跨模态信息的统一表征。其核心研究问题在于如何通过结构化令牌序列(如 <seed2>、<cosmos>、<agent>、<snac> 等)实现视频、语音与人体动作的联合建模,为诸如 PAB-Spline 等全模态视觉-语言-动作大模型提供训练基准。作为 FineVideo-VLA 系列的延伸,OmniVideo-100K-final 在视频理解领域具有里程碑意义,其部分覆盖的 3D 姿态数据与全量的音频令牌设计,为细粒度多模态推理任务开辟了新路径。
当前挑战
数据集面临多重挑战。首先,在领域问题层面,现有视频数据集多仅关注视觉与文本的粗粒度对齐,难以处理复杂场景下隐含的人体运动与音频环境信息的联合推理,例如体育动作解析中姿态与语义的同步建模。其次,在构建过程中,全量 5,213 个视频中仅约 15% 因运动检测管道覆盖限制而包含 3D 姿态数据,导致了模态间严重的不平衡性;同时,SNAC 音频令牌与视觉令牌的逐块对齐需精确的时间一致性校验,而源数据中视频时长与分割窗口的差异性(如 24 帧/30fps 的固定分块)增加了数据拼接的复杂度。此外,问答对来源(70K 开放式与 30K 选择题)的跨视频分组与令牌流整合,也考验着数据管道的鲁棒性与可扩展性。
常用场景
经典使用场景
在跨模态学习与视频理解领域,OmniVideo-100K-final凭借其丰富的多模态标注脱颖而出。该数据集将视频、音频、3D姿态以及问答对深度融合于统一序列中,特别适合用于训练能够同时理解视觉、听觉与结构化运动信息的全能型大语言模型。研究者可基于其标准化的token化格式,构建端到端的视频问答与多模态推理基准,评估模型在复杂真实场景下的联合表征能力。经典的训练范式是将每一帧对应的视觉种子、宇宙编码、SNAC音频以及可选的姿态代理令牌拼接为连续输入,再与自由形式或多项选择问答配对,从而迫使模型学习跨模态对齐与因果逻辑推断,由此构成了当前全模态视频语言模型最核心的学习框架。
衍生相关工作
基于OmniVideo-100K-final催生了一系列开创性工作。其与PAB-Spline及FineVideo-VLA等框架的协同演进推动了全模态大语言模型的技术架构革新,研究者借鉴其统一令牌序列的设计思路,提出了能够同时处理图像、语音与运动信号的跨模态训练范式。后续工作探索了在该数据集上对类Qwen等基础模型进行大规模联合微调,显著提升了模型在视频描述、时序推理与动作问答任务上的泛化性能。该数据集亦成为Sports-100K等专项数据集构建的参照基准,其分块融合策略与SNAC音频编码方案被广泛复用,扩展到医疗手术视频分析与机器人动作规划等前沿方向,形成了以全模态序列化为核心的学术研究集群。
数据集最近研究
最新研究方向
该数据集聚焦于全模态视频理解的前沿探索,通过融合视频帧、空间姿态、环境音频与问答推理,构建统一的序列化表示。研究热点集中在多模态对齐与跨模态推理机制的协同演化,尤其是将3D姿态代理令牌与SNAC音频令牌嵌入视频语言模型,推动具身智能体在复杂动态场景中的感知与交互能力。数据集覆盖大量开放域和选择题形式的问答对,为评估模型在细粒度动作理解、时空关联推理及多源信息整合上的表现提供了高标准基准。其部分覆盖的姿态数据设计反映了现实场景中模态不均衡的挑战,促使研究者探索鲁棒的部分模态缺失策略,对推动多模态大模型在体育分析、人机协作等实际应用中的部署具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务