遇见数据集

mmduet2-training-data

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

MMDuet2 训练数据(预提取帧)是一个用于视觉问答和视频到文本任务的数据集,语言为英文。该数据集包含预提取的媒体帧,以独立 JPEG 文件、通过视频接口呈现的 JPEG 序列或打包在 HDF5 容器中的 JPEG 帧形式提供。数据分为监督微调(SFT)和强化学习(RL)两部分,每部分都有对应的元数据(JSONL 或 Parquet 文件)和媒体文件(tar 分片)。RL 部分提供两种帧率版本:2秒每帧和1秒每帧。元数据中包含了训练所需的标签和用户轮次信息。媒体文件以未压缩的 tar 包形式存储,因为内部的 JPEG/HDF5 有效载荷已经压缩。请注意,该数据集不包含原始上游视频文件、模型检查点、日志或评估输出,使用时应遵守上游数据集的原始许可证和条款。

MMDuet2 Training Data (Pre-extracted Frames) is a dataset for visual question answering and video-to-text tasks, with language being English. The dataset contains pre-extracted media frames, provided as independent JPEG files, JPEG sequences presented via a video interface, or JPEG frames packed in HDF5 containers. The data is divided into two parts: supervised fine-tuning (SFT) and reinforcement learning (RL), each with corresponding metadata (JSONL or Parquet files) and media files (tar shards). The RL part offers two frame rate versions: 2 seconds per frame and 1 second per frame. The metadata includes labels and user turns required for training. Media files are stored as uncompressed tar packages because the internal JPEG/HDF5 payloads are already compressed. Note that this dataset does not contain original upstream video files, model checkpoints, logs, or evaluation outputs, and users should comply with the original licenses and terms of the upstream datasets.

创建时间:
2026-09-02
原始信息汇总

MMDuet2训练数据(预处理帧)概述

该数据集为MMDuet2模型的本地SFT(监督微调)和GRPO(组相对策略优化)训练运行提供预处理输入。数据以预提取的帧形式呈现,包含三种媒体格式:独立JPEG图片、通过视频接口呈现的JPEG序列,以及打包在HDF5容器中的JPEG帧。

数据布局

数据集按功能划分为元数据、媒体和清单三大类目录:

元数据(metadata/)

  • metadata/sft/:包含5个SFT JSONL格式的训练文件
  • metadata/rl/:包含RL阶段每秒2帧采样的训练/验证Parquet文件及用户轮次JSON
  • metadata/rl-1fps/:包含RL阶段每秒1帧采样的训练/验证Parquet文件及用户轮次JSON

媒体(media/)

  • media/sft/:以tar分片形式存储,需解压至 data/datasets/mmduet2-frame/sft/
  • media/rl/:以tar分片形式存储,需解压至 data/datasets/mmduet2-frame/rl/
  • media/rl-1fps/:以tar分片形式存储,需解压至 data/datasets/mmduet2-frame/rl-1fps/

清单(manifests/)

  • 包含打包过程中生成的归档文件及校验和清单

任务类别与语言

  • 任务类别:视觉问答、视频到文本生成
  • 语言:英语

重要说明

  • tar文件有意未压缩,因其JPEG/HDF5载荷本身已为压缩格式
  • 原始上游视频文件、模型检查点、训练日志及评估输出不包含在数据集中
  • 上游数据集的许可协议和使用条款继续适用于本数据集
搜集汇总
数据集介绍
mmduet2-training-data 数据集图片
构建方式
该数据集是MMDuet2训练流程中精心制备的输入资源,其构建核心在于将原始视频数据转化为机器可解析的帧格式。具体而言,数据以独立JPEG图片、经由视频接口呈现的JPEG序列,或封装于HDF5容器中的帧集形式存储,确保了视觉信息的高保真与高效组织。数据集目录结构分明,分别存放监督微调(SFT)与强化学习(RL)及每秒一帧的RL变体的元数据与媒体文件,其中媒体内容以未压缩的tar分片打包,遵循上游许可协议,并附带校验清单以确保数据完整性。
特点
该数据集最显著的特点是其多模态适配性,统一以帧为基本单元,巧妙规避了原始视频编码差异带来的复杂性,直接服务于视觉问答与视频文本生成任务。其时间粒度覆盖2秒与1秒两种采样率,分别对应不同训练阶段对时序敏感度的需求,展现了设计上的精细与灵活。此外,数据形态的多样性——从独立图像到序列乃至HDF5容器——为不同模型架构提供了便捷的输入接口,而排除原始视频与训练副产品,则使得数据集专注且高效,极具实操价值。
使用方法
使用此数据集时,研究者需先按照目录指引解压相应的tar分片至本地路径,并利用附带的parquet文件与JSON描述构建训练或验证输入。对于SFT任务,可直接加载JSONL条目;RL阶段则需结合用户轮次JSON与对应帧数据,依据其2秒或1秒的采样频率适配模型的时间建模能力。数据集的元数据与媒体文件对应关系清晰,检验清单可用于验证数据完整性,从而确保训练流程的可靠复现。建议在具有强大I/O与计算资源的集群环境中操作,以应对高容量帧数据的处理负载。
背景与挑战
背景概述
MMDuet2训练数据的创建源于多模态大语言模型(MLLMs)在视频理解与时空推理任务中面临的挑战,其研究可追溯至2025年前后由国际顶尖AI研究机构主导的MMDuet系列项目。该数据集以预提取的帧序列为核心载体,将视频内容转化为JPEG帧或HDF5容器格式,旨在为监督微调(SFT)与基于组相对策略优化(GRPO)的强化学习阶段提供标准化训练语料。其设计聚焦于视频问答(VideoQA)与视频到文本生成任务,通过精细划分的元数据(2秒/帧、1秒/帧)与模块化媒体存储结构,支撑了多尺度时序建模的对比实验。该数据集的发布为多模态对齐、长程视频理解等研究提供了高复现性的基准资源,其打包规范(如无压缩tar分片、校验清单)显著提升了大规模分布式训练的工程效率,影响力辐射至诸多后序开源视频理解工作。
当前挑战
该数据集应对的领域挑战包括:视频问答中细粒度时间动态的捕捉难题,即模型需在秒级甚至亚秒级分辨率下关联视觉事件与语义查询,而传统稠密采样易引发计算开销与信息冗余的权衡困境;同时,视频文本对齐需克服跨模态时序漂移,确保语言描述与帧序列的因果一致性。在构建层面,主要挑战涵盖高压缩比视频源向帧级表示的转换过程中保持关键视觉信息保真度,避免JPEG/HDF5封装引入的编解码伪影;海量元数据(如SFT JSONL与RL parquet文件)的版本一致性维护及存根校验,需实现跨存储分区的可追溯性;此外,向上游视频版权许可的合规性要求与多平台数据分布的异构性问题,促使团队设计了分层的媒体/元数据目录架构及无压缩tar打包策略,既规避了重复编码开销,又确保了数据流水线在SFT与GRPO场景下的无缝衔接。
常用场景
经典使用场景
MMDuet2训练数据作为多模态大模型微调阶段的核心语料,最经典的用途在于针对视觉问答与视频-文本到文本任务进行监督微调(SFT)与强化学习优化(如GRPO)。该数据集预先抽取视频关键帧并以JPEG、JPEG序列或HDF5容器形式存储,便于直接输入模型进行训练,从而高效地评估模型对动态视觉内容的理解与生成能力。研究者常利用其SFT的JSONL注释文件与RL阶段的parquet数据,构建标准化的训练管线,实现从静态图像到视频时序语义的跨模态对齐。
实际应用
在实际应用中,MMDuet2训练数据支撑了视频内容自动问答、智能视频摘要及人机交互系统的开发,使模型能够基于连续视觉帧生成精准的文本响应。其预抽取帧的媒体格式适配了工业级训练框架,降低了视频解码的资源开销,便于在云环境中进行规模化模型调优。该数据集还可用于构建视频检索与推荐引擎中的语义理解模块,辅助实现跨模态内容匹配。在诸如自动驾驶场景理解或安防监控事件解析等对时序敏感的实际任务中,训练得到的模型展现出更强的帧间关联推理能力,提升了系统对真实动态环境的适应性与响应速度。
衍生相关工作
该数据集激发了多模态模型针对视频指令跟随与偏好对齐的系列衍生研究,例如基于其RL数据设计奖励模型以优化生成策略的工作,以及利用帧序列构建时序感知自监督预训练任务的研究。衍生工作常借鉴其元数据schema,组织训练集以探索多帧联合编码的效率与效果。此外,该数据集的公开也可催生针对动态视觉场景的跨数据集迁移学习研究,促进通用视觉语言基础模型在视频理解层面的扩展。在评估协议上,相关论文可能引用其提供的训练/验证划分方式以公平对比不同算法,进一步推动了视频多模态领域的研究社区化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务