mmduet2-training-data
收藏资源简介:
MMDuet2 训练数据(预提取帧)是一个用于视觉问答和视频到文本任务的数据集,语言为英文。该数据集包含预提取的媒体帧,以独立 JPEG 文件、通过视频接口呈现的 JPEG 序列或打包在 HDF5 容器中的 JPEG 帧形式提供。数据分为监督微调(SFT)和强化学习(RL)两部分,每部分都有对应的元数据(JSONL 或 Parquet 文件)和媒体文件(tar 分片)。RL 部分提供两种帧率版本:2秒每帧和1秒每帧。元数据中包含了训练所需的标签和用户轮次信息。媒体文件以未压缩的 tar 包形式存储,因为内部的 JPEG/HDF5 有效载荷已经压缩。请注意,该数据集不包含原始上游视频文件、模型检查点、日志或评估输出,使用时应遵守上游数据集的原始许可证和条款。
MMDuet2 Training Data (Pre-extracted Frames) is a dataset for visual question answering and video-to-text tasks, with language being English. The dataset contains pre-extracted media frames, provided as independent JPEG files, JPEG sequences presented via a video interface, or JPEG frames packed in HDF5 containers. The data is divided into two parts: supervised fine-tuning (SFT) and reinforcement learning (RL), each with corresponding metadata (JSONL or Parquet files) and media files (tar shards). The RL part offers two frame rate versions: 2 seconds per frame and 1 second per frame. The metadata includes labels and user turns required for training. Media files are stored as uncompressed tar packages because the internal JPEG/HDF5 payloads are already compressed. Note that this dataset does not contain original upstream video files, model checkpoints, logs, or evaluation outputs, and users should comply with the original licenses and terms of the upstream datasets.
MMDuet2训练数据(预处理帧)概述
该数据集为MMDuet2模型的本地SFT(监督微调)和GRPO(组相对策略优化)训练运行提供预处理输入。数据以预提取的帧形式呈现,包含三种媒体格式:独立JPEG图片、通过视频接口呈现的JPEG序列,以及打包在HDF5容器中的JPEG帧。
数据布局
数据集按功能划分为元数据、媒体和清单三大类目录:
元数据(metadata/)
metadata/sft/:包含5个SFT JSONL格式的训练文件metadata/rl/:包含RL阶段每秒2帧采样的训练/验证Parquet文件及用户轮次JSONmetadata/rl-1fps/:包含RL阶段每秒1帧采样的训练/验证Parquet文件及用户轮次JSON
媒体(media/)
media/sft/:以tar分片形式存储,需解压至data/datasets/mmduet2-frame/sft/media/rl/:以tar分片形式存储,需解压至data/datasets/mmduet2-frame/rl/media/rl-1fps/:以tar分片形式存储,需解压至data/datasets/mmduet2-frame/rl-1fps/
清单(manifests/)
- 包含打包过程中生成的归档文件及校验和清单
任务类别与语言
- 任务类别:视觉问答、视频到文本生成
- 语言:英语
重要说明
- tar文件有意未压缩,因其JPEG/HDF5载荷本身已为压缩格式
- 原始上游视频文件、模型检查点、训练日志及评估输出不包含在数据集中
- 上游数据集的许可协议和使用条款继续适用于本数据集




