MCSC
收藏资源简介:
MCSC-Bench是一个用于现实视频制作的多模态上下文到脚本创建的数据集,旨在全面评估脚本创建质量和跨领域泛化能力。数据集包含两个子集:领域内测试集(data1,974个样本)和通用子集(data2,521个样本)。每个样本包含视频帧特征或帧图像、input.json和metadata.json文件。input.json包含每个样本的所有输入,包括交替的视频剪辑ID和帧路径(name_image_list)、视频剪辑库存与持续时间(video_material)、文本参考材料(text_material)和用户指令(instruction)。metadata.json提供额外注释,如无关干扰材料(distractor)和目标视频长度(duration)。领域内测试集提供预提取的Qwen3-VL视觉特征,以safetensors格式存储,包含主视觉表示(post_merger_embeds)、补丁网格维度(image_grid_thw)和多级中间ViT特征(deepstack_feature_00等)。领域外测试集设计用于直接推理,无需预提取特征。数据集仅限学术研究使用,禁止商业用途和再分发,并注重隐私保护和版权合规。
MCSC-Bench is a multimodal context-to-script creation dataset tailored for real-world video production, designed to comprehensively evaluate script creation quality and cross-domain generalization capability. The dataset comprises two subsets: the in-domain test set (data1, 974 samples) and the general subset (data2, 521 samples). Each sample includes video frame features or frame images, as well as the input.json and metadata.json files. The input.json file contains all input contents for each sample, including alternating video clip IDs and frame paths (name_image_list), video clip inventory and duration (video_material), text reference materials (text_material), and user instructions (instruction). The metadata.json file provides additional annotations such as irrelevant distractor materials (distractor) and target video length (duration). The in-domain test set provides pre-extracted Qwen3-VL visual features stored in safetensors format, which include main visual representations (post_merger_embeds), patch grid dimensions (image_grid_thw), and multi-level intermediate ViT features (e.g., deepstack_feature_00 and similar entries). The out-of-domain test set is intended for direct inference without requiring pre-extracted features. The dataset is exclusively for academic research use, with commercial use and redistribution strictly prohibited, and priority is given to privacy protection and copyright compliance.
MCSC-Bench 数据集概述
数据集基本信息
- 数据集名称:MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
- 创建者:Huanran Hu, Zihui Ren, Dingyi Yang, Liangyu Chen, Qixiang Gao, Tiezheng Ge, Qin Jin
- 用途:用于评估视频脚本创作质量与跨领域泛化能力的多模态基准测试。
数据构成
数据集包含两个测试子集:
- 领域内测试集(In-Domain Test set):974个样本(data1),用于全面评估脚本创作质量。
- 通用子集(Out-of-Domain Test set):521个样本(data2),用于测试跨领域泛化能力。
数据内容与格式
通用文件
每个样本均包含以下文件:
input.json:包含每个样本的所有输入信息,具体结构如下:name_image_list:交错的视频片段ID和帧路径列表。video_material:视频片段清单及其持续时间。text_material:文本参考材料。instruction:用户指令。
metadata.json:提供额外标注信息,包括:distractor:指示哪些视频片段是无关的干扰材料。duration:指定目标视频的长度(以秒为单位)。
领域内测试集(data1)特定内容
- 视觉特征:提供预提取的Qwen3-VL视觉特征,以safetensors格式存储,无需原始视频文件或视觉编码器即可进行推理。
- 特征文件结构:
- 特征按样本ID组织,每个样本包含一个
features/目录。 - 视频片段由子目录名称标识(例如
1_1,1_2)。 - 每个片段包含按编号的帧目录(例如
000001,000002)。 - 每个帧目录包含三个文件:
features.safetensors:包含以下张量:post_merger_embeds:视觉编码器(ViT + Merger)的输出,形状为[N, hidden_size],是可直接输入语言模型的主要视觉表示。image_grid_thw:补丁网格维度[1, 3](时间、高度、宽度),用于M-RoPE位置编码。pre_merger_embeds(可选):Merger之前的原始ViT输出,形状为[M, vision_dim]。deepstack_feature_00,deepstack_feature_01, ...:Qwen3-VL的DeepStack机制用于将细粒度视觉特征注入LLM层的多级中间ViT特征。
metadata.json:记录源张量形状、提取设备/数据类型等信息,用于追溯。feature_card.json:完整的可复现性卡片,包括模型配置、提取参数、库版本和特征维度描述。
- 特征按样本ID组织,每个样本包含一个
通用子集(data2)特定内容
- 数据形式:提供来自多个视频片段的帧图像以及结构化的文本输入,设计用于任何多模态大语言模型直接推理,无需预提取特征。
- 文件位置:解压
data2/frames.zip至frames/目录。
模型输入构建方法
遵循input.json中name_image_list的顺序构建图文交错的序列:将片段ID(例如"1.mp4")作为文本标记,并将帧路径(或特征路径)加载为图像(或视觉嵌入)。
许可、伦理与访问条款
- 仅限学术使用:本数据集仅可用于学术研究目的,严格禁止任何商业用途。
- 禁止再分发:未经作者事先书面同意,不得以任何形式重新分发数据集。
- 隐私保护:
- 领域内数据源自经授权的机构访问的淘宝电商视频。
- 所有视觉内容均以通过Qwen3-VL-8B视觉编码器提取的去标识化特征形式发布;出于隐私原因,不分发原始图像或视频。
- 需要替代编码器(例如Qwen2.5-VL)特征的研究人员可联系[huanranhu@ruc.edu.cn]寻求协助。
- 版权与下架政策:
- MCSC-GEN包含从公开可用的YouTube和TikTok视频中采样的帧。视频内容参考Vript数据集进行选择,均源自公共平台。
- 尊重原始来源的个人信息隐私。
- 如果您是版权所有者并认为任何内容侵犯了您的权利,请联系[huanranhu@ruc.edu.cn]。
- 免责声明:
- 用户对使用本数据集所产生的任何法律责任承担全部责任。
- 作者保留随时修改或终止访问的权利,并对因使用本数据集而产生的任何损害不承担责任。




