MovieStory101
收藏资源简介:
MovieStory101数据集包含3分钟长的视频片段,每个片段附有详细的描述、对应的演员列表和带有角色名称的字幕。
The MovieStory101 Dataset contains 3-minute-long video clips, each of which is accompanied by a detailed description, a corresponding cast list, and subtitles with character names.
StoryTeller 数据集概述
简介
StoryTeller 是一个用于生成长视频密集描述的系统,结合了低级视觉概念和高级剧情信息。该系统使用多模态大语言模型,整合视觉、音频和文本模态,进行音频-视觉角色识别,以增强视频描述的一致性。
框架
StoryTeller 的框架包括三个主要模块:
- 视频分割:将长视频分割成秒级的独立且内部完整的片段。
- 音频-视觉角色识别:使用音频和视觉线索识别每个对话线的角色。
- 描述生成:为每个短片段生成详细描述,最终生成整个长视频的连贯和一致的叙事。
数据集
标注数据
- 字幕:
data/raw_data/caption.json - 音频分割:
data/raw_data/diarization.json - 数据集划分:
data/raw_data/split.json - 每个片段的主要演员:
data/raw_data/ref_actor - 电影问答:
data/raw_data/movie_qa.jsonl
视频文件
数据集包含5,210个训练片段、140个开发片段和632个测试片段。视频文件可通过申请访问权限获取。
数据处理步骤
-
生成帧和音频文件:
- 输入视频路径:
data/video - 输出帧路径:
data/frame - 输出音频路径:
data/audio
- 输入视频路径:
-
视频片段分割:
- 通过自动场景变化检测将3分钟视频片段分割成小段,结果存储在
data/raw_data/scene_detect。 - 最终分割文件存储在
data/scene_detect/scene_split_new.json。
- 通过自动场景变化检测将3分钟视频片段分割成小段,结果存储在
-
生成每个角色的参考照片:
- 对于MovieQA数据集,提供每个片段的演员列表。
- 其他电影可通过IMDb演员列表和面部识别算法获取演员列表。
-
全局音频分割:
- 使用ERes2NetV2模型进行音频嵌入,结果存储在
data/global_diarization/embeddings.jsonl。 - 使用聚类算法分配全局ID,结果存储在
data/global_diarization/diarization_id.jsonl。
- 使用ERes2NetV2模型进行音频嵌入,结果存储在
-
音频-视觉角色识别:
- 使用Tarsier-7B模型和OpenAI Whisper-large-v2音频编码器进行角色识别。
- 生成最终的音频分割结果,存储在
data/audio_visual_diarization/correct/test_diarization.json。
-
长描述生成:
- 使用Tarsier-7B模型生成最终的视频描述。
- 生成密集描述并进行电影问答评估。
模型检查点
即将发布。
引用
请引用以下内容: BibTeX @misc{he2024storyteller, title={StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification}, author={Yichen He and Yuan Lin and Jianchao Wu and Hanchong Zhang and Yuchen Zhang and Ruicheng Le}, year={2024}, eprint={2411.07076}, archivePrefix={arXiv}, primaryClass={cs.CV} }




