FunCineForge
收藏资源简介:
FunCineForge包含一个端到端的数据集工具包,用于生产大规模配音数据集,以及一个基于MLLM的配音模型,专为多样化的电影场景设计。使用这个工具包,我们构建了第一个大规模中文电视配音数据集,其中包括丰富的注释和多样化的场景。在独白、旁白、对话和多说话者场景中,我们的配音模型在音频质量、唇形同步、音色转换和指令遵循方面始终优于最先进的方法。
FunCineForge includes an end-to-end dataset toolkit for generating large-scale dubbing datasets, as well as an MLLM-based dubbing model tailored for diverse film scenarios. Leveraging this toolkit, we constructed the first large-scale Chinese TV dubbing dataset, which features rich annotations and diverse scene settings. In monologue, voiceover, dialogue, and multi-speaker scenarios, our dubbing model consistently outperforms state-of-the-art methods across audio quality, lip-sync accuracy, voice conversion, and instruction following capabilities.
FunCineForge 数据集概述
数据集简介
FunCineForge 是一个用于零样本电影配音的统一数据集工具包和模型,专注于多样化的电影场景。该工具包构建了首个大规模中文电视剧配音数据集,包含丰富的标注和多样化的场景。
数据集内容与特点
- 场景多样性:数据集涵盖独白、旁白、对话和多说话者场景。
- 标注丰富性:包含情感线索、角色年龄、性别和音色信息。
- 高质量标注:采用大模型+小模型解决方案,将词错误率(WER)从3.2%降低至0.6%,说话人ID错误率从4.3%降低至1.2%,达到甚至优于人工转录的质量。
数据集获取与示例
数据集样本和演示样本可通过以下地址访问: https://anonymous.4open.science/w/FunCineForge/
数据集构建工具包
环境要求
- 操作系统:Linux
- Python版本:>= 3.8
- Pytorch版本:>= 2.1
- 依赖工具:FFmpeg
数据收集要求
- 视频源:电视剧或电影(非纪录片),包含较多独白或对话场景,人脸清晰无遮挡。
- 语音要求:发音标准、吐字清晰、人声突出,避免方言重、背景噪声大或口语化过强的素材。
- 图像要求:高分辨率、面部细节清晰、光照充足,避免极暗或强逆光场景。
数据处理流程
- 视频标准化:将视频格式标准化为mp4,使用libx264和libmp3lame编码;裁剪电视剧片头片尾(默认各裁剪5分钟)。
- 视频剪辑:对长序列视频,使用VAD获取句子级片段,通过ASR生成字幕文件,并切割视频。
- 视频时长限制与字幕清洗:清理不符合时长要求的视频和字幕文件。
- 语音分离:从音频中分离人声和伴奏音乐。
- 说话人日志:通过多模态主动说话人识别获取RTTM文件;识别说话人面部帧,提取帧级说话人面部和嘴唇原始数据,从面部帧中识别说话帧,并提取说话帧的面部特征。
- 思维链标注:基于多模态大语言模型,以音频、ASR文本和RTTM文件为输入,通过思维链提取情感线索,并使用大模型校正小模型解决方案以减少ASR错误,同时标注角色年龄、性别和音色信息。
- 数据集构建:清洗和校正思维链结果;确定视频剪辑类型(独白、对话、多人、旁白);划分训练集和测试集;生成索引。
配音模型
FunCineForge配音模型的源代码和检查点将在论文被接受后开源。
使用声明
- 此匿名仓库仅作为同行评审的补充材料。
- 本仓库仅用于学术/研究目的。
- 本仓库受特定许可条款约束。




