遇见数据集

wubuwizard-cleveland-video

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集是 WuBuWizard 电影项目的原始素材集合,由 WaefreBeorn 创作,属于 parody/comedy 类型多媒体制作。数据集仅包含来自 AI 电影生成器(FAL image_generate + ffmpeg 合成,以及早期 FLUX-3 测试)的原始输出视频和资产,经过重新整理(2026-08-16),旨在从零开始构建新电影。所有衍生渲染(如专辑MV、MEGA 合成、盗版剪辑)已被移除,仅保留基础素材,分类整理并可供直接组装。数据集结构包括:810 个恢复的 MEGA 场景片段(约3.3 GB,总时长 4.95 小时,每个片段约 22 秒),27 个命名视频剪辑(约1.8 GB,约9分钟),2 个 Cleveland 秀专属生成片段,rapman 库(包含角色设计图、环境/地点图、运动参考视频、标题卡片、一致性帧集,总计 206 个设计资产),生成 manifest 文件,以及参考片段。数据集明确排除所有衍生作品,仅提供原始素材,适用于视频编辑/组装研究、角色与环境参考、parody/comedy 内容分析、在 transformative 作品中的创意复用,也可用于教育目的。许可证组合为 Waefrebeorn Umbrella License v3.0(主要)、Creative Commons Attribution 4.0(次要),并主张 parody/fair use 权利。

This dataset is a collection of raw materials for the WuBuWizard film project, created by WaefreBeorn, belonging to the parody/comedy multimedia production. It contains only original output videos and assets from AI film generators (FAL image_generate + ffmpeg compositing, and early FLUX-3 tests), reorganized (2026-08-16) to build a new film from scratch. All derivative renders (such as album MV, MEGA compositing, pirated edits) have been removed, retaining only the base materials, categorized and ready for direct assembly. The dataset structure includes: 810 recovered MEGA scene clips (approx. 3.3 GB, total duration 4.95 hours, each clip ~22 seconds), 27 named video clips (approx. 1.8 GB, ~9 minutes), 2 Cleveland show exclusive clips, rapman library (character designs, environment/location images, motion reference videos, title cards, consistency frames, totaling 206 design assets), a generation manifest file, and a reference clip. The dataset explicitly excludes all derivative works, providing only raw materials, suitable for video editing/assembly research, character and environment reference, parody/comedy content analysis, creative reuse in transformative works, and educational purposes. The license combination is Waefrebeorn Umbrella License v3.0 (primary) and Creative Commons Attribution 4.0 (secondary), with parody/fair use claims.

创建时间:
2026-08-06
原始信息汇总

数据集概述

WuBuWizard Raw Footage Dataset (Parody) 是 WaefreBeorn 创作的 WuBuWizard 电影项目(一部恶搞/喜剧多媒体作品)的原始生成器输出数据集。该数据集仅包含从 AI 电影生成器(FAL image_generate + ffmpeg 合成,以及早期的 FLUX-3 测试)输出的源素材和资产,已于 2026-08-16 重新整理,用于从零开始构建一部新电影。

许可信息

数据集采用组合许可证:

  • Waefrebeorn Umbrella License v3.0(主许可)— SPDX: Waefrebeorn-Umbrella-3.0
  • Creative Commons Attribution 4.0(次级许可)— SPDX: CC-BY-4.0
  • 恶搞/合理使用 — 依据美国法典第17篇第107条主张,并提供来源归属

数据集结构

raw_footage/ ├── WuBuManifest.txt # 生成清单(FAL image_generate + ffmpeg) ├── mega_master/WuBuWizard_MEGA.mp4 # 4.95 小时源合成主文件 ├── mega_scenes/ # 810 个恢复的独立片段(每个约22秒,共4.95小时,100%覆盖) │ └── mega_clip_0001.mp4 ... mega_clip_0810.mp4 ├── wubuclips/WuBuClips/ # 27 个命名在线生成视频片段(约1.8 GB) │ └── wubu_{cast,crossover,run,laura,examine,ensemble,float,story}sN.mp4 ├── cleveland_clips/WuBuCleveland/ # 2 个 Cleveland 剧集专属生成 ├── rapman/ # 早期生成输出 + 设计资产 │ ├── *.mp4 # 主种子、wave、dance_(动态参考生成) │ ├── peter/ poses/ sheets/ # 角色设计表 + 姿态集 │ ├── sets/ # 100+ 地点/环境场景图像 │ └── cards/ consistency/ # 标题卡片 + 动态一致性帧集 └── reference_clips/ # flux_test_character.mp4(生成测试)

数据集内容详情

  • 810 个恢复的 MEGA 场景mega_scenes/,约3.3 GB,总计4.95小时):完整的基础素材,从 WuBuWizard_MEGA.mp4 分割成每个约22秒的独立片段(100%覆盖,平均22.0秒)。这是主要的原始素材卷。
  • 27 个生成视频片段wubuclips/,约1.8 GB,约9分钟):命名 AI 生成素材,涵盖演员、跨界、奔跑、劳拉、检查、合奏、漂浮、故事等场景组。
  • 2 个 Cleveland 片段:Cleveland 剧集专属生成。
  • rapman 库:角色表(Peter + 姿态集)、100+ 环境/地点场景图像、动态参考视频、标题卡片。这是电影的设计骨干。
  • 生成清单:证明来源(FAL image_generate → 视频;FLUX 宣传已结束)。
  • 206 个设计资产总计(7 张角色表、100 个地点场景、10 张标题卡片、89 个动态一致性帧集)+ raw_footage_manifest.json 中的 850 个视频片段目录。

明确排除的内容

专辑 MV 曲目、WuBuWizard_MEGA.mp4 长格式合成、SHORT 剪辑以及盗版/预告片渲染不包含在本数据集中——它们是衍生汇编,而非基础素材。新电影将从 raw_footage/ 全新组装。

预期用途

  • 视频剪辑/组装研究(WuBuEdit 训练)
  • 生成管线的角色与环境参考
  • 恶搞/喜剧内容分析
  • 转化性作品的创意重用
  • 教育用途
搜集汇总
数据集介绍
wubuwizard-cleveland-video 数据集图片
构建方式
该数据集为WuBuWizard电影项目的原始生成器输出,由WaefreBeorn基于FAL image_generate与ffmpeg合成流程,以及早期FLUX-3测试生成。数据经过2026-08-16的重新整理,剔除了所有衍生渲染产物,仅保留基础素材。构建过程包括将4.95小时的主合成视频分割为810个约22秒的片段,实现100%覆盖;同时集成27个命名生成片段、2个Cleveland特定片段,以及包含角色设计图、场景设定与运动一致性帧集的rapman库,并附有生成清单以验证来源。
特点
数据集的核心特色在于其作为纯粹的基础素材库,包含850个视频片段与206个设计资产,总计约5.1GB,覆盖完整时长。其结构层次分明,从大型主合成到细分场景,再到设计参考,便于灵活调用。所有素材均源自AI生成,具备清晰的生成清单与版权组合(CC BY 4.0与Waefrebeorn Umbrella License),同时排除所有衍生作品,强调原始性与可追溯性。
使用方法
该数据集适用于视频编辑与组装研究,可支持WuBuEdit模型的训练,以及生成式流水线中的角色与环境参考。其内容亦可用于喜剧/戏仿内容的分析、转换性作品的创意重用及教育目的。用户可通过raw_footage_manifest.json目录索引快速定位素材,并结合生成清单进行溯源。使用时需遵守Waefrebeorn Umbrella License v3.0与CC BY 4.0的许可条款,并符合合理使用原则。
背景与挑战
背景概述
WuBuWizard-cleveland-video数据集由创作者WaefreBeorn于2026年8月16日整理发布,旨在支持其同名恶搞喜剧电影项目的重建。该数据集汇集了来自AI电影生成器(FAL image_generate与ffmpeg合成)及早期FLUX-3测试的原始素材,剔除了所有派生渲染,仅保留基础镜头与设计资产。其核心研究问题在于为视频编辑与生成式流水线提供可追溯、结构化的原始数据,从而促进角色与场景一致性研究、恶搞内容分析及创意复用。数据集中包含810个恢复的MEGA场景片段、27个命名生成片段及206项设计资产,覆盖完整时长4.95小时,为该领域提供了高覆盖率的基准数据,对视频生成与编辑研究具有奠基性影响。
当前挑战
该数据集面临的挑战多重且深刻。在领域层面,它致力于解决AI生成视频的原始素材组织与一致性难题,如何在大量异构片段中保持角色与场景的视觉连贯性,以及如何有效支持后续的编辑与再创作,是当前生成式视频研究的核心痛点。在构建过程中,需对长达4.95小时的主合成视频进行精确分割与归类,确保100%覆盖且无信息丢失;同时,还需从早期生成输出中系统提取角色设计、环境设定与动作参考,并建立完整的来源记录(manifest),以保证数据的可追溯性与法律合规性。此外,版权与许可的复杂交叉(Waefrebeorn Umbrella License v3.0与CC BY 4.0并行)也为数据集的合法分发与复用增添了额外挑战。
常用场景
经典使用场景
该数据集作为WuBuWizard电影项目的原始生成素材库,专为视频生成与编辑研究而构建。其核心使用场景在于支撑基于深度学习的视频编辑与组装模型(如WuBuEdit)的训练,利用810段约22秒的细粒度片段、27个命名视频剪辑以及丰富的角色与场景设计资产,为模型提供高质量的成对数据,从而赋能自动化的视频拼接、场景过渡与叙事结构生成。此外,该数据集亦可用于生成式模型的评估基准,检验模型在长视频连贯性、角色一致性与环境多变性方面的表现,推动视频生成技术从短片段向长时域叙事拓展。
衍生相关工作
该数据集衍生的相关工作聚焦于生成式视频编辑与组装技术的前沿探索。基于其原始素材结构,研究者已发展出针对长视频的分段生成与无缝拼接算法,以及基于角色一致性约束的图像到视频生成优化方法。其详尽的角色设计表与环境集合,催生了多篇关于可控条件生成(如姿势、场景布局)的实证研究,推动了像FLUX、FAL等扩散模型在影视级质量控制中的改进。在学术圈,该数据集常被引用于视频理解、叙事结构分析和生成内容版权研究,为生成式媒体在创作伦理与所有权归属上的讨论提供了具体范例,激励了更多针对AI生成作品的可解释性与可追溯性机制的探索。
数据集最近研究
最新研究方向
该数据集聚焦于AI生成内容在喜剧及戏仿片创作中的前沿应用,通过整理810个独立片段与多样化的设计资产,构建了从生成源素材到影片剪辑的完整研究基线。当前研究热点在于利用此类原始生成数据训练视频编辑与组装模型,实现角色一致性和环境连贯性的自动优化,同时探索生成式管线中元数据与创作来源的可追溯机制。该数据集为生成式视频内容的结构化重组、跨模态设计参考及基于戏仿法的合理使用边界提供了实证基础,对推动生成式媒体叙事的工程化与规范化具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务