OmniDance
收藏资源简介:
OmniDance 是一个用于多模态舞蹈视频生成的大规模数据集,基于互联网舞蹈视频构建,旨在支持文本-图像到视频(TI2V)、音乐-图像到视频(MI2V)以及文本-音乐-图像到视频(MTI2V)等研究任务。数据集专注于单人舞蹈视频,包含丰富的编舞内容和稳定的视觉表现。数据集由视频和文本两部分组成,视频部分包含舞蹈片段,文本部分则提供与视频配对的编舞感知文本注释,描述身体动态、编舞内容、表现力、镜头呈现和整体视觉外观等关键属性。数据集规模在10万到100万样本之间,经过严格的过滤和标注流程,包括参考清晰度验证、舞蹈视频验证、单人舞蹈过滤、场景稳定性过滤和编舞感知文本标注等步骤。尽管数据集经过精心筛选,但仍可能存在一些偏见和噪声,如女性表演者较多、样本主要来自亚洲在线舞蹈社区等。该数据集仅限研究使用,使用时需注意隐私、肖像权、人口统计偏见和身份敏感风险等问题。
OmniDance is a large-scale dataset for multimodal dance video generation, constructed based on Internet dance videos. It aims to support research tasks including Text-to-Image-to-Video (TI2V), Music-to-Image-to-Video (MI2V), and Text-Music-Image-to-Video (MTI2V). The dataset focuses on single-person dance videos, featuring rich choreography content and stable visual performance. It consists of two components: video and text. The video component contains dance clips, while the text component provides choreography-aware text annotations paired with the corresponding videos, describing key attributes such as body dynamics, choreography content, expressiveness, shot presentation, and overall visual appearance. The dataset has a scale ranging from 100,000 to 1,000,000 samples, and has undergone strict filtering and annotation procedures, including reference clarity verification, dance video validation, single-person dance filtering, scene stability filtering, and choreography-aware text annotation. Despite careful screening, the dataset may still contain certain biases and noises, such as a higher proportion of female performers and samples mainly sourced from Asian online dance communities. This dataset is for research use only. Users should pay attention to issues including privacy, portrait rights, demographic biases, and identity-sensitive risks during usage.
💃 OmniDance 数据集概述
数据集基本信息
- 数据集名称: OmniDance
- 语言: 英语
- 许可证: 其他(研究用途)
- 数据规模: 100K < 样本数 < 1M
任务类型
OmniDance 是一个面向多模态舞蹈视频生成的大规模数据集,支持以下任务:
- TI2V: 文本 + 参考图像 → 舞蹈视频
- MI2V: 音乐 + 参考图像 → 舞蹈视频
- MTI2V: 文本 + 音乐 + 参考图像 → 舞蹈视频
此外,还支持舞蹈动作理解、音乐-运动对齐、编舞条件生成、身份一致的人体视频合成等相关任务。
数据内容
数据集中每个样本包含一个舞蹈视频及其对应的文本描述:
Opensource_Data/video/
- 存放舞蹈视频片段,用于训练或评估
Opensource_Data/text/
- 存放编舞感知的文本标注,描述舞蹈视频的关键属性,包括:
- 身体动态
- 编舞内容
- 表现力
- 镜头呈现
- 整体视觉外观
数据集特点
- 大规模: 从互联网收集的大规模舞蹈视频集合
- 编舞感知文本: 提供与编舞相关的文本标注,比通用视频描述提供更有用的监督信息
- 单人舞蹈: 专注于单人舞蹈表演
- 音乐条件生成: 适用于音乐条件驱动的舞蹈生成
- 数据筛选: 经过舞蹈有效性、参考清晰度、场景稳定性等多轮过滤
数据构建流程
数据集通过渐进式过滤和标注流程构建,主要阶段包括:
- 参考清晰度验证
- 舞蹈视频验证
- 单人舞者过滤
- 场景稳定性过滤
- 编舞感知文本标注
局限性
作为网络收集的数据集,OmniDance 可能存在以下偏差和噪声:
- 女性表演者多于男性表演者
- 许多样本来自亚洲在线舞蹈社区
- 部分视频可能存在运动模糊、压缩伪影或局部视觉缺陷
使用说明
- 用途限制: 仅限研究用途
- 注意事项:
- 关注隐私和人像相关的问题
- 注意人口统计和地区偏差
- 防范身份敏感的滥用风险
- 遵守当地法规和源平台政策




