遇见数据集

Efficient-Large-Model/SANA-Streaming-example-training-dataset

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含1000个对齐的反向视频编辑对,用于公开的SANA-Streaming双向视频到视频(V2V)训练配方。具体内容包括500个背景更改、167个局部添加、167个局部移除和166个局部更改。每个样本由源视频(.source.mp4)、目标视频(.target.mp4)和元数据文件(.json)组成,数据集以ZIP分片形式组织,每个分片包含100对。数据集用于非商业研究用途,支持SANA-Streaming模型的微调训练,但请注意这是一个示例子集,并非完整训练混合数据。

This dataset contains 1000 aligned paired reverse video edit pairs, developed for the publicly released SANA-Streaming bidirectional video-to-video (V2V) training recipe. It specifically includes 500 background modification cases, 167 local additions, 167 local removals, and 166 local modifications. Each sample is composed of a source video (.source.mp4), a target video (.target.mp4), and a metadata file (.json). The dataset is structured as ZIP shards, with each shard holding 100 pairs. This dataset is intended for non-commercial research purposes only, and supports the fine-tuning of the SANA-Streaming model. Please note that this is an example subset rather than the complete training mixture data.

提供机构:
Efficient-Large-Model
搜集汇总
数据集介绍
Efficient-Large-Model/SANA-Streaming-example-training-dataset 数据集图片
构建方式
该数据集精心构建了1,000个逆向视频编辑对,涵盖了背景变换、局部增添、局部移除及局部修改四种核心编辑类型,分别占据500、167、167、166个样本。每个样本均以<id>.source.mp4、<id>.target.mp4及<id>.json文件形式存储,其中JSON文件包含可重定位路径、逆编辑提示、视频元数据、许可证声明及SHA256摘要。数据被均匀划分为10个ZIP分片,每片包含100对,并通过manifest.jsonl提供索引,保证了数据加载的灵活性与完整性。
特点
该数据集聚焦于逆向视频编辑任务,即提供原始视频与编辑后视频的配对,专为SANA-Streaming双向视频到视频训练框架设计。其独特之处在于编辑类型的高度结构化分布,为模型理解不同编辑操作提供了均衡的训练素材。此外,数据集采用视频对形式,且编辑方向为逆序(从编辑结果恢复原始内容),这一设计使得模型能够学习双向映射,增强了视频编辑的灵活性与鲁棒性。
使用方法
用户可通过HuggingFace CLI将数据集下载至NVlabs-Sana项目目录下的指定路径,并利用SHA256校验验证文件完整性。随后,可直接调用官方提供的双向微调训练脚本,该脚本将原始视频作为扩散目标,编辑后视频作为视频到视频的条件输入。数据集加载器自动处理时空对齐,确保源视频与目标视频在相同时间窗口和空间裁剪下被模型读取,简化了训练流程。
背景与挑战
背景概述
SANA-Streaming-example-training-dataset由Efficient-Large-Model团队于近期创建,专注于视频到视频(video-to-video)的双向编辑任务。该数据集以推动视频编辑领域的前沿研究为目标,核心研究问题在于如何实现高质量、高一致性的逆向视频编辑配对。通过提供1,000个对齐的逆向视频编辑样本,涵盖背景替换、局部添加、删除与修改等多样场景,该数据集为SANA-Streaming双向微调方案提供了标准化训练示例,对视频编辑模型的非商业研究具有重要参考价值。
当前挑战
该数据集所解决的领域问题挑战是视频编辑中双向一致性匹配的困难,即如何确保原始视频与编辑后的视频在时间窗口与空间区域上精准对齐,同时支持逆向推理。构建过程中遇到的挑战包括:仅包含逆向方向样本,未能覆盖完整编辑分布;数据规模有限,仅为1,000个示例子集,不足以代表预训练模型的鲁棒性需求;同时需处理复杂的时序裁剪、空间对齐及元数据校验,以保证训练数据的可靠性与可复现性。
常用场景
经典使用场景
该数据集专为视频到视频的双向编辑任务而设计,其核心特色在于提供了1,000组对齐的反向编辑视频对。这些视频对涵盖了背景更换、局部添加、局部移除以及局部变化四种典型的视频编辑操作,为训练和评估双向视频编辑模型提供了高质量、多样化的配对数据。研究者可以借此探索如何基于给定的编辑指令,在保持时序一致性的前提下,实现源视频与目标视频之间的自动转换,从而构建出具备精准语义理解和空间时序建模能力的视频编辑系统。
实际应用
在实际应用中,该数据集可直接赋能自动化视频后期制作、影视特效合成、短视频内容创作、在线视频修复与增强等产业场景。例如,通过微调得到的双向视频编辑模型,用户只需提供一段原始视频和一条编辑指令,即可快速完成诸如替换视频背景、移除或添加特定物体、改变局部区域外观等复杂操作。此外,该技术还能集成到智能剪辑软件、直播滤镜、虚拟现实内容生产中,大幅降低人工逐帧编辑的时间成本,提升视频创意的灵活性与生产力。
衍生相关工作
该数据集衍生了包括SANA-Streaming双向视频编辑模型在内的一系列代表性工作,其训练流程和模型架构已成为视频编辑领域的基线参考。基于该数据集,研究者进一步探索了时序一致性损失函数设计、基于光流的运动对齐、自适应时序窗口采样等优化策略,并催生了多篇研究论文和开源工具。同时,该数据的发布也启发了后续更大规模、更多样化视频编辑数据集的构建工作,推动了视频生成领域从单向编辑向双向、可逆、可解释方向的学术演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务