Uncompressed
收藏资源简介:
该数据集是FlowMimic研究项目的配套材料,包含论文的未压缩版本(main.pdf)以及多种视频编辑任务的结果示例视频。这些视频展示了同一1.3B模型在文字修改、非刚性元素替换、表情更换、发型更换、视频重光照等任务上的编辑效果,部分视频包含超过训练平均帧数(121帧)的推理结果。数据集旨在为视觉编辑与生成领域的研究提供可复现的参考,并支持基于像素对齐的时间点流扭曲场和模态模仿方法的验证。
This dataset is supporting materials for the FlowMimic research project, containing the uncompressed version of the accompanying paper (main.pdf) and example result videos for various video editing tasks. These videos demonstrate the editing effects achieved by the same 1.3B-scale model across tasks including text modification, non-rigid element replacement, facial expression replacement, hairstyle replacement, video relighting, and more. Some of these videos include inference results that exceed the average training frame count (121 frames). The dataset aims to provide reproducible references for research in the field of visual editing and generation, and supports the validation of pixel-aligned temporal flow warping field and modality imitation methods.
数据集概述:FlowMimic/Uncompressed
基本信息
研究核心内容
FlowMimic 研究提出了无掩码的视觉编辑与生成方法,其核心贡献包括:
-
时间点流变形场(Temporal Point-flow Warped Field):
- 将视频编辑学习的本质抽象为像素级编辑效果的时间保持
- 可仅从图像编辑样本中实时、可扩展地生成视频编辑数据
- 适用于多种编辑任务,并可扩展至高层次视频任务(如分割)、低层次视频任务(如视频去模糊)及可控视频生成(如条件图到视频)
-
模态模仿(Modality Mimicry)机制:
- 认为同时在图像和视频模态上训练生成与编辑任务的模型,应产生跨模态相对一致的输出分布
- 设计了模态模仿生成损失和模态模仿编辑损失
-
内化语言视觉编辑能力:
- 不依赖微调额外模块(如带连接器适配的VLM或辅助掩码序列输入),而是通过引入感知相关任务及编辑区域感知的潜在层和注意力层损失,赋予模型内化的编辑能力
-
策略内自蒸馏(OPSD)视角:
- 模态模仿过程本质上是流匹配模型的一种策略内自蒸馏形式
- 相关模仿方法可应用于图像或视频流匹配模型的OPSD,如Z-image和Stable Diffusion 3.5 Medium
视频编辑结果
数据集中包含多项视频编辑任务的演示视频,均由同一个1.3B模型完成。示例包括:
- 更改文字(如“PEACE”)
- 非刚性元素替换及添加视觉效果
- 轨迹引导的条件输入编辑
- 表情更改(如“微笑”)
- 发型更改(如“法式浅紫色短发”)
- 视频重新打光(如“夕阳柔和光线”)
- 121帧长序列推理效果(训练平均帧数的3倍以上),包括添加魔法帽和调整秋日下午阳光照明等任务
引用信息
如需引用该研究成果,可使用提供的BibTeX条目(作者:Zhang, Dingyun; Gong, Lixue; Liu, Wei;发表于arXiv:2607.18227,2026年)。




