CharEdit-50K
收藏资源简介:
CharEdit-50K是由澳门大学、vivo蓝影实验室及大湾区大学联合构建的流媒体角色视频编辑数据集,专为指令驱动的角色外观编辑任务设计。该数据集包含约5万条配对样本,覆盖从发型、服饰到配饰等多种外观变换,其核心数据来源于运动对齐的真实视频,并通过参考帧编辑与逆向恢复策略生成高质量监督信号。数据集创建过程采用外观-运动解耦范式,将源视频参考帧经编辑指令修改后,结合原始运动信号实现视频重建,从而确保面部表情与身体动作的忠实保留。该数据集旨在解决现有方法在实时流媒体场景中面临的表情不一致、离线推理延迟及长期外观漂移等关键挑战,为低延迟、高保真的角色视频编辑提供坚实基础。
CharEdit-50K is a streaming character video editing dataset jointly constructed by the University of Macau, vivo Blue Shadow Lab, and Guangdong-Hong Kong-Macao Greater Bay Area University, specifically designed for instruction-driven character appearance editing tasks. This dataset contains approximately 50,000 paired samples, covering a wide range of appearance transformations including hairstyles, clothing, accessories and more. Its core data is sourced from motion-aligned real-world videos, and high-quality supervision signals are generated via reference frame editing and inverse restoration strategies. The dataset construction adopts an appearance-motion decoupling paradigm: the reference frames of the source video are modified based on editing instructions, then combined with the original motion signals to achieve video reconstruction, thereby ensuring the faithful retention of facial expressions and body movements. This dataset aims to address the key challenges faced by existing methods in real-time streaming scenarios, including inconsistent facial expressions, offline inference latency and long-term appearance drift, providing a solid foundation for low-latency, high-fidelity character video editing.
数据集/项目概述:EditaLive
项目名称: EditaLive! Unified Character Video Editing for Live Streaming
项目地址: https://huai-chang.github.io/EditaLive/
核心定位: 一个用于实时流媒体场景的统一角色视频编辑框架,支持基于文本指令的、保持运动一致性的长序列视频编辑。
核心特性
- 实时性能: 运行速度可达 14.47 FPS(在单张 H100 上,384×672 分辨率)。
- 因果流式处理: 支持分块(chunk-by-chunk)的因果流式生成,适合直播等连续场景。
- 指令引导编辑: 通过文本指令(如“添加红色镜框太阳镜”)即可编辑视频。
- 长流一致性: 能够处理超长视频流,保持角色身份和外观稳定。
- 外观-运动解耦: 将需要编辑的外观与需要保留的运动信号分离处理。
技术方法与流程
EditaLive 通过三个连续的阶段实现流式角色视频编辑:
-
外观-运动解耦编辑(Stage 1):
- 将角色视频编辑重新定义为“以显式运动信号为条件的外观编辑”。
- 使用参考帧表示角色外观,骨架序列和隐式面部表征捕捉身体运动和面部动态。
- 训练时仅对参考图像进行合成编辑,以真实视频为重建目标,并配对反向指令以恢复原始外观。
-
因果流式适配(Stage 2):
- 将离线双向视频模型适配为因果流式生成,利用缓存的历史上下文进行推理。
- 引入固定旋转位置编码(Fixed RoPE)和“Align Forcing”技术,减少训练与推理之间的差异。
-
对齐自展开蒸馏(Stage 3):
- 将因果模型压缩为二步采样器,并通过对齐自展开蒸馏进行优化。
- 采用“首帧保留稀疏注意力”(First-Frame Preserved Sparse Attention, FPSA)过滤冗余历史信息,减轻外观漂移。
评估基准与性能
在两个基准上进行了评估:CharEdit-Bench-S(150 个五秒短视频,81 帧,480×832)和 CharEdit-Bench-L(30 个长于一分钟的长视频)。
关键性能指标(CharEdit-Bench-S,单张 H100 @ 384×672):
- 效率: 端到端 FPS 为 14.47,平均 chunk 间延迟为 0.829 秒。启用 Flash-VAED 后,FPS 可达 16.4。
- 质量表现: 在全部八项质量指标上,EditaLive 均排名第一或第二,尤其是在视频质量(Pick Score)、文本对齐(TA)和编辑质量(EQ)方面表现突出。
关键性能指标(CharEdit-Bench-L):
- 长视频表现: 在长视频设置中取得了最强的整体性能,包括最佳的文本对齐(TA)、编辑质量(EQ)、背景一致性(BC)、成功率(SR)和视频质量(Pick Score)。其短视频成功率为 0.720。
消融研究
消融研究揭示了各个组件的作用:
- 去除 Align Forcing(对齐强制): 导致性能大幅下降,因为它引入了展开训练与流式推理之间 KV-cache 构建的不匹配。
- 去除 Fixed RoPE(固定旋转位置编码): 会使模型暴露于未见过的位置偏移,削弱参考条件。
- 去除 FPSA(首帧保留稀疏注意力): 会过滤掉冗余历史信息,导致外观漂移。
引用信息
BibTeX: bibtex @article{li2026editalive, title = {EditaLive! Unified Character Video Editing for Live Streaming}, author = {Li, Zhiyuan and Pun, Chi-Man and Jiang, Peng-Tao and Li, Bo and Cun, Xiaodong}, journal = {arXiv preprint arXiv:2608.27123}, year = {2026} }





