遇见数据集

CharEdit-50K

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

CharEdit-50K是由澳门大学、vivo蓝影实验室及大湾区大学联合构建的流媒体角色视频编辑数据集,专为指令驱动的角色外观编辑任务设计。该数据集包含约5万条配对样本,覆盖从发型、服饰到配饰等多种外观变换,其核心数据来源于运动对齐的真实视频,并通过参考帧编辑与逆向恢复策略生成高质量监督信号。数据集创建过程采用外观-运动解耦范式,将源视频参考帧经编辑指令修改后,结合原始运动信号实现视频重建,从而确保面部表情与身体动作的忠实保留。该数据集旨在解决现有方法在实时流媒体场景中面临的表情不一致、离线推理延迟及长期外观漂移等关键挑战,为低延迟、高保真的角色视频编辑提供坚实基础。

CharEdit-50K is a streaming character video editing dataset jointly constructed by the University of Macau, vivo Blue Shadow Lab, and Guangdong-Hong Kong-Macao Greater Bay Area University, specifically designed for instruction-driven character appearance editing tasks. This dataset contains approximately 50,000 paired samples, covering a wide range of appearance transformations including hairstyles, clothing, accessories and more. Its core data is sourced from motion-aligned real-world videos, and high-quality supervision signals are generated via reference frame editing and inverse restoration strategies. The dataset construction adopts an appearance-motion decoupling paradigm: the reference frames of the source video are modified based on editing instructions, then combined with the original motion signals to achieve video reconstruction, thereby ensuring the faithful retention of facial expressions and body movements. This dataset aims to address the key challenges faced by existing methods in real-time streaming scenarios, including inconsistent facial expressions, offline inference latency and long-term appearance drift, providing a solid foundation for low-latency, high-fidelity character video editing.

创建时间:
2026-08-27
原始信息汇总

数据集/项目概述:EditaLive

项目名称: EditaLive! Unified Character Video Editing for Live Streaming

项目地址: https://huai-chang.github.io/EditaLive/

核心定位: 一个用于实时流媒体场景的统一角色视频编辑框架,支持基于文本指令的、保持运动一致性的长序列视频编辑。


核心特性

  • 实时性能: 运行速度可达 14.47 FPS(在单张 H100 上,384×672 分辨率)。
  • 因果流式处理: 支持分块(chunk-by-chunk)的因果流式生成,适合直播等连续场景。
  • 指令引导编辑: 通过文本指令(如“添加红色镜框太阳镜”)即可编辑视频。
  • 长流一致性: 能够处理超长视频流,保持角色身份和外观稳定。
  • 外观-运动解耦: 将需要编辑的外观与需要保留的运动信号分离处理。

技术方法与流程

EditaLive 通过三个连续的阶段实现流式角色视频编辑:

  1. 外观-运动解耦编辑(Stage 1):

    • 将角色视频编辑重新定义为“以显式运动信号为条件的外观编辑”。
    • 使用参考帧表示角色外观,骨架序列和隐式面部表征捕捉身体运动和面部动态。
    • 训练时仅对参考图像进行合成编辑,以真实视频为重建目标,并配对反向指令以恢复原始外观。
  2. 因果流式适配(Stage 2):

    • 将离线双向视频模型适配为因果流式生成,利用缓存的历史上下文进行推理。
    • 引入固定旋转位置编码(Fixed RoPE)和“Align Forcing”技术,减少训练与推理之间的差异。
  3. 对齐自展开蒸馏(Stage 3):

    • 将因果模型压缩为二步采样器,并通过对齐自展开蒸馏进行优化。
    • 采用“首帧保留稀疏注意力”(First-Frame Preserved Sparse Attention, FPSA)过滤冗余历史信息,减轻外观漂移。

评估基准与性能

在两个基准上进行了评估:CharEdit-Bench-S(150 个五秒短视频,81 帧,480×832)和 CharEdit-Bench-L(30 个长于一分钟的长视频)。

关键性能指标(CharEdit-Bench-S,单张 H100 @ 384×672):

  • 效率: 端到端 FPS 为 14.47,平均 chunk 间延迟为 0.829 秒。启用 Flash-VAED 后,FPS 可达 16.4
  • 质量表现: 在全部八项质量指标上,EditaLive 均排名第一或第二,尤其是在视频质量(Pick Score)、文本对齐(TA)和编辑质量(EQ)方面表现突出。

关键性能指标(CharEdit-Bench-L):

  • 长视频表现: 在长视频设置中取得了最强的整体性能,包括最佳的文本对齐(TA)、编辑质量(EQ)、背景一致性(BC)、成功率(SR)和视频质量(Pick Score)。其短视频成功率为 0.720

消融研究

消融研究揭示了各个组件的作用:

  • 去除 Align Forcing(对齐强制): 导致性能大幅下降,因为它引入了展开训练与流式推理之间 KV-cache 构建的不匹配。
  • 去除 Fixed RoPE(固定旋转位置编码): 会使模型暴露于未见过的位置偏移,削弱参考条件。
  • 去除 FPSA(首帧保留稀疏注意力): 会过滤掉冗余历史信息,导致外观漂移。

引用信息

BibTeX: bibtex @article{li2026editalive, title = {EditaLive! Unified Character Video Editing for Live Streaming}, author = {Li, Zhiyuan and Pun, Chi-Man and Jiang, Peng-Tao and Li, Bo and Cun, Xiaodong}, journal = {arXiv preprint arXiv:2608.27123}, year = {2026} }

搜集汇总
数据集介绍
CharEdit-50K 数据集图片
构建方式
CharEdit-50K数据集的构建遵循精心设计的重建式训练范式,旨在解决现有视频编辑数据集中面部表情不一致的缺陷。首先,从SpeakerVid-5M、Seamless Interaction Dataset及互联网资源中搜集大量人物视频,依据面部清晰度、完整性及手部可见性等标准,为每段视频筛选出一帧高质量图像作为外观参考。其次,利用GPT-5.5针对每帧参考图像生成涵盖增删、换色、风格化四类双向指令对,并实施类别与颜色分布均衡化处理。最后,采用Qwen-Image-Edit与Nano Banana 2合成对应编辑图像,经GPT-5.5依据编辑准确性、目标清晰度、角色一致性及逆向可行性进行质量过滤,保留每个样本包含编辑图像、逆向指令及原始视频的配对结构,从而构建出覆盖多样化外观编辑任务的大型数据集。
特点
CharEdit-50K数据集具有突出的构建特色。它摒弃了传统合成视频对带来的表情漂移问题,通过仅对参考帧进行合成编辑,而将原始真实视频作为重建目标,确保了运动与面部动态的严格对齐。数据集涵盖四种主要编辑类型:增删、移除-添加、颜色更换-恢复以及全局风格化,形成了丰富的双向指令对,为模型提供了完整的外观变换学习信号。每个样本均包含正反向指令、编辑后的参考图像及对应的源视频,这种三元组结构独特地支持了外观-运动解耦的编辑范式。此外,通过GPT-5.5的多维质量过滤机制,确保了编辑结果的真实性和一致性,为训练高保真的流媒体人物视频编辑模型奠定了坚实基础。
使用方法
CharEdit-50K数据集旨在支持实时流媒体人物视频编辑模型的训练与评测。在使用时,研究者可利用其重建式训练策略,将编辑后的参考图像、逆向指令及源视频的运动信号作为条件输入,训练模型学习从编辑外观恢复原始外观的能力,从而隐式掌握多样化的外观变换。数据集支持三阶段的训练流程:首先进行外观-运动解耦的基础训练,其次适配为因果流式生成,最后通过自rollout蒸馏实现高效的两步采样。此外,配套的CharEdit-Bench可全面评估模型在短视频与长视频场景下的编辑质量、表情保真度、运动一致性及推理效率,为验证模型在实际流媒体环境中的实时性能提供了标准化基准。
背景与挑战
背景概述
CharEdit-50K数据集诞生于2026年,由澳门大学、vivo蓝心影像实验室及大湾区大学联合研究团队构建,旨在解决直播场景下角色视频编辑的难题。随着生成式AI的兴起,直播主播渴望通过文本指令实时定制自身形象,而现有视频编辑方法多聚焦于场景级内容,难以满足人物中心、实时交互的需求。该数据集的核心研究问题在于,如何在保持源视频运动与面部表情的同时,实现多样化的角色外观编辑,并支持低延迟的流式推理。CharEdit-50K通过创新的外观-运动解耦范式,将编辑任务重构为受显式运动控制的外观变换,为模型训练提供了真实、运动对齐的视频监督,有力推动了实时流媒体角色编辑领域的发展。
当前挑战
CharEdit-50K面对的挑战体现在两大维度。其一,领域问题层面,现有视频编辑数据集多由生成模型合成,常引入面部表情不一致,且模型依赖离线双向注意力与多步采样,无法满足直播场景的实时性;同时,长序列生成中的外观漂移问题也亟待解决。其二,数据集构建层面,需从大规模视频池中精准挖掘高质量参考帧,确保面部与手部清晰完整;指令生成需覆盖增删、改色、风格化等多样任务并平衡分布;合成图像需经过严格的质量过滤,包括编辑准确性、目标清晰度、角色一致性及反向可行性验证,以保证每一训练样本的可靠性与有效性。
常用场景
经典使用场景
CharEdit-50K作为首个专为流媒体直播场景设计的人物视频编辑数据集,其经典使用场景聚焦于指令驱动的实时人物外观编辑。该数据集通过提供成对的正反向编辑指令、编辑后的参考帧以及与之运动对齐的真实源视频,支撑了从局部属性修改(如更换服饰颜色、添加配饰)到全局风格迁移(如动漫化、毛绒质感)的多样化编辑任务。研究者可基于此数据集训练模型,使得模型能够在保持原始面部表情与身体动作的前提下,依据自然语言指令对直播中的人物形象进行即时变换,从而满足直播互动中对个性化视觉呈现的迫切需求。
解决学术问题
CharEdit-50K的构建有效解决了视频编辑领域长期存在的两大痼疾:其一是合成数据导致的面部表情不匹配问题,通过将合成编辑严格限定于参考帧并保留真实视频作为重建目标,确保了训练数据中运动与表情的真实一致性;其二是离线编辑范式与流媒体实时性需求之间的根本矛盾,数据集配套的重建式训练策略促使模型从双向时序建模转向因果生成,为后续的流式推断与蒸馏压缩提供了坚实的数据基础。这一数据设计范式不仅提升了编辑质量,更为实时交互式视频编辑的研究开辟了新的数据驱动路径。
衍生相关工作
围绕CharEdit-50K,衍生出了一系列深化实时人物视频编辑研究的前沿工作。其中,EditaLive作为直接依托该数据集提出的统一框架,创新性地将外观-运动解耦范式引入流媒体编辑,并结合对齐自展蒸馏、固定旋转位置编码及首帧保留稀疏注意力等机制,实现了低延迟下的长时稳定编辑。后续研究进一步借鉴其重建式训练思想,探索将类似数据构造策略推广至多人物交互、音频驱动编辑及更高分辨率场景。同时,该数据集也为评测指令遵循的准确性、编辑一致性及流式推理的鲁棒性提供了标准基准,推动了实时视频编辑领域从理论探索向实际应用的加速转化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务