MSRVTT-Personalization
收藏资源简介:
MSRVTT-Personalization是一个新的基准数据集,用于个性化任务。它旨在准确评估主题的保真度,并支持多种条件模式,包括基于面部裁剪、单个或多个任意主题以及前景对象和背景的组合。
MSRVTT-Personalization is a novel benchmark dataset for personalized tasks. It is designed to accurately evaluate the fidelity of target subjects, and supports a variety of conditional modes, including face cropping-based setups, single or multiple arbitrary target subjects, as well as combinations of foreground objects and backgrounds.
MSRVTT-Personalization 数据集概述
数据集简介
MSRVTT-Personalization 是一个用于个性化任务的新基准数据集,旨在准确评估主题保真度,并支持多种条件模式,包括基于面部裁剪、单个或多个任意主题以及前景对象和背景组合的条件。
数据集内容
- 测试数据集:包含测试样本和评估协议。
- 样本展示:提供了测试样本的示例,包括真实视频和个性化注释。
评估指标
MSRVTT-Personalization 通过以下五个指标评估模型:
- 文本相似度 (Text-S)
- 视频相似度 (Vid-S)
- 主题相似度 (Subj-S)
- 面部相似度 (Face-S)
- 动态程度 (Dync-D)
定量评估结果
主题模式(基于整个主题图像的条件)
| 方法 | Text-S | Vid-S | Subj-S | Dync-D |
|---|---|---|---|---|
| ELITE | 0.245 | 0.620 | 0.359 | - |
| VideoBooth | 0.222 | 0.612 | 0.395 | 0.448 |
| DreamVideo | 0.261 | 0.611 | 0.310 | 0.311 |
| Video Alchemist | 0.269 | 0.732 | 0.617 | 0.466 |
面部模式(基于面部裁剪图像的条件)
| 方法 | Text-S | Vid-S | Face-S | Dync-D |
|---|---|---|---|---|
| IP-Adapter | 0.251 | 0.648 | 0.269 | - |
| PhotoMaker | 0.278 | 0.569 | 0.189 | - |
| Magic-Me | 0.251 | 0.602 | 0.135 | 0.418 |
| Video Alchemist | 0.273 | 0.687 | 0.382 | 0.424 |
定性评估结果
- 主题模式:展示了不同方法生成的视频与真实视频的对比。
- 面部模式:展示了不同方法生成的视频与真实视频的对比。
引用
如果您在研究中使用了该项目,请引用以下论文: bibtex @inproceedings{chen2025videoalchemist, title = {Multi-subject Open-set Personalization in Video Generation}, author = {Chen, Tsai-Shien and Siarohin, Aliaksandr and Menapace, Willi and Fang, Yuwei and Lee, Kwot Sin and Skorokhodov, Ivan and Aberman, Kfir and Zhu, Jun-Yan and Yang, Ming-Hsuan and Tulyakov, Sergey}, journal = {arXiv preprint arXiv:2501.06187}, year = {2025} }
联系方式
- Tsai-Shien Chen: tsaishienchen@gmail.com




