遇见数据集

PexelsCustom-1M

收藏
github2026-06-09 更新2026-06-11 收录
数据链接:
官方服务:

资源简介:

PexelsCustom-1M是首个公开的百万规模身份保持视频生成数据集,包含100万条经过筛选的(身份、文本、视频)三元组,涵盖8,373个类别。该数据集旨在解决开放域定制视频生成中缺乏大规模、带注释数据集的问题,支持身份感知的参考图像条件化视频生成。

PexelsCustom-1M is the first publicly available million-scale identity-preserving video generation dataset, which includes 1 million filtered (identity, text, video) triplets covering 8,373 categories. This dataset aims to solve the problem of the lack of large-scale annotated datasets in open-domain custom video generation, and supports identity-aware reference-image-conditioned video generation.

创建时间:
2026-06-08
原始信息汇总

PexelsCustom-1M 数据集详情

基本信息

  • 全称: PexelsCustom-1M
  • 关联论文: A Comprehensive Ecosystem for Open-Domain Customized Video Generation(ICASSP 2026)
  • 数据集规模: 百万级,包含 1,000,000 个 (identity, text, video) 三元组
  • 覆盖类别: 8,373 个类别

数据集用途

该数据集专为开放域定制化视频生成任务设计,旨在解决身份保留视频生成领域中缺乏大规模、带标注数据的问题。

数据集构成

发布内容包含以下三部分:

  1. 元数据 CSV 文件: 包含视频 ID、主体类别、描述文本和标注参考信息
  2. 参考图像: 裁剪后的主体参考图像
  3. 标注信息: 边界框和分割掩码(以 tar 分片形式打包)

视频文件托管于 Pexels 平台,可通过视频 ID 下载: https://www.pexels.com/video/{VIDEO_ID}/

相关模型与框架

基于 PexelsCustom-1M 数据集,提出了 CustomDiT 框架:

  • 模型架构: Diffusion Transformer(DiT)
  • 基础模型: CogVideoX-5b
  • 训练方式: 两阶段训练
    • 第一阶段(WoDA): 无数据增强,训练 8,000 步
    • 第二阶段(WtDA): 带数据增强,微调 2,000 步,缓解复制-粘贴问题
  • 核心机制: 通过偏置注入的 RoPE 嵌入实现身份感知条件生成,结合 LoRA 层实现高效微调

数据整理流程

  1. 预处理: 关键帧提取、Florence-2 字幕生成、GPT-4o 名词提取、GroundingDINO 检测、SAM2 分割
  2. 过滤: 多阶段质量过滤(美学质量、边界框大小、重叠度、SAM 分数)
  3. 重新描述: GPT-4o 主体中心描述生成
  4. 后处理: 结果聚合、CSV 合并、训练/验证集划分

评估基准(OpenCustom)

  • 覆盖类别: 1,000+ 个类别
  • 构建方式: 融合 ImageNet-1K 和 MS-COCO
  • 评估指标(8项):
    • CLIP-T / Regional CLIP-T:文本-图像对齐(全帧/主体区域)
    • CLIP-I / Regional CLIP-I:参考图像相似度(全帧/主体区域)
    • DINO-I / Regional DINO-I:基于 DINO 的参考图像相似度(全帧/主体区域)
    • Motion Smoothness:生成视频的时间平滑度
    • Dynamic Degree:生成视频的运动量

可用性

  • 数据集将通过 HuggingFace 发布(待上线)
  • 评估基准 OpenCustom 提供统一协议,涵盖身份提取、上下文提示生成和多维度评估
搜集汇总
数据集介绍
PexelsCustom-1M 数据集图片
构建方式
在开放域个性化视频生成领域,大规模标注数据集的匮乏长期制约着模型对多样化身份属性特征的泛化学习能力。为填补这一空白,PexelsCustom-1M基于Pexels平台的海量公开视频,构建了一套系统化的数据策展流水线。该流水线首先通过关键帧提取与Florence-2模型生成初始描述,随后利用GPT-4o进行名词短语提取,并借助GroundingDINO与SAM2完成目标检测与分割。经过多阶段质量过滤,包括美学评分、边界框尺寸与重叠率评估,最后采用GPT-4o生成以目标主体为中心的重标注描述,形成包含8373个类别、共计一百万个(身份, 文本, 视频)三元组的大规模标注数据集。
使用方法
使用PexelsCustom-1M数据集时,研究者可首先从HuggingFace平台获取元数据CSV文件、参考图像及标注文件,视频源文件则需依据提供的视频ID从Pexels平台下载。配合CustomDiT训练框架,其采用两阶段训练策略:第一阶段无数据增强训练8000步以学习身份条件生成,第二阶段引入随机缩放、旋转与位移增强,额外微调2000步以增强模型鲁棒性。推理阶段需加载预训练的LoRA权重,并准备包含文本提示与参考图像路径的CSV文件,通过命令行脚本即可生成个性化视频。评估方面,OpenCustom基准融合了ImageNet-1K与MS-COCO的千余类别,提供包括CLIP系列、DINO系列及运动平滑度等八项指标的综合评价协议。
背景与挑战
背景概述
随着视频生成技术的迅猛发展,定制化视频生成领域面临缺乏大规模、高质量标注数据集的瓶颈。为此,中国科学技术大学、微软亚洲研究院与首尔国立大学的研究人员于2025年联合创建了PexelsCustom-1M数据集,该数据集作为首个公开的百万级身份保持视频生成数据集,包含100万个精心构建的(身份、文本、视频)三元组,覆盖8373个细粒度类别。该数据集旨在解决开放域定制化视频生成中身份特征保留与多样化场景迁移的核心科学问题,其提出的背景植根于现有基准仅涵盖100类而难以评估模型泛化能力的局限。PexelsCustom-1M的诞生为视频生成领域提供了标准化训练资源,推动了扩散变换器模型在身份感知生成中的突破性进展,其配套的OpenCustom评估协议更将基准类别扩展至1000余种,显著提升了领域研究的可复现性与可比性。
当前挑战
PexelsCustom-1M所解决的领域挑战在于开放域定制化视频生成任务中身份保持与场景泛化的天然矛盾:现有模型常因训练数据中身份特征与背景的混淆而产生复制粘贴问题,且难以在未见类别上维持生成质量。构建过程中面临的挑战尤为突出,包括从海量原始视频中自动提取主体身份的精准性——需融合Florence-2字幕生成、GPT-4o名词提取、GroundingDINO目标检测与SAM2分割等多模态管道;多阶段质量过滤的平衡难题,即在筛除低美学、小尺寸或遮挡过度的样本时避免数据量骤降;以及面向主体中心的重描述生成,需借助大语言模型将通用字幕转化为聚焦目标个体的结构化文本,从而确保百万级三元组的语义一致性与训练可用性。
常用场景
经典使用场景
PexelsCustom-1M是首个面向开放域身份保持视频生成的百万级数据集,其核心应用场景在于为定制化视频生成(CVG)任务提供大规模、高多样性的训练数据。该数据集以(身份标识、文本描述、视频片段)三元组形式组织,覆盖8,373个细粒度类别,每个样本均包含精准的边界框、分割掩码以及以主体为中心的文本描述。研究者可利用该数据集训练条件视频生成模型,使其能够在给定任意参考人像或物体图像的情况下,基于自然语言提示词生成保持其外观一致性的动态视频内容,从而突破传统闭集定制化生成的局限。
解决学术问题
该数据集解决了开放域身份保持视频生成领域长期面临的三大关键挑战:其一,现有数据集规模较小且类别覆盖极为有限(通常仅约100类),难以支撑模型对海量身份泛化能力的探索;其二,缺乏统一的高质量标注范式,导致不同工作间评估标准不统一、结果难以横向比较;其三,身份特征与视频内容的联动生成机制尚未得到系统研究。PexelsCustom-1M的发布不仅填补了大规模标注数据空白,还推动了身份保持生成从闭集迈向开域,显著提升了模型在未见类别上的零样本泛化能力。
实际应用
在实际应用中,该数据集驱动技术可广泛赋能影视内容制作、虚拟数字人构建、个性化广告生成和直播电商等场景。例如,创作者仅需提供一张模特照片和一句“穿着白色连衣裙在海边漫步”的提示词,即可自动生成包含该模特形象的高质量视频片段,免去重复拍摄之虞。在电商领域,平台可基于用户个人形象生成定制化产品展示视频,极大提升互动体验与转化率。此外,该技术还可用于虚拟教培、远程会议角色定制等场景,以极低成本实现精准身份呈现与内容创意融合。
数据集最近研究
最新研究方向
PexelsCustom-1M作为首个百万级开放域定制化视频生成数据集,填补了该领域大规模标注数据的空白。其核心贡献在于提出了包含8373类身份属性的(身份、文本、视频)三元组,并构建了基于扩散变换器的CustomDiT框架,通过偏置注入旋转位置编码和低秩适配层实现高效的身份感知视频生成。研究团队同时推出覆盖1000+类别的OpenCustom评估基准,融合ImageNet-1K与MS-COCO数据集,为身份保持视频生成提供了统一的多维度评测协议。该工作发表于ICASSP 2026,显著推动了开放域视频生成技术从有限类别向大规模通用化的演进,为生成式人工智能在影视创作、虚拟现实等领域的应用奠定了数据与算法基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务