遇见数据集

RenderMatte-Human-Multi-Street-2K

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

RenderMatte Human Multi-Person Street 2K 是一个合成的视频抠图(video matting)数据集,专门用于多人物场景。它基于单人物VideoMatting管线和素材库构建,采用相同的渲染和合成设置。数据集包含300个片段,每个片段时长6、7或8秒,帧率30fps,分辨率1920×1080。总共63,090张合成图像和63,090张16位alpha遮罩。训练集255个片段,测试集45个片段,两个分集在角色和背景上无重叠。片段包括120个三人全身、120个两人全身和60个两人半身场景。使用了78个不同的3D角色(训练集64个,测试集14个),每个角色最多出现13次。背景来自127个真实视频片段,主要是户外白天的街道和步行街,训练集和测试集背景无重叠。每个片段文件夹包含合成图像(JPEG)、遮罩(PNG)、预览视频、元数据JSON文件。注意:每个片段只有一个遮罩,合并了所有角色的alpha通道,不支持单人遮罩。角色高度统一(1.60–1.85米),不匹配背景中行人的实际大小。合成图像为JPEG无色度子采样,遮罩为无损16位PNG。角色之间不重叠,背景中包含真实行人但不在遮罩中。数据集仅限研究用途,不可商用或再分发。制作过程包括动作生成、分组、Blender Cycles渲染(64样本+降噪)、合成到背景视频上。所有片段通过自动化质量检查,包括遮罩连通性、角色不触碰边框、高度匹配、边缘柔和、帧数完整等。已知限制包括角色无接触阴影、背景为平面视频、无单人遮罩、半身片段渲染较慢等。版本v2进行了角色替换、动作重选、半身裁剪调整等改进。

RenderMatte Human Multi-Person Street 2K is a synthetic video matting dataset specifically designed for multi-person scenes. It is constructed based on a single-person VideoMatting pipeline and asset library, using the same rendering and compositing settings. The dataset contains 300 clips, each lasting 6, 7, or 8 seconds, at 30fps, with a resolution of 1920×1080. In total, there are 63,090 synthetic images and 63,090 16-bit alpha masks. The training set has 255 clips, and the test set has 45 clips, with no overlap in characters or backgrounds between the two splits. Clips include 120 three-person full-body, 120 two-person full-body, and 60 two-person half-body scenes. A total of 78 distinct 3D characters are used (64 in training, 14 in test), with each character appearing at most 13 times. Backgrounds come from 127 real video clips, primarily outdoor daytime streets and pedestrian areas, with no background overlap between training and test sets. Each clip folder contains composite images (JPEG), masks (PNG), preview videos, and metadata JSON files. Note: each clip has only one mask that combines alpha channels of all characters; individual character masks are not available. Character heights are uniform (1.60–1.85m) and do not match the actual sizes of pedestrians in the background. Composite images are JPEG without chroma subsampling, masks are lossless 16-bit PNG. Characters do not overlap with each other; background contains real pedestrians but they are not included in the mask. The dataset is restricted to research purposes only, not for commercial use or redistribution. The production process includes motion generation, grouping, Blender Cycles rendering (64 samples + denoising), and compositing onto background videos. All clips pass automated quality checks including mask connectivity, characters not touching borders, height matching, edge softness, frame completeness, etc. Known limitations include no contact shadows, flat video backgrounds, no single-person masks, slower rendering of half-body clips, etc. Version v2 features character replacements, motion reselection, and half-body cropping adjustments.

创建时间:
2026-09-19
原始信息汇总

RenderMatte Human Multi-Person Street 2K 数据集概述

基本信息

  • 数据集名称:RenderMatte Human Multi-Person Street 2K
  • 许可证:其他(仅限研究用途,research-only)
  • 许可证链接:LICENSE
  • 任务类型:视频抠图、alpha 抠图、人物抠图
  • 场景类型:多人
  • 数据类型:合成数据
  • 数据规模:10K < n < 100K
  • 数据集地址:https://huggingface.co/datasets/Deanshy1/RenderMatte-Human-Multi-Street-2K

数据集简介

该数据集是一个用于多人场景的合成视频抠图数据集。通过将两到三个绑定骨骼的 3D 人物角色在同一个 Blender(Cycles)场景中动画化并渲染,再合成到真实街道视频素材上。每一帧都配有 16 位 alpha 蒙版。

该数据集构建于单人 VideoMatting 流程及其源素材集合之上,并尽可能保持相同的渲染与合成设置。

仅限研究使用。 角色模型、动作和背景视频来自 VideoMatting 源素材集合,并非所有源素材的许可证都已审核。仅可用于非商业研究;不得再分发或商用(参见 LICENSE)。

数据概览

项目 说明
片段数 300
划分 训练 255 / 测试 45。两个划分之间不共享任何角色和背景片段。
构成 120 × 三人全身、120 × 两人全身、60 × 两人半身
时长 30 fps 下 6 秒 / 7 秒 / 8 秒 → 180 / 210 / 240 帧(101 / 95 / 104 个片段)
帧数 63,090 合成帧 + 63,090 蒙版
分辨率 1920 × 1080
角色 78 个不同角色,720 次出场,单个角色最多出现 13 次(中位数 11)。训练使用 64 个,测试使用另外 14 个,无重叠。
背景 127 个真实视频片段,每个最多使用 4 次,起始时间错开。当片段太短无法容纳四个独立窗口时,窗口会重叠:在共享片段的 267 个片段对中,230 个在时间上重叠(中位重叠为较短片段的 86%,29 对几乎完全重叠)。因此这些片段并非独立样本,尽管其角色、动作和位置总是不同。训练与测试完全不共享片段。
场景 户外日间场景,主要是街道和步行街。片段来自三个素材库:124 个片段 / 291 个片段来自通用城市与景观素材库,2 个片段 / 6 个片段为森林主题,1 个片段 / 3 个片段为室内场所。
大小 总计 35.4 GB:合成帧 30.3 GB,蒙版 4.5 GB,预览视频 0.7 GB,元数据 10 MB

目录结构

每个片段一个文件夹。文件夹名称编码划分和构成: g3f = 三人全身,g2f = 两人全身,g2h = 两人半身。

<train|test>/<clip>/ 例如 train/train_g3f_0014/ ├── composite/00001.jpg … 1920×1080 RGB:角色合成到背景上 ├── mask/00001.png … 1920×1080 单通道,16 位:alpha 蒙版 ├── video/preview_1920x1080.mp4 该片段的 H.264 预览 ├── record.json 角色、背景片段和时间窗口、动作预设、 │ 指定身高、位置、QC 结果 └── group_report.json 相机、光照、每个角色的最终实测身高、 每帧秒数、渲染后端

composite/NNNNN.jpg 与 mask/NNNNN.png 编号相同者配对。编号从 00001 开始,在片段内连续。

python import cv2 clip = "train/train_g3f_0014" rgb = cv2.imread(f"{clip}/composite/00001.jpg")[..., ::-1] # H×W×3 uint8, RGB alpha = cv2.imread(f"{clip}/mask/00001.png", cv2.IMREAD_UNCHANGED) / 65535.0 # H×W float in [0, 1]

约定

  • 每组一个蒙版,而非每人一个。 一个片段中的所有角色合并为单个 alpha 通道(0 = 背景,65535 = 角色,边缘和头发处为软值)。因此无法监督“仅人物 2 的蒙版”。
  • 合成帧为 JPEG(-q:v 3 -pix_fmt yuvj444p,无色度子采样)——与单人流程使用的设置相同。无法从中恢复精确的前景和背景层。蒙版为无损 16 位 PNG。
  • 角色大小统一,不与背景匹配。 在全身片段中,角色约占帧高的一半,脚部位于帧高的 90% 处;在半身片段中,帧底部切过小腿,位于角色自身身高的 20–25%(膝盖以下),角色几乎填满帧高。角色大小未根据背景中真实行人的表观大小进行调整。
  • 身高归一化为 1.60–1.85 m。 group_report.json → heights_m 是实际应用的身高(已验证所有 720 次出场均落在 [1.600, 1.850] 区间)。注意 record.json → character_height 是源模型自身的测量值,不在一致的单位中——有些模型报告厘米(例如 185.9)或任意单位(例如 1.12、4.95)。请使用 heights_m。
  • 角色之间不重叠。 它们从左到右分布并逐帧检查;整个发布版中两个角色之间的最小间隙为 0.14 m(最宽处 0.45 m)。
  • 背景包含真实人物。 大多数片段中某处有行人、骑行者或车辆。在预期使用场景中抠图是提示导向的,因此这不影响标签。真实行人当然不包含在蒙版中。
  • 无近距离前景遮挡物。 每个片段都选择了一个时间窗口,在此期间没有东西在角色所站区域前方走动或行驶;静态物体(杆、树干、栏杆、停放的车)已逐片段目视筛查。
  • 相机缓慢漂移。 在 208 个片段中背景相机漂移。角色和蒙版逐帧跟随背景,因此看起来是静止站立。未使用抖动素材。

制作方法

  1. 每个角色: 生成动作并通过单人流程自身的检查,然后缓存每帧边界框。上游代码未修改。
  2. 分组: 将 2–3 个角色放置在一个场景中,身高归一化,动作开始时间错开,从左到右分布并逐帧非重叠检查,由一个共享的正交相机取景。
  3. 渲染: Blender 5.0.1,Cycles,64 采样并去噪,透明背景,16 位 RGBA。
  4. 合成: 蒙版即渲染的 alpha 通道;合成帧将角色叠加到背景视频对应的时间窗口上。

36 个片段在 GPU 上渲染,264 个在 CPU 上渲染(GPU 队列较慢)。两种后端通过一个组分别用两种方式重渲染(12 帧)进行了交叉验证:蒙版 IoU 为 0.99999,没有任何像素差异超过 0.1/65535,合成帧 PSNR 至少为 56.9 dB,角色区域平均差异为 0.57/255,角色区域外差异恰好为零。

质量检查

每个片段自动通过以下所有检查:

  • 蒙版中连通分量数不超过角色数量(可捕捉头发或配饰飞散);
  • 没有角色触碰帧边界;
  • 组在帧中的身高与计划相符;
  • 蒙版具有软边缘(非硬二值掩码);
  • 合成帧和蒙版帧数完整且相等。

全部 300 个片段均通过(record.json → qc.verdict == "PASS")。帧还经过目视抽查。

已知限制

  • 角色没有接触阴影,且永远不会被背景中的物体遮挡——这就是选择无近距离前景遮挡物时间窗口的原因。这两点同样适用于单人数据。
  • 背景是平面视频,没有真实地面起伏;所有角色的脚落在同一条线上。
  • 每组一个蒙版,因此无法进行逐人监督。
  • 在半身片段中角色较大,长发角色渲染缓慢(每帧最长 78 秒;整个发布版的中位数为 12.4 秒)。
  • record.json 包含渲染集群上的绝对路径和源素材的原始文件名。它们保留用于溯源,并非意在在其他机器上解析。

修订历史

v2(2026-09-30)。 在单人流程作者对 v1 审核后重建。300 个片段中有 264 个重新渲染;背景、时间窗口、组大小、相机工作和片段长度未变。

  • 替换演员阵容。 原始 147 个角色中删除了 70 个:7 个身体网格在渲染帧中透过或低于服装显露解剖结构,42 个在渲染帧中的服装为内衣、丁字裤、泳装或渔网,以及另外 21 个与上述之一共享身体网格的服装变体。抠图难度在于服装边缘、下摆和头发,因此近乎裸露的人物阵容也会使数据比其意在替代的真实素材更容易。剩余池为 78 个角色,这就是为什么单个角色现在最多出现 13 次而非 6 次。
  • 重新挑选动作,针对报告为变形或抽搐的 54 个角色实例(47 个片段)。
  • 半身裁剪降低,从角色身高的 40% 降至 20–25%,因此帧现在切在膝盖以下而非大腿中部。这影响全部 60 个半身片段。
  • 移除一个杂散道具。 一个角色自带一件设备停在原点,在 10 个片段中渲染为其脚下躺着的物体。
  • 更宽的间距,在 3 个片段中两个角色相交。

本发布版中的每个片段均通过自动检查,各片段的 record.json / group_report.json 描述实际渲染的版本。

搜集汇总
数据集介绍
RenderMatte-Human-Multi-Street-2K 数据集图片
构建方式
该数据集依托单人称视频抠像管线及其源素材库构建,将两至三名骨骼绑定三维人物角色置于同一Blender(Cycles)场景中动画化并渲染,再合成至真实街景视频之上。每一帧均同步输出16位alpha遮罩,渲染与合成参数尽可能沿用单人称管线的既有设置,并额外引入逐帧非重叠校验、身高归一化与运动起始时间错位等组级控制,最终经自动质检筛选出全部合格片段。
特点
数据集涵盖300个片段,总计63090帧1920×1080合成图与等量遮罩,包含三人全身、两人全身及两人半身三种构图。片段时长6至8秒,帧率30fps,训练集与测试集在人物和背景段上均无交集。遮罩为无损16位PNG且每组合并为一通道,人物身高统一归一化至1.60至1.85米,角色互不重叠,背景为户外日间街景且无近距离前景遮挡。
使用方法
使用时按片段目录组织读取,composite目录下JPEG为RGB合成图,mask目录下同编号PNG为单通道16位alpha遮罩,两者一一对应。可借助OpenCV等库加载图像并将遮罩归一化至[0,1],配合record.json与group_report.json中的人物、背景时间段、运动预设及身高信息进行训练或评测。该数据集仅限非商业研究用途,不得再分发或用于商业场景。
背景与挑战
背景概述
视频抠图旨在从视频序列中逐帧估计前景的透明度,是影视后期、虚拟现实与实时直播等应用的核心技术。然而,现有多数公开数据集聚焦于单人物场景,难以支撑多人交互下的算法评估与训练。RenderMatte-Human-Multi-Street-2K数据集于2026年发布,由视频抠图领域的研究人员基于单人物VideoMatting管线构建。该数据集包含300个合成视频片段、63090帧合成图像与对应16位alpha蒙版,涵盖两至三人、全身与半身构图,并置于真实街景背景中。其核心研究问题在于为多人视频抠图提供像素级标注,推动算法在复杂人物组合与真实背景下的鲁棒性研究,对视频编辑与增强现实等领域具有重要支撑价值。
当前挑战
多人视频抠图本身面临人物间相互遮挡、边缘与发丝细节保持、以及前景与背景运动不一致等固有难题。在构建该数据集时,挑战亦贯穿始终:合成人物需与真实街景在透视、尺度与光照上自然融合,但人物尺寸被统一归一化而非匹配背景中行人的真实大小,且缺失接触阴影与前景遮挡,导致合成数据与真实场景存在域差异;每帧仅提供一个整组alpha蒙版,无法进行逐人监督,限制了细粒度多人分析;半身裁剪比例和长发人物的渲染耗时进一步增加了数据生成成本。这些因素共同构成该数据集在推动多人视频抠图研究时需直面的核心挑战。
常用场景
经典使用场景
在视频抠像与 alpha 遮罩估计领域,多人物街景场景长期受制于真实标注数据的稀缺。RenderMatte-Human-Multi-Street-2K 以合成渲染范式为基石,将两至三名骨骼绑定三维人物在 Blender Cycles 中统一动画并渲染,随后与真实街景视频合成,每帧配套 16 位高精度 alpha 遮罩。该数据集最经典的使用场景在于训练与评测多人物视频抠像模型,尤其是需要处理人物间非重叠布局、软边缘与发丝细节的深度网络,其 1920×1080 分辨率与 30 fps 时长设计贴合时序抠像架构的输入需求,为算法提供像素级监督信号。
实际应用
在实际应用中,该数据集支撑着影视后期制作、虚拟制片、视频会议背景替换与增强现实等场景的算法研发。影视与短视频创作常需将多个人物从街景中精准分离以进行背景替换或特效合成,而本数据集提供的合成复合帧与对应 alpha 遮罩可直接用于训练端到端抠像网络,使其在人物边缘、发丝与半透明区域获得稳健表现。此外,数据集中背景包含真实行人、车辆等动态元素,而遮罩仅覆盖合成角色,这一设定贴合提示引导抠像的实际需求,为交互式视频编辑工具提供了贴近真实部署条件的训练资源。
衍生相关工作
该数据集衍生于单人物 VideoMatting 合成管线,并在其基础上扩展至多人物场景,因而与一系列视频抠像基准工作形成谱系关联。围绕该数据集的典型后续工作包括多人物时序抠像网络的设计与评测、软遮罩边缘细化方法的验证,以及合成到真实域自适应技术的探索。其 16 位无损遮罩与 JPEG 复合帧的分离存储方式,亦被用于研究压缩伪影对抠像监督的影响。同时,该数据集对人物身高归一化、非重叠布局与背景时间窗口的精细控制,为后续合成数据集的构建提供了可复用的质量控制范式,推动了视频抠像数据生成方法的规范化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务