RenderMatte-Human-Multi-Street-2K
收藏资源简介:
RenderMatte Human Multi-Person Street 2K 是一个合成的视频抠图(video matting)数据集,专门用于多人物场景。它基于单人物VideoMatting管线和素材库构建,采用相同的渲染和合成设置。数据集包含300个片段,每个片段时长6、7或8秒,帧率30fps,分辨率1920×1080。总共63,090张合成图像和63,090张16位alpha遮罩。训练集255个片段,测试集45个片段,两个分集在角色和背景上无重叠。片段包括120个三人全身、120个两人全身和60个两人半身场景。使用了78个不同的3D角色(训练集64个,测试集14个),每个角色最多出现13次。背景来自127个真实视频片段,主要是户外白天的街道和步行街,训练集和测试集背景无重叠。每个片段文件夹包含合成图像(JPEG)、遮罩(PNG)、预览视频、元数据JSON文件。注意:每个片段只有一个遮罩,合并了所有角色的alpha通道,不支持单人遮罩。角色高度统一(1.60–1.85米),不匹配背景中行人的实际大小。合成图像为JPEG无色度子采样,遮罩为无损16位PNG。角色之间不重叠,背景中包含真实行人但不在遮罩中。数据集仅限研究用途,不可商用或再分发。制作过程包括动作生成、分组、Blender Cycles渲染(64样本+降噪)、合成到背景视频上。所有片段通过自动化质量检查,包括遮罩连通性、角色不触碰边框、高度匹配、边缘柔和、帧数完整等。已知限制包括角色无接触阴影、背景为平面视频、无单人遮罩、半身片段渲染较慢等。版本v2进行了角色替换、动作重选、半身裁剪调整等改进。
RenderMatte Human Multi-Person Street 2K is a synthetic video matting dataset specifically designed for multi-person scenes. It is constructed based on a single-person VideoMatting pipeline and asset library, using the same rendering and compositing settings. The dataset contains 300 clips, each lasting 6, 7, or 8 seconds, at 30fps, with a resolution of 1920×1080. In total, there are 63,090 synthetic images and 63,090 16-bit alpha masks. The training set has 255 clips, and the test set has 45 clips, with no overlap in characters or backgrounds between the two splits. Clips include 120 three-person full-body, 120 two-person full-body, and 60 two-person half-body scenes. A total of 78 distinct 3D characters are used (64 in training, 14 in test), with each character appearing at most 13 times. Backgrounds come from 127 real video clips, primarily outdoor daytime streets and pedestrian areas, with no background overlap between training and test sets. Each clip folder contains composite images (JPEG), masks (PNG), preview videos, and metadata JSON files. Note: each clip has only one mask that combines alpha channels of all characters; individual character masks are not available. Character heights are uniform (1.60–1.85m) and do not match the actual sizes of pedestrians in the background. Composite images are JPEG without chroma subsampling, masks are lossless 16-bit PNG. Characters do not overlap with each other; background contains real pedestrians but they are not included in the mask. The dataset is restricted to research purposes only, not for commercial use or redistribution. The production process includes motion generation, grouping, Blender Cycles rendering (64 samples + denoising), and compositing onto background videos. All clips pass automated quality checks including mask connectivity, characters not touching borders, height matching, edge softness, frame completeness, etc. Known limitations include no contact shadows, flat video backgrounds, no single-person masks, slower rendering of half-body clips, etc. Version v2 features character replacements, motion reselection, and half-body cropping adjustments.
RenderMatte Human Multi-Person Street 2K 数据集概述
基本信息
- 数据集名称:RenderMatte Human Multi-Person Street 2K
- 许可证:其他(仅限研究用途,research-only)
- 许可证链接:LICENSE
- 任务类型:视频抠图、alpha 抠图、人物抠图
- 场景类型:多人
- 数据类型:合成数据
- 数据规模:10K < n < 100K
- 数据集地址:https://huggingface.co/datasets/Deanshy1/RenderMatte-Human-Multi-Street-2K
数据集简介
该数据集是一个用于多人场景的合成视频抠图数据集。通过将两到三个绑定骨骼的 3D 人物角色在同一个 Blender(Cycles)场景中动画化并渲染,再合成到真实街道视频素材上。每一帧都配有 16 位 alpha 蒙版。
该数据集构建于单人 VideoMatting 流程及其源素材集合之上,并尽可能保持相同的渲染与合成设置。
仅限研究使用。 角色模型、动作和背景视频来自 VideoMatting 源素材集合,并非所有源素材的许可证都已审核。仅可用于非商业研究;不得再分发或商用(参见
LICENSE)。
数据概览
| 项目 | 说明 |
|---|---|
| 片段数 | 300 |
| 划分 | 训练 255 / 测试 45。两个划分之间不共享任何角色和背景片段。 |
| 构成 | 120 × 三人全身、120 × 两人全身、60 × 两人半身 |
| 时长 | 30 fps 下 6 秒 / 7 秒 / 8 秒 → 180 / 210 / 240 帧(101 / 95 / 104 个片段) |
| 帧数 | 63,090 合成帧 + 63,090 蒙版 |
| 分辨率 | 1920 × 1080 |
| 角色 | 78 个不同角色,720 次出场,单个角色最多出现 13 次(中位数 11)。训练使用 64 个,测试使用另外 14 个,无重叠。 |
| 背景 | 127 个真实视频片段,每个最多使用 4 次,起始时间错开。当片段太短无法容纳四个独立窗口时,窗口会重叠:在共享片段的 267 个片段对中,230 个在时间上重叠(中位重叠为较短片段的 86%,29 对几乎完全重叠)。因此这些片段并非独立样本,尽管其角色、动作和位置总是不同。训练与测试完全不共享片段。 |
| 场景 | 户外日间场景,主要是街道和步行街。片段来自三个素材库:124 个片段 / 291 个片段来自通用城市与景观素材库,2 个片段 / 6 个片段为森林主题,1 个片段 / 3 个片段为室内场所。 |
| 大小 | 总计 35.4 GB:合成帧 30.3 GB,蒙版 4.5 GB,预览视频 0.7 GB,元数据 10 MB |
目录结构
每个片段一个文件夹。文件夹名称编码划分和构成:
g3f = 三人全身,g2f = 两人全身,g2h = 两人半身。
<train|test>/<clip>/ 例如 train/train_g3f_0014/ ├── composite/00001.jpg … 1920×1080 RGB:角色合成到背景上 ├── mask/00001.png … 1920×1080 单通道,16 位:alpha 蒙版 ├── video/preview_1920x1080.mp4 该片段的 H.264 预览 ├── record.json 角色、背景片段和时间窗口、动作预设、 │ 指定身高、位置、QC 结果 └── group_report.json 相机、光照、每个角色的最终实测身高、 每帧秒数、渲染后端
composite/NNNNN.jpg 与 mask/NNNNN.png 编号相同者配对。编号从 00001 开始,在片段内连续。
python import cv2 clip = "train/train_g3f_0014" rgb = cv2.imread(f"{clip}/composite/00001.jpg")[..., ::-1] # H×W×3 uint8, RGB alpha = cv2.imread(f"{clip}/mask/00001.png", cv2.IMREAD_UNCHANGED) / 65535.0 # H×W float in [0, 1]
约定
- 每组一个蒙版,而非每人一个。 一个片段中的所有角色合并为单个 alpha 通道(0 = 背景,65535 = 角色,边缘和头发处为软值)。因此无法监督“仅人物 2 的蒙版”。
- 合成帧为 JPEG(
-q:v 3 -pix_fmt yuvj444p,无色度子采样)——与单人流程使用的设置相同。无法从中恢复精确的前景和背景层。蒙版为无损 16 位 PNG。 - 角色大小统一,不与背景匹配。 在全身片段中,角色约占帧高的一半,脚部位于帧高的 90% 处;在半身片段中,帧底部切过小腿,位于角色自身身高的 20–25%(膝盖以下),角色几乎填满帧高。角色大小未根据背景中真实行人的表观大小进行调整。
- 身高归一化为 1.60–1.85 m。
group_report.json→heights_m是实际应用的身高(已验证所有 720 次出场均落在 [1.600, 1.850] 区间)。注意record.json→character_height是源模型自身的测量值,不在一致的单位中——有些模型报告厘米(例如 185.9)或任意单位(例如 1.12、4.95)。请使用heights_m。 - 角色之间不重叠。 它们从左到右分布并逐帧检查;整个发布版中两个角色之间的最小间隙为 0.14 m(最宽处 0.45 m)。
- 背景包含真实人物。 大多数片段中某处有行人、骑行者或车辆。在预期使用场景中抠图是提示导向的,因此这不影响标签。真实行人当然不包含在蒙版中。
- 无近距离前景遮挡物。 每个片段都选择了一个时间窗口,在此期间没有东西在角色所站区域前方走动或行驶;静态物体(杆、树干、栏杆、停放的车)已逐片段目视筛查。
- 相机缓慢漂移。 在 208 个片段中背景相机漂移。角色和蒙版逐帧跟随背景,因此看起来是静止站立。未使用抖动素材。
制作方法
- 每个角色: 生成动作并通过单人流程自身的检查,然后缓存每帧边界框。上游代码未修改。
- 分组: 将 2–3 个角色放置在一个场景中,身高归一化,动作开始时间错开,从左到右分布并逐帧非重叠检查,由一个共享的正交相机取景。
- 渲染: Blender 5.0.1,Cycles,64 采样并去噪,透明背景,16 位 RGBA。
- 合成: 蒙版即渲染的 alpha 通道;合成帧将角色叠加到背景视频对应的时间窗口上。
36 个片段在 GPU 上渲染,264 个在 CPU 上渲染(GPU 队列较慢)。两种后端通过一个组分别用两种方式重渲染(12 帧)进行了交叉验证:蒙版 IoU 为 0.99999,没有任何像素差异超过 0.1/65535,合成帧 PSNR 至少为 56.9 dB,角色区域平均差异为 0.57/255,角色区域外差异恰好为零。
质量检查
每个片段自动通过以下所有检查:
- 蒙版中连通分量数不超过角色数量(可捕捉头发或配饰飞散);
- 没有角色触碰帧边界;
- 组在帧中的身高与计划相符;
- 蒙版具有软边缘(非硬二值掩码);
- 合成帧和蒙版帧数完整且相等。
全部 300 个片段均通过(record.json → qc.verdict == "PASS")。帧还经过目视抽查。
已知限制
- 角色没有接触阴影,且永远不会被背景中的物体遮挡——这就是选择无近距离前景遮挡物时间窗口的原因。这两点同样适用于单人数据。
- 背景是平面视频,没有真实地面起伏;所有角色的脚落在同一条线上。
- 每组一个蒙版,因此无法进行逐人监督。
- 在半身片段中角色较大,长发角色渲染缓慢(每帧最长 78 秒;整个发布版的中位数为 12.4 秒)。
record.json包含渲染集群上的绝对路径和源素材的原始文件名。它们保留用于溯源,并非意在在其他机器上解析。
修订历史
v2(2026-09-30)。 在单人流程作者对 v1 审核后重建。300 个片段中有 264 个重新渲染;背景、时间窗口、组大小、相机工作和片段长度未变。
- 替换演员阵容。 原始 147 个角色中删除了 70 个:7 个身体网格在渲染帧中透过或低于服装显露解剖结构,42 个在渲染帧中的服装为内衣、丁字裤、泳装或渔网,以及另外 21 个与上述之一共享身体网格的服装变体。抠图难度在于服装边缘、下摆和头发,因此近乎裸露的人物阵容也会使数据比其意在替代的真实素材更容易。剩余池为 78 个角色,这就是为什么单个角色现在最多出现 13 次而非 6 次。
- 重新挑选动作,针对报告为变形或抽搐的 54 个角色实例(47 个片段)。
- 半身裁剪降低,从角色身高的 40% 降至 20–25%,因此帧现在切在膝盖以下而非大腿中部。这影响全部 60 个半身片段。
- 移除一个杂散道具。 一个角色自带一件设备停在原点,在 10 个片段中渲染为其脚下躺着的物体。
- 更宽的间距,在 3 个片段中两个角色相交。
本发布版中的每个片段均通过自动检查,各片段的 record.json / group_report.json 描述实际渲染的版本。





