遇见数据集

prison-unreal-synthetic

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集为“Prison yard: Unreal Engine synthetic capture”,是一个由 Unreal Engine 5.8.1 渲染的合成目标检测与实例分割数据集。包含 300 帧图像,分辨率为 1280×960,水平视场角 57.3 度,模拟了从 07:00 到 19:00 的监狱场景。所有标注(边界框和实例分割掩码)均直接读取自引擎的实例 ID 缓冲区,无需人工标注或模型生成,共包含 11,428 个标注实例。数据集涵盖 12 个类别:人(2,890)、桶(1,124)、板条箱(1,001)、箱子(1,120)、托盘(766)、长凳(843)、床垫(613)、桌子(557)、篮球(585)、桶(672)、锥筒(618)、轮胎(639)。根据 COCO 尺度,小目标 6,846 个,中等目标 4,128 个,大目标 454 个,平均边界框覆盖帧面积的 0.15%,属于小目标数据集。文件结构包括 images/(RGB 帧,PNG)、segmentation/(实例分割掩码,每个实例一种颜色)、labels/(YOLO 格式文本)、annotations/(COCO 格式)、metadata/(每帧相机、角色和生成记录)、reports/(验证报告)和 capture.json(运行契约)。数据集质量验证通过:0 张损坏图像,0 帧无标签,0 近重复图像,0 跨分割泄漏,平均亮度 102.6。已知局限包括类别不平衡(最稀有/最常用类比率 0.193)、0.21% 的引擎可见人物未标记(6/2816)、视角范围有限(8 个相机区域)以及合成到真实的域差距。该数据集适用于目标检测、实例分割、模拟到真实迁移学习等任务,可用作预训练或数据增强材料,但不宜替代真实评估集。

This dataset, named "Prison yard: Unreal Engine synthetic capture", is a synthetic object detection and instance segmentation dataset rendered by Unreal Engine 5.8.1. It contains 300 frames with a resolution of 1280×960, a horizontal field of view of 57.3 degrees, simulating a prison yard scene from 07:00 to 19:00. All annotations (bounding boxes and instance segmentation masks) are directly read from the engines instance ID buffer, requiring no manual annotation or model generation, totaling 11,428 annotated instances. The dataset covers 12 categories: person (2,890), barrel (1,124), crate (1,001), box (1,120), pallet (766), bench (843), mattress (613), table (557), basketball (585), bucket (672), cone (618), and tire (639). According to COCO size criteria, there are 6,846 small objects, 4,128 medium objects, and 454 large objects, with an average bounding box covering 0.15% of the frame area, making it a small object dataset. The file structure includes images/ (RGB frames, PNG), segmentation/ (instance segmentation masks, one color per instance), labels/ (YOLO format text), annotations/ (COCO format), metadata/ (camera, character, and generation records per frame), reports/ (validation reports), and capture.json (run contract). Dataset quality validation passed: 0 corrupted images, 0 frames without labels, 0 near-duplicate images, 0 cross-segmentation leaks, average brightness 102.6. Known limitations include class imbalance (rarest/most common class ratio 0.193), 0.21% of engine-visible persons unlabeled (6/2816), limited viewpoint range (8 camera regions), and synthetic-to-real domain gap. The dataset is suitable for tasks such as object detection, instance segmentation, and sim-to-real transfer learning, and can be used as pre-training or data augmentation material, but should not replace real evaluation sets.

创建时间:
2026-08-20
原始信息汇总

数据集概述:Prison yard(虚幻引擎合成采集数据)

基本信息

  • 数据集名称:Prison yard: Unreal Engine synthetic capture(监狱院子:虚幻引擎合成采集)
  • 许可证:其他(sample-capture-terms,具体条款见 LICENSE 文件)
  • 任务类型:目标检测、图像分割
  • 标签:合成数据、虚幻引擎、计算机视觉、目标检测、实例分割、sim2real
  • 数据规模:少于 1K 样本(共 300 帧)
  • 标注来源:机器生成(引擎实例 ID 缓冲区直接读取)

数据采集详情

项目 数值
引擎版本 5.8.1-56057345+++UE5+Release-5.8
地图 Prison_DemoMap_Daytime
帧数 300 帧
实例总数 11,428 个标注对象
分辨率 1280 x 960
水平视场角 57.3 度
相机策略 camera_zones_look_at_target,8 个作者自定义区域
镜头配置 realistic_drone at 0.6
时间范围 07:00 至 19:00
天气 场景固定(300 帧)
主种子 20260822
验证评分 A 级,93.5/100

标注特点:所有边界框和掩码均从引擎的逐实例 ID 缓冲区在渲染时直接读取。无模型生成、无人工绘制,标签准确性取决于场景描述的正确性。配置确定性采样(deterministic_per_logical_frame_and_instance),相同种子和场景可复现相同的 300 帧。

类别分布

ID 类别 实例数
0 person(人) 2,890
1 barrel(桶) 1,124
2 crate(板条箱) 1,001
3 box(盒子) 1,120
4 pallet(托盘) 766
5 bench(长凳) 843
6 mattress(床垫) 613
7 table(桌子) 557
8 basketball(篮球) 585
9 bucket(水桶) 672
10 cone(锥桶) 618
11 tire(轮胎) 639

目标尺度分布(按 COCO 阈值):小目标 6,846 个,中目标 4,128 个,大目标 454 个。平均边界框覆盖画面约 0.15%,属于小目标采集数据集。

文件结构

images/ 渲染 RGB 帧,未修改的 PNG segmentation/ 逐实例 ID 缓冲区,每个实例一种颜色 labels/ YOLO 格式框,每帧一个文本文件 annotations/ 相同标签的 COCO 格式文件 metadata/ 每帧相机、演员和生成清单记录 reports/ 采集报告和验证输出 capture.json 运行契约:类别、相机策略、种子 data.yaml 类别名称,可直接用于 YOLO 训练器

  • 帧号 Nimages/segmentation/labels/metadata/ 中对应同一场景。
  • 未预设划分:全部 300 帧位于同一池中,可根据实验需要自行划分。
  • 解码分割 PNG 时需注意通道顺序,实例颜色为精确 8 位值,通道交换会导致掩码查找失败。

质量验证

来自 reports/validation.json 的验证结果:

  • 损坏图像:0/300
  • 无标签帧:0
  • 近似重复图像:0
  • 跨划分泄漏:0
  • 平均亮度 102.6;7 帧欠曝光,0 帧过曝光
  • 逐帧核对:300 帧请求、300 帧图像、300 个标签文件、11,428 条标注

已知局限

  • 验证器因 类别不平衡 扣 6.46 分:最稀有/最常见类别比率为 0.193
  • 6/2816(0.21%)引擎可见人物未标注(覆盖 300/300 帧)
  • 相机布局来自 8 个作者自定义区域,视角和距离范围较窄,属于单环境样本而非基准
  • 渲染图像存在合成到真实的域差距,适合作为预训练或增强材料而非真实世界评测集的替代

来源与使用条款

  • 帧由 NameFrameCapture(编辑器插件)在虚幻引擎中渲染并从引擎实例缓冲区标注;capture.json 包含完整构建记录、插件和任务哈希
  • 场景中的环境和道具资产为第三方许可用于虚幻引擎项目;此处仅发布渲染图像及标签,不包含源资产、.uasset 或地图文件
  • 重新分发图像前须阅读 LICENSE 文件
  • 采集管道、系列中的其他环境及相关测量记录详见 https://getnameframe.com(此链接为普通文本,未访问验证)
搜集汇总
数据集介绍
prison-unreal-synthetic 数据集图片
构建方式
该数据集基于虚幻引擎5.8.1构建,于单一囚犯庭院场景中,通过确定性采样生成300帧合成图像,共包含11,428个标注实例。每帧图像的边界框与分割掩码均直接读取自引擎的实例ID缓冲区,避免了人工标注与模型预测的误差。相机姿态、物体摆放及场景光照均受控于主种子(20260822),确保实验可复现。图像分辨率为1280×960,涵盖12个类别,物体尺度偏向小目标,平均框面积仅占帧面的0.15%。标注格式兼容YOLO与COCO,并附带逐帧元数据与验证报告。
使用方法
该数据集适用于目标检测与实例分割模型的预训练或数据增强,尤其适合sim2real迁移学习。数据未预设分割,用户可根据实验需求自定义训练/验证集划分。使用时应结合`data.yaml`文件快速适配YOLO框架,或采用`annotations/`下的COCO格式进行常规训练。解码分割掩码时需注意通道顺序,避免因通道交换导致的掩码错位。建议将合成数据与真实数据混合使用,以缓解域差距影响。
背景与挑战
背景概述
该数据集由NameFrameCapture插件在虚幻引擎5.8.1中渲染生成,创建于2026年,由该工具的开发团队发布。其核心研究问题在于利用合成数据弥合模拟与真实世界之间的鸿沟,为小目标检测与实例分割提供高质量的训练素材。数据集包含300帧来自单一监狱庭院场景的渲染图像,共标注11,428个实例,覆盖12个类别,标注信息直接源于引擎的实例ID缓冲,确保了标签的精确性。该数据集在模拟到现实迁移(sim2real)领域具有潜在影响力,可作为预训练或数据增强工具,为计算机视觉模型在复杂环境下的泛化能力提供支持。
当前挑战
该领域面临的挑战包括:合成数据与现实世界之间的域差距,使得模型在真实场景中性能下降;以及小目标检测的固有难度,数据集中平均框面积仅占帧的0.15%,超过一半的实例为小目标,对特征提取和定位精度提出高要求。在构建过程中,挑战主要体现在:确保标签的绝对准确性,尽管依赖引擎缓冲,仍需校验场景描述的正确性;相机视角受限于8个设定区域,导致视角多样性不足;类别不平衡问题显著,最稀有与最常见类别比例仅为0.193,可能影响模型对少数类的学习。
常用场景
经典使用场景
该数据集作为合成视觉数据的典范,在计算机视觉领域内被广泛用于目标检测与实例分割模型的预训练与性能评估。其独特之处在于,所有标注均源自Unreal Engine的实例ID缓冲,确保了标签的绝对精确性,消除了人工标注的主观误差。研究者常利用其300帧的高质量图像,针对小目标检测、类别不平衡等挑战进行算法验证,同时借助其提供的YOLO与COCO格式标签,无缝集成至主流检测框架中,作为sim2real迁移学习的关键基准。
解决学术问题
该数据集直面真实数据获取成本高昂与标注不精确等核心问题,通过合成渲染技术,为学术界提供了大规模、精确标注且可复现的实验环境。它解决了小样本场景下模型泛化能力不足的难题,尤其是在监控、安防等特定领域,其丰富的类别分布与尺度变化为研究长尾分布、细粒度识别提供了宝贵资源。此外,其确定性生成机制支持实验的可重复性,促进了目标检测、实例分割领域方法论的严谨比较与验证。
实际应用
在实际应用中,该数据集是训练智能监控系统、工业自动化检测及无人机巡检等场景中视觉模型的关键素材。其模拟的监狱环境虽具特定性,但其中的物体类别(如人、桶、托盘等)与布局具有普适性,能有效提升模型在复杂场景下的鲁棒性。尤其适用于增强现实、自动驾驶等需robust视觉感知的领域,通过合成数据预训练,再用少量真实数据微调,可在保障性能的同时大幅降低数据采集与标注成本。
数据集最近研究
最新研究方向
该合成数据集基于虚幻引擎5.8.1渲染,包含300帧监狱场景图像及11,428个标注实例,专为小目标检测与实例分割设计,聚焦于sim2real迁移学习。其标注完全由引擎实例ID缓冲器自动生成,杜绝了人工标注的主观偏差,并通过确定性种子保证可复现性,为领域前沿的‘合成数据即服务’模式提供了范式。研究热点在于利用此类高保真合成数据增强真实场景泛化能力,缓解小样本与类不平衡问题,同时推动基于物理引擎的自动化标注流程向标准化、规模化发展。该数据集亦可作为预训练素材,测试域适应算法在极端小目标(平均框占比0.15%)与狭窄视角下的鲁棒性,其质量验证报告(含零损坏帧、零泄漏)为合成数据的可信度评估设立了新基准,对自动驾驶、安防监控等对标注精度要求严苛的领域具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务