遇见数据集

beach-unreal-synthetic

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Beach: Unreal Engine synthetic capture 是一个由Unreal Engine 5.8.1渲染的合成目标检测与实例分割数据集。数据集包含300帧分辨率为1280×960的图像,共标注了22,040个实例,涵盖10个类别:人物(8,770)、球(1,116)、游泳圈(1,589)、毛巾(1,566)、躺椅(4,878)、遮阳伞(787)、冲浪板(1,085)、桶(1,079)、人字拖(780)和船(390)。根据COCO尺度阈值,其中16,915个为小目标,5,079个为中目标,46个为大目标,平均边界框覆盖图像面积的0.07%,属于小目标数据集。数据通过引擎的实例ID缓冲区在渲染时直接读取生成,无需人工标注。数据文件包括原始RGB图像(PNG格式)、逐实例ID缓冲区(用于分割掩码)、YOLO格式的边界框标签、COCO格式的注释、每帧的相机与演员元数据、验证报告以及捕获配置JSON。所有300帧均属于同一数据集,未划分训练/验证/测试集,用户可根据需要自行分割。数据集附带验证器输出,显示0张损坏图像、0张无标签帧、4张近重复图像、11张跨分割泄漏图像,平均亮度118.3,7帧欠曝光,0帧过曝光。已知限制包括:跨分割泄漏(dHash≤4)导致评分扣11.0分;类别不平衡(最稀有/最常用类别比0.044)扣7.64分;近重复图像(dHash≤4)扣0.67分;构建来源未验证;引擎可见但未标注的人物占0.07%;相机视角来源于3个预定义区域,视角和距离范围较窄;渲染图像存在合成到真实的域差距,适合作为预训练或增强材料,而非真实评估集。数据集由NameFrameCapture插件从Unreal Engine实例缓冲区生成,环境资产来自第三方许可,仅发布渲染图像和标签,不包含源资产,使用前请阅读LICENSE文件。

Beach: Unreal Engine synthetic capture is a synthetic object detection and instance segmentation dataset rendered by Unreal Engine 5.8.1. It contains 300 frames at 1280×960 resolution, with 22,040 annotated instances across 10 categories: person (8,770), ball (1,116), swim ring (1,589), towel (1,566), deck chair (4,878), umbrella (787), surfboard (1,085), bucket (1,079), flip flop (780), and boat (390). According to COCO scale thresholds, there are 16,915 small objects, 5,079 medium objects, and 46 large objects, with average bounding box covering 0.07% of image area, making it a small object dataset. Data is generated by reading the engines instance ID buffer during rendering, requiring no manual annotation. Data files include raw RGB images (PNG), per-instance ID buffers (for segmentation masks), YOLO format bounding box labels, COCO format annotations, per-frame camera and actor metadata, validation reports, and capture configuration JSON. All 300 frames belong to the same dataset without training/validation/test splits; users can split as needed. The dataset includes validator output showing 0 corrupted images, 0 unlabeled frames, 4 near-duplicate images, 11 cross-split leakage images, average brightness 118.3, 7 underexposed frames, 0 overexposed frames. Known limitations: cross-split leakage (dHash≤4) deducts 11.0 points; class imbalance (rarest/most frequent class ratio 0.044) deducts 7.64 points; near-duplicate images (dHash≤4) deducts 0.67 points; build provenance not verified; engine-visible but unlabeled persons account for 0.07%; camera viewpoints are from 3 predefined areas with narrow view and distance range; rendered images have synthetic-to-real domain gap, suitable as pre-training or augmentation material, not as a real evaluation set. The dataset is generated by the NameFrameCapture plugin from the Unreal Engine instance buffer, environment assets are from third-party licenses, only rendered images and labels are released, source assets are not included, please read the LICENSE file before use.

创建时间:
2026-08-20
原始信息汇总

数据集概述

Beach: Unreal Engine synthetic capture 是一个使用虚幻引擎(Unreal Engine)5.8.1 渲染合成的海滩场景目标检测与图像分割数据集,包含 300 帧渲染图像及 22,040 个标注实例。

基本信息

属性 内容
数据集名称 Beach: Unreal Engine synthetic capture
许可协议 other(sample-capture-terms,详见 LICENSE)
任务类型 目标检测、图像分割
数据规模 n < 1K(300 帧)
标注方式 机器生成(引擎实例 ID 缓冲区读取)
标签类型 实例分割、目标检测

采集规格

属性 内容
引擎版本 5.8.1-56057345+++UE5+Release-5.8
地图 BeachDemo
分辨率 1280 x 960
水平视场角 57.3 度
相机策略 camera_zones_look_at_target(3 个作者定义的区域)
镜头配置 realistic_drone at 0.6
时间范围 07:00 至 19:00
天气 场景(300 帧)
主种子 20260817
验证评分 等级 B,80.7/100

类别分布

id 类别 实例数
0 person 8,770
1 ball 1,116
2 swimmingring 1,589
3 towel 1,566
4 deckchair 4,878
5 umbrella 787
6 surfboard 1,085
7 bucket 1,079
8 flipflop 780
9 boat 390

按 COCO 尺度阈值划分:16,915 个小目标、5,079 个中目标、46 个大目标。平均框覆盖帧面积约 0.07%,属于小目标数据集。

文件结构

  • images/:渲染的 RGB 帧(PNG,未修改)
  • segmentation/:逐实例 ID 缓冲区(每实例一种颜色)
  • labels/:YOLO 格式框标注(每帧一个文本文件)
  • annotations/:COCO 格式标注
  • metadata/:每帧相机、角色和生成清单记录
  • reports/:采集报告和验证输出
  • capture.json:运行契约(类别、相机策略、种子)
  • data.yaml:类别名称,可直接用于 YOLO 训练

Nimages/segmentation/labels/metadata/ 中对应同一场景。未预设数据划分,300 帧全部置于单一池中,可按实验需求自行切分。

质量验证结果

  • 损坏图像:0 / 300
  • 无标签帧:0
  • 近似重复图像:4
  • 跨划分泄漏:11
  • 平均亮度 118.3;7 帧曝光不足,0 帧过曝
  • 逐帧核对:请求 300 帧、300 张图像、300 个标注文件、22,040 个标注

已知局限

  • 跨划分泄漏:验证器扣除 11.0 分,因精确或近似相同图像跨 train/val/test 出现(dHash ≤ 4)
  • 类别不平衡:扣除 7.64 分,最稀有/最常见类别比率为 0.044
  • 近似重复图像:扣除 0.67 分,单一划分内存在视觉近似图像(dHash ≤ 4)
  • 构建溯源未通过:BUILD_PROVENANCE_UNVERIFIED: UNVERIFIED_REPOSITORY_COMMIT
  • 漏标人员:引擎可见人员中 6/8,678 未标注(0.07%,覆盖 300/300 帧)
  • 视角范围有限:相机位置仅来自 3 个作者定义的区域,视角和距离覆盖较窄,仅代表单一环境而非基准
  • 合成到真实域差距:渲染图像存在 sim2real 域差距,适合作为预训练或增强材料,而非真实世界评估集

来源与条款

帧由 NameFrameCapture(虚幻引擎编辑器插件)渲染,标注直接读取引擎逐实例 ID 缓冲区生成。capture.json 包含完整构建记录,包括插件和任务哈希及未能验证的检查项。

场景中的环境和道具资产由第三方许可用于虚幻引擎项目。此处发布渲染图像及其标注,不包含源资产(无 .uasset 或地图文件)。重新分发图像前请阅读 LICENSE

采集流水线、系列中的其他环境及相关测量方法文档见 https://getnameframe.com。

搜集汇总
数据集介绍
beach-unreal-synthetic 数据集图片
构建方式
本数据集源自单一Unreal Engine环境下的300帧渲染图像,共计22,040个标注实例。所有标注信息均直接源于引擎渲染时生成的实例ID缓冲区,确保了标签的准确性与客观性,排除了人工标注或模型预测可能引入的偏差。数据生成遵循确定性采样策略,依据主种子(Master seed)20260817,对物体放置、姿态及相机视角进行精确控制,保证了实验的可重复性。数据集涵盖10个类别的物体,包括人物、球类、泳圈等,其中小型目标占比较高,平均边界框覆盖仅占画面0.07%,突出了小目标检测的挑战性。
使用方法
数据集未预设训练/验证/测试划分,所有300帧图像集中于同一池中,赋予使用者灵活的划分权限,可根据实验需求自定义分割方案。兼容YOLO与COCO两种主流标注格式,可直接用于目标检测与实例分割模型的训练与评估。分割掩码的读取需注意通道顺序,避免因通道交换导致的掩码解码错误。由于数据源自合成环境,建议将其作为预训练或数据增强材料,而非真实场景评估的替代品,尤其适用于Sim2Real迁移学习场景。
背景与挑战
背景概述
该数据集由NameFrameCapture插件生成,由Unreal Engine 5.8.1渲染,创建于2025年(基于主种子20260817)。数据集包含300帧海滩场景的合成图像,总计22,040个标注实例,涵盖10个类别,如人物、球、游泳圈等,所有标注均直接取自引擎的实例ID缓冲区,无需人工干预。该数据集旨在为计算机视觉领域提供高质量的合成数据,以解决真实数据获取成本高、标注困难等问题,尤其针对小目标检测任务,其中平均边界框仅覆盖帧的0.07%。其影响力在于推动sim2real迁移学习研究,为模型预训练提供丰富且精确标注的数据源,同时为合成数据生成和验证方法建立新标准。
当前挑战
该数据集面临的挑战主要来自三个方面:首先,在领域问题层面,由于目标尺寸极小(平均覆盖0.07%),对检测算法的敏感性要求极高,且类别不平衡显著(稀有/常见类比0.044),易导致模型偏向常见类;其次,构建过程中,虽然标注源自引擎ID缓冲区具有高精确性,但存在跨分割泄漏(11例)和近重复图像(4例)问题,影响了数据独立性和评估有效性;此外,渲染图像与真实世界存在领域差异,无法直接替代真实评估集,仅适用于预训练或增强;最后,相机视角受限于3个预设区域,导致视角多样性不足,且构建出处验证未通过(UNVERIFIED_REPOSITORY_COMMIT),存在可重复性风险。
常用场景
经典使用场景
该数据集由虚幻引擎渲染的300帧海滩场景图像构成,包含22,040个标注实例,涵盖人物、球、游泳圈、毛巾、躺椅等十类常见物体。其标注信息源自引擎自身的实例ID缓冲,无需人工标注,确保了标签的精确性和客观性。经典使用场景集中在合成数据驱动的计算机视觉研究,尤其是针对小目标检测与实例分割任务的模型训练与评估。由于图像中平均目标框仅占画面0.07%,该数据集特别适合验证算法在极小目标下的鲁棒性,同时丰富的场景变化(如时间、天气、视角)为研究光照和背景干扰对检测性能的影响提供了可控的实验平台。
解决学术问题
该数据集有效解决了真实数据获取成本高昂、标注困难以及数据多样性受限等学术瓶颈。通过引擎渲染精确控制场景要素,实现了大规模自动化标注,排除了人工标注的主观误差,为量化分析算法性能提供了无偏基准。其确定性采样机制(主种子可复现)保障了实验的可重复性,助力探究模型在合成到真实(sim2real)迁移中的泛化能力。此外,数据附带全面质量报告和限制说明(如类别不平衡、近重复图像),有助于学者辨识数据偏差,发展更鲁棒的训练策略和评估协议,促进合成数据在计算机视觉研究中的规范化使用。
实际应用
实际应用中,该数据集作为预训练或数据增强资源,可显著提升目标检测与分割模型在真实场景(如监控、无人机巡检、智慧城市)中的性能,尤其在数据稀疏或隐私敏感环境下补充训练样本。其合成性质允许自由扩展场景与物体组合,为构建面向特定业务(如海滩安全监控、水上运动分析)的定制化模型提供快速迭代的基础。同时,标注的精确性与多样性有利于精简模型调优流程,缩短从实验到部署的周期。在领域自适应研究中,该数据集可充当源域数据,用于测试域随机化、图像风格迁移等技术,推动视觉系统在复杂多变环境下的落地可靠性。
数据集最近研究
最新研究方向
该合成数据集聚焦于虚拟到现实的迁移(sim2real)前沿,通过Unreal Engine渲染生成高保真海滩场景,为小目标检测与实例分割提供大规模、精确标注的训练样本。其独特的引擎级实例ID缓冲标签生成机制,消除了人工标注误差,为跨域泛化研究提供了可靠基准。当前研究热点集中于利用此类合成数据增强真实场景下的模型鲁棒性,探索仿真环境中的领域自适应与零样本学习,推动自动驾驶、安防监控等复杂视觉任务的发展。该数据集以300帧图像承载超2万实例,虽存在类别不平衡与视角局限,但其高质量标注和可复现的确定性采样,为算法评估与多场景扩展奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务