遇见数据集

ToyFerrariCarScratchDefectDataset

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Toy Ferrari Car 数据集是一个用于表面划痕检测的目标检测数据集,源自 ScratchSim 程序化合成数据管道。该数据集包含合成图像和真实图像两种模态,并针对两种主流检测器(LW-DETR 和 YOLO26)进行了划分。数据集根据训练方式组织为三类子集:纯合成数据(仅合成图像)、纯真实数据(稀缺或完整真实图像)以及混合数据(合成图像与少量真实图像以10%、25%、50%或100%比例混合)。背景方面,合成图像可选择随机背景或白色背景(模拟真实采集环境的静态白色背景)。所有评估均在独立预留的真实测试集上进行,确保泛化性。数据格式方面,LW-DETR 子集使用 COCO 格式的标注,YOLO26 子集使用 Ultralytics YOLO 格式(包含 images/、labels/ 和 data.yaml)。该数据集适用于研究从合成数据到真实数据的迁移学习、数据增强以及少样本目标检测等方法。

The Toy Ferrari Car dataset is an object detection dataset for surface scratch detection, derived from the ScratchSim procedural synthetic data pipeline. It contains two modalities: synthetic images and real images, and is partitioned for two mainstream detectors (LW-DETR and YOLO26). The dataset is organized into three subsets based on training methods: pure synthetic data (only synthetic images), pure real data (scarce or full real images), and mixed data (synthetic images mixed with a small amount of real images at ratios of 10%, 25%, 50%, or 100%). For backgrounds, synthetic images can have random backgrounds or white backgrounds (simulating a static white background in real acquisition environments). All evaluations are performed on a separate held-out real test set to ensure generalization. In terms of data format, the LW-DETR subset uses COCO format annotations, and the YOLO26 subset uses Ultralytics YOLO format (including images/, labels/, and data.yaml). This dataset is suitable for research on transfer learning from synthetic to real data, data augmentation, and few-shot object detection.

创建时间:
2026-08-09
原始信息汇总

Toy Ferrari Car 划痕缺陷数据集

数据集简介

该数据集围绕玩具法拉利汽车的表面划痕缺陷检测任务构建,包含多种训练策略与检测器组合的版本,并配套了对应的论文引用与许可协议。

数据集结构

数据集按检测器训练模式组织,涵盖三类训练模式:

训练模式 说明
合成数据(Synthetic only) 仅使用程序化生成的合成图像
真实数据(Real only) 使用真实拍摄的图像(含稀缺子集与全量)
融合数据(Infused) 合成图像与少量真实图像(10%、25%、50%、100%)混合

对应检测器包括 LW-DETR(使用 COCO 格式标注)和 YOLO26(使用 Ultralytics YOLO 格式,包含 images/labels/data.yaml)。

目录组织

LW-DETR 目录

  • lwdetr/infusion_rb:融合数据,随机背景
  • lwdetr/infusion_wb:融合数据,白色背景
  • lwdetr/synth/synth_lwdetr_random_background.zip:纯合成,随机背景
  • lwdetr/synth/synth_lwdetr_white_background.zip:纯合成,白色背景
  • lwdetr/real_scarce:真实数据稀缺子集(10%/25%/50%)
  • lwdetr/real_scarce/synth_mixed_scarce_lwdetr_real100:真实数据全量(100%)

YOLO26 目录

  • yolo26/synth_mixed_random_background.zip:融合数据,随机背景
  • yolo26/synth_mixed_white_background.zip:融合数据,白色背景
  • yolo26/synth_random_background.zip:纯合成,随机背景
  • yolo26/synth_white_background.zip:纯合成,白色背景
  • yolo26/real_data_scratches.zip:纯真实数据

关键说明

  • 背景模式随机背景 使用随机化背景渲染合成图像;白色背景 (WB) 模拟真实采集场景中的静态白色背景。
  • 评估方式:所有模型均在留出的真实图像测试集上评估,该测试集不参与任何训练。
  • 微调策略Synth → Real 微调使用纯合成数据集进行预训练,使用纯真实数据集进行第二阶段训练。
  • 数据路径:所有相对路径均位于数据集仓库根目录下,可通过 Hugging Face 数据集页面访问对应文件(如 https://huggingface.co/datasets/saptarshineilsinha/ToyFerrariCarScratchDefectDataset/tree/main)。

引用与许可

该数据集配套论文为《ScratchSim: A Procedural Synthetic Data Pipeline for Surface Scratch Detection》(arXiv 编号 2607.27065),许可协议为 CC BY 4.0

搜集汇总
数据集介绍
ToyFerrariCarScratchDefectDataset 数据集图片
构建方式
该数据集围绕玩具法拉利车模的表面划痕检测任务精心构建,其构建方式独具匠心。数据集依据检测器类型(LW-DETR与YOLO26)及训练范式(纯合成、纯真实、以及合成与稀缺真实数据混合的注入式)进行系统化组织。合成图像通过程序化流程生成,支持随机背景与模拟真实拍摄环境的白色背景两种模式;注入式数据集则按10%、25%、50%及100%的比例掺入真实图像,以增强模型的泛化能力。此外,数据集的划分严格遵循‘合成预训练-真实微调’的两阶段策略,并确保评估始终在独立的真实测试集上进行,从而客观衡量模型性能。
特点
该数据集最显著的特点在于其多维度、系统化的数据组织策略。通过检测器、训练模式与背景类型的交叉组合,形成了层次分明的数据矩阵,为研究数据合成策略对模型性能的影响提供了理想的实验平台。其‘随机背景’与‘白色背景’的对照设计,可有效探究背景复杂度对划痕检测的干扰效应。注入式数据集的梯度化真实数据比例(10%至100%),使得研究者能够精确量化真实数据量对模型性能的边际贡献。同时,数据集为不同检测器量身定制了标注格式(COCO与YOLO),极大降低了算法适配的工程门槛,促进了跨框架研究的便捷开展。
使用方法
该数据集的使用方法灵活多样,以适应不同的研究目标。对于域适应研究,可遵循‘Synth → Real’范式,利用纯合成数据集进行预训练,随后在纯真实数据集上微调,以评估合成数据对真实场景的适应能力。对于数据增强策略探索,研究者可选择不同比例的注入式数据集,比较模型性能随真实数据比例增加的变化趋势,从而确定最优的数据混合比例。此外,通过对比在随机背景与白色背景下训练的模型性能,可专门分析背景元素对检测任务的影响。数据集还支持跨检测器的基准测试,由于提供了LW-DETR和YOLO26所需的两种标注格式,研究者可便捷地在不同框架间迁移评估,全面验证算法的鲁棒性。
背景与挑战
背景概述
ToyFerrariCarScratchDefectDataset由Paul Julius Kühn、Saptarshi Neil Sinha等研究人员于2026年发布,旨在推动表面划痕检测领域的发展。该数据集围绕玩具法拉利汽车模型,提供了一套包含合成图像与稀缺真实图像的综合性资源,并针对LW-DETR和YOLO26等先进检测器进行了精心组织。其核心研究问题是验证程序化合成数据管线(ScratchSim)在工业质检场景中的有效性,通过混合训练策略弥合合成与真实数据间的领域鸿沟。该数据集及其配套论文为表面缺陷检测提供了新范式,对降低数据采集成本、提升模型泛化能力具有重要影响。
当前挑战
该数据集面临的挑战多维且显著。首先,领域内合成图像与真实图像间的分布差异构成核心难题,尽管采用随机背景与白色背景模拟,仍需解决域适应问题。其次,构建过程中需平衡稀缺真实样本与大量合成样本的比例(10%至100%),并确保不同检测器(LW-DETR、YOLO26)的标注格式兼容,增加了数据管线的复杂性。此外,评估需在从未参与训练的独立真实测试集上进行,以确保模型的真实性能,这要求严格的数据隔离策略。这些挑战共同推动了数据生成与评估方法的创新。
常用场景
经典使用场景
ToyFerrariCarScratchDefectDataset 作为面向表面划痕检测的专用视觉数据集,其核心应用场景聚焦于工业质检与精细缺陷识别领域。该数据集以玩具法拉利车模为载体,通过精心设计的合成图像与稀缺真实图像混合策略,为评估目标检测模型在复杂纹理、反射表面及微小划痕上的鲁棒性提供了标准化基准。研究者可依据 LW-DETR 与 YOLO26 两种主流检测框架,在随机背景与白色背景两种模式下开展对比实验,从而系统验证模型在不同视觉环境下的泛化能力与检测精度。
解决学术问题
该数据集精准回应了视觉检测领域中合成数据与真实数据分布差异这一长期棘手的学术难题。通过构建 Infused 训练机制,即合成图像与 10%、25%、50%、100% 不同比例的稀缺真实图像相融合,为域适应、少样本学习及迁移学习等前沿方向提供了可量化的实验平台。其明确的 Synth→Real 两阶段微调范式,有助于厘清预训练策略对真实场景检测性能的增益机制,进而推动对合成数据效用的理论化理解与实证验证。
衍生相关工作
围绕此数据集,研究社区已衍生出多个方向的探索性工作。其 ScratchSim 程序化合成流程启发了后续关于物理渲染引擎在缺陷仿真中应用的研究,推动了更真实光照与材质模型融入合成数据生成管线。此外,基于该数据集上 LW-DETR 与 YOLO26 性能对比的实证结论,促进了针对轻量级检测网络在边缘设备上部署的优化研究。同时,Infused 数据混合策略的提出,为域随机化与数据增强领域的交叉融合提供了新视角,催生了更多关于稀缺真实样本利用效率的深入探讨与算法改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务