遇见数据集

filter-inspection-data

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集为IR-CUT滤光片裁片的暗场成像图,用于光学滤光片外观质检。数据来自11个采集包,包含3728张PNG图像和1977个labelme JSON格式的多边形标注(label字段恒为defect,缺陷类型由文件夹名决定)。图像涵盖良品(1746张)和多种缺陷:划痕(1170张)、崩边(565张)、麻点(164张)、碎(64张)、不可擦脏(19张)。数据集提供两种切分方案:splitA为全混合8:1:1随机切分(训练2768张、验证434张、测试409张),splitB为跨批次留包切分(测试集为样本_38016_P08262014整包)。分组单位以(包,session)为准,确保同一次拍摄不跨split。此外,数据集包含inventory.csv全量清点文件和metrics_fixed.csv几何指标文件。已知数据质量问题包括:约3.3%良品标签存疑(漏标缺陷)、34张缺陷图无监督标注、崩/侧面崩/碎缺陷标注多边形几乎全在片体外、麻点标注口径不统一、标注精细度分两档、采集配置色调漂移、判定规格缺失等。该数据集适用于图像分类、图像分割、工业缺陷检测等任务。

This dataset consists of dark-field imaging images of IR-CUT filter slices, used for optical filter appearance quality inspection. The data comes from 11 acquisition packages, containing 3728 PNG images and 1977 polygon annotations in labelme JSON format (the label field is always defect, and the defect type is determined by the folder name). The images cover good products (1746 images) and various defects: scratches (1170), chipped edges (565), pitting (164), broken (64), and non-erasable dirt (19). The dataset provides two splitting schemes: splitA is a fully mixed 8:1:1 random split (2768 training, 434 validation, 409 test), and splitB is a cross-batch leave-package split (test set is the entire package of sample_38016_P08262014). Grouping is based on (package, session) to ensure that the same shoot is not split across splits. Additionally, the dataset includes an inventory.csv full inventory file and a metrics_fixed.csv geometric metrics file. Known data quality issues include: about 3.3% of good product labels are questionable (missing defect labels), 34 defect images have no supervised annotations, the annotation polygons for chipped/side chipped/broken defects are almost entirely outside the slice body, inconsistent annotation standards for pitting, two levels of annotation granularity, color shift in acquisition configuration, and missing judgment specifications. The dataset is suitable for tasks such as image classification, image segmentation, and industrial defect detection.

创建时间:
2026-07-31
原始信息汇总

滤光片外观质检数据集

该数据集为IR-CUT 滤光片裁片的暗场成像图,来源于 11 个采集包(样本7_27.zip),并附带配套模型与开箱即用推理包。

数据规模

类别 张数
良品 1746
划痕(划) 1170
崩边(崩 + 侧面崩) 565
麻点(麻) 164
64
不可擦脏 19
合计 3728

标注文件为 1977 个 labelme JSON(多边形),其中 label 字段恒为 defect,缺陷类型由文件夹名决定。

文件结构

  • images/:3728 张 PNG + 1977 个 labelme JSON,保持原始 11 包目录结构
  • splits/splitA/meta.csv:全混合 8:1:1 切分(train 2768 / val 434 / test 409)
  • splits/splitB/meta.csv:跨批次留包切分(test = 样本_38016_P08262014 整包)
  • splits/*/dropped.csv:被剔除的图与原因
  • inventory.csv:3728 张全量清点(批次/机器/工单/标注粒度/顶点数等)
  • metrics_fixed.csv:1948 张已标注图的几何指标(顶点密度、片体内比例等)

切分协议

  • 分组单位为 (包, session),同一次拍摄的图绝不跨 split
  • 两套切分均实测 0 组跨 split(共 288 组)
  • test 为锁箱,训练与选型全程不加载

命名规律

样本_38016_P08262014 → 批次 38016 / 机器 P08 / 工单 262014。路径中缺失的信息一律留空,未做任何推断——5 个包无机器号,2 个连批次号也没有。

已知数据质量问题

  • 良品标签约 3.3% 存疑(漏标的真缺陷),已用客观门槛核查
  • 34 张缺陷图零监督(6 张缺 json + 28 张 shapes 为空),已在 dropped.csv 标出
  • 崩/侧面崩/碎 的标注多边形几乎整个画在片体外(片体内比例仅 1–3%),语义上成立但直接栅格化做分割 GT 会有问题
  • 麻点标注口径不统一:多数包逐颗描(面积中位 0.15–0.64% 图幅),但 样本_38030_P15261973_2 是画大圈圈住密集区(中位 9.42%),差 20–60 倍
  • 标注精细度分两档:labelme 3.3.10 的包顶点中位 80(精描),5.11.4 的包顶点中位 12(粗框),样本_38031 两版本混装
  • 采集配置色调漂移:B 通道逐日 15→8→5,冷/暖两种配置
  • 判定规格缺失:多亮×多大的圆点算麻点、多长的划痕算不良,至今无书面判据

相关文档

  • docs/INDEX.md:项目总索引(四个仓库怎么选、三个核心结论、数据一览)
  • docs/REPRODUCE.md:完整复现指南(环境、数据准备、逐个实验的命令与预期数字)
  • docs/FILES.md:逐文件使用说明(41 个脚本、结果表字段、51 个训练产物目录)
  • docs/RESULTS.md:全部实验结果(42 个模型完整榜单、分割 vs 分类同口径对决)
  • docs/AUDIT.md:诚实性审计(四道审计的原理与结果)
  • docs/CAVEATS.md:已知问题与边界(含评估口径错误)
  • docs/REPOS.md:四个仓库逐一说明与下载方式

配套模型与推理包:https://huggingface.co/daipath/filter-inspection

搜集汇总
数据集介绍
filter-inspection-data 数据集图片
构建方式
该数据集源自11个采集包的IR-CUT滤光片裁片暗场成像图,共计3728张PNG图像,其中包含1977个labelme JSON标注文件。标注以多边形形式勾勒缺陷,统一以'defect'标记,缺陷类别由所在文件夹名确定。数据集提供两套切分方案:splitA为全混合8:1:1随机划分,splitB为跨批次留包划分,均以(包, session)为最小分组单位,确保同一次拍摄的图像不跨切分。此外,数据集详尽记录了每张图像的批次、机器、工单等元信息,以及标注几何指标,并剔除了存在质量问题的图像与标注。
特点
数据集覆盖六类缺陷(良品、划痕、崩边、麻点、碎、不可擦脏),类别分布不均,反映了工业场景中的真实长尾分布。其特点在于详尽的元数据与标注质量审计,如实标注了良品标签约3.3%存疑、34张缺陷图零监督等问题,以及标注多边形常覆盖片体外区域、麻点标注口径不一、标注精细度分两档、采集色调漂移等真实挑战,为鲁棒性研究提供了极佳素材。
使用方法
使用时,可直接依据splits目录下的meta.csv加载训练、验证与测试集,测试集作为锁箱不应参与训练或模型选择。数据集支持图像分类与图像分割两类任务,缺陷类型由文件夹名决定,适合训练基于深度学习的缺陷检测模型。配套的推理包(daipath/filter-inspection)提供开箱即用的模型,且提供了上传工具用于扩充数据,并自动去除labelme内嵌图片副本以节省流量。文档体系完整,涵盖复现指南、实验结果与诚实性审计,便于科研验证与工业部署。
背景与挑战
背景概述
滤光片外观质检数据集(filter-inspection-data)由工业视觉领域的研究团队于近期构建,旨在应对IR-CUT滤光片生产过程中人工质检效率低、一致性差的痛点。该数据集基于暗场成像技术,采集自11个不同批次的样本包,涵盖良品及划痕、崩边、麻点、碎、不可擦脏等五类典型缺陷,共计3728张图像,并配有1977个labelme多边形标注。数据集的核心研究问题是探索基于深度学习的缺陷检测与分割模型在复杂工业场景下的泛化能力,其配套的模型与推理包已在HuggingFace平台发布,为同类光学元件的自动化质检提供了基准资源,对推动工业视觉检测技术的落地具有重要参考价值。
当前挑战
该数据集面临的挑战兼具领域共性与构建特殊性。首先,缺陷检测的本质难题在于良品与缺陷样本的类别不均衡(良品占比近47%),且某些缺陷(如不可擦脏)样本极少,易导致模型过拟合;同时,缺陷形态多样(如崩边多边形多位于片体外)使得分割标注难以直接用于训练。其次,数据构建过程中面临多重困难:良品标签存在约3.3%的漏标真缺陷,34张缺陷图缺乏有效监督;标注口径不统一(麻点逐颗描或画大圈,顶点密度差异达20-60倍);采集配置存在色调漂移(B通道逐年变化)及标注精细度分档差异;而缺陷判定规格的缺失(如麻点大小、划痕长度的量化标准)进一步增加了标注一致性与模型评估的难度。这些挑战要求后续工作需精细化标注协议与鲁棒性验证。
常用场景
经典使用场景
滤光片外观质检数据集聚焦于工业视觉中的缺陷检测任务,涵盖良品与划痕、崩边、麻点、碎裂、不可擦脏等五类典型缺陷的暗场成像图。其经典使用场景为图像分类与图像分割模型的基准评测,研究者可基于其提供的3728张标注图像及两套严格划分的数据切分(全混合与跨批次留包),开展缺陷识别与定位的算法设计与性能比较。该数据集以多边形标注和缺陷类型由文件夹名决定的独特设计,为弱监督或无监督缺陷检测研究提供了天然实验场,尤其适合探索标注效率与模型鲁棒性之间的权衡。
衍生相关工作
围绕该数据集衍生的相关工作涵盖多个方向:基于其提供的51个训练产物与42个模型完整榜单,研究者可开展分类与分割方法的系统对比,探索不同架构在细粒度缺陷识别上的优劣;其严谨的审计流程(四道审计原理)催生了关于模型评估可信度的讨论,催生了对评估口径标准化的工作;标注质量问题的深入分析激发了关于鲁棒学习与噪声标签处理的研究;而两套切分协议成为领域适应与泛化性能验证的标尺。这些衍生研究共同推动了工业缺陷检测领域的理论深化与实践进步。
数据集最近研究
最新研究方向
在工业视觉质检领域,滤光片外观缺陷检测正朝着高精度、细粒度与跨批次泛化方向演进。本数据集聚焦IR-CUT滤光片裁片的暗场成像,涵盖划痕、崩边、麻点等典型缺陷,并首创跨批次留包切分协议以严格评估模型泛化能力。前沿研究围绕分割与分类任务的对决展开,辅以诚实性审计机制确保评测可信度,同时探索针对标注口径不一、缺陷区域语义偏移等真实工业噪声的鲁棒建模策略。该数据集为光学元件自动化质检提供了标准化的评测基准,对推动智能制造的品质管控精细化具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务