遇见数据集

conamodal

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

ConAmodal是一个专为建筑工地场景设计的非模态实例分割(amodal instance segmentation)基准数据集。其目标是在建筑施工环境中,恢复被其他物体部分遮挡的结构元素(如梁、柱、钢筋、管道)的完整轮廓。与现有的非模态分割数据集(如COCOA、KINS、D2SA)主要覆盖日常场景(人物、车辆、家居物品)不同,ConAmodal聚焦于建筑元素的独特属性——它们通常呈长条状、直线形、重复性强且具有强烈的形状先验。该数据集包含1643个实例,共4925个样本,涵盖三个主要类别:structural_member(结构构件)、piping(管道)和rebar(钢筋),并进一步细分为12个子类别。数据集由三个子集构成:conamodal_generation2(用于训练和模型选择,包含合成遮挡和AI生成图像)、conamodal_field(作为测试基准,包含合成遮挡和来自5个真实建筑工地的照片)、以及conamodal_field_realocc(包含真实遮挡,但仅用于稳定性检查,不作为基准的一部分)。每个样本提供遮挡后的图像、真实非模态掩码(完整形状)、真实模态掩码(可见部分),以及遮挡前的图像(如果存在)作为生成方法的RGB目标。设计上,ConAmodal通过仅接受自然遮挡程度≤5%的对象来保证非模态真值的准确性,然后以可控速率和深度感知方式添加合成遮挡,从而使得遮挡率、遮挡物数量和碎片数量可作为难度评估指标。由于数据规模相对较小,子类别级别的统计结果仅供参考;合成遮挡与真实遮挡存在差异;真实遮挡的真值基于重建而非直接观测;训练图像为AI生成,与真实照片存在领域差距。数据集采用CC-BY-NC-4.0非商业许可证。

ConAmodal is an amodal instance segmentation benchmark dataset specifically designed for construction site scenarios. Its goal is to recover the complete contours of structural elements (e.g., beams, columns, rebar, pipes) that are partially occluded by other objects in building construction environments. Unlike existing amodal segmentation datasets (such as COCOA, KINS, D2SA) which mainly cover everyday scenes (people, vehicles, household items), ConAmodal focuses on the unique attributes of building elements—they are typically long, linear, repetitive, and have strong shape priors. The dataset contains 1,643 instances and 4,925 samples, covering three main categories: structural_member, piping, and rebar, further subdivided into 12 subcategories. The dataset consists of three subsets: conamodal_generation2 (for training and model selection, containing synthetic occlusions and AI-generated images), conamodal_field (as a test benchmark, containing synthetic occlusions and photos from 5 real construction sites), and conamodal_field_realocc (containing real occlusions, but only for stability checks, not part of the benchmark). Each sample provides an occluded image, a ground-truth amodal mask (full shape), a ground-truth modal mask (visible part), and an image before occlusion (if available) as the RGB target for generation methods. By design, ConAmodal ensures the accuracy of amodal ground truth by only accepting objects with natural occlusion ≤5%, then adding synthetic occlusions at controlled rates and depth-aware manners, so that occlusion rate, number of occluders, and fragment count can serve as difficulty evaluation metrics. Due to the relatively small data scale, subcategory-level statistical results are for reference only; synthetic occlusions differ from real occlusions; ground truth for real occlusions is based on reconstruction rather than direct observation; training images are AI-generated and have a domain gap with real photos. The dataset is licensed under CC-BY-NC-4.0 (non-commercial).

创建时间:
2026-08-23
原始信息汇总

ConAmodal 数据集

概述

ConAmodal 是一个用于建筑施工场地模态实例分割的基准数据集,目标是恢复被其他物体部分遮挡的结构元素(如梁、柱、钢筋、管道)的完整轮廓。与现有的日常场景模态基准(COCOA、KINS、D2SA)不同,本数据集专注于建筑元素——这些元素具有长、直、重复且遵循强形状先验的特点。

数据集规模与构成

  • 规模:约 1K-10K 样本,包含 4,925 个样本、1,643 个实例
  • 主要基准:包含 conamodal_generation2(合成图像,用于训练和模型选择)和 conamodal_field(真实图像,5 个施工现场,作为主测试集)
  • 附加集conamodal_field_realocc 为真实遮挡数据,不属于 ConAmodal 基准,用于野外一致性检查

类别

  • 3 个主要类别:structural_member(结构构件)、piping(管道)、rebar(钢筋)
  • 包含 12 个子类别

数据特点

  • 每个样本提供:遮挡图像、真值模态掩码(完整形状)、真值可见掩码(可见部分)、以及遮挡前图像(作为生成方法的 RGB 目标)
  • 真值获取策略:标注者仅接受自然遮挡 ≤5% 的几乎完全可见对象,避免猜测性标注;遮挡以受控速率合成添加,遮挡物按类别自然尺寸先验缩放并深度感知放置
  • 难度轴:遮挡率、遮挡物数量、碎片数量可作为难度评估维度

使用注意事项

  • Windows 文件系统无法直接下载(文件名含 ::
  • 合成集中的每个实例在轻/中/重遮挡下出现三次,共享同一 ann_id,划分数据时必须使用提供的 splits/generation2/split_manifest.json,避免样本级划分导致同一物理对象泄漏到两侧
  • conamodal_fieldconamodal_field_realocc 是留出评估集,应整体使用,不可用于调参

已知局限

  • 规模较小,子类别结果的统计功效较低
  • 主要集采用合成遮挡,与真实遮挡存在差异
  • 真实遮挡真值为重建结果而非观测结果,仅适用于排名稳定性检查
  • 每个施工场地仅在一天拍摄,存在场地和进度偏差,一个场地无管道图像
  • 生成的训练图像与真实照片存在域差距

文档

  • SCHEMA.md:布局、元数据字段、划分规则
  • DATASHEET.md:动机、收集、标注、用途、局限性
  • LICENSE:组件级许可
  • LICENSES-THIRD-PARTY.md:第三方材料和归属要求
  • croissant.json:机器可读元数据(ML Commons Croissant 1.0)
  • SHA256SUMS:完整性校验和

许可

组件特定许可,组合数据集为非商业用途(CC-BY-NC-4.0)。

搜集汇总
数据集介绍
conamodal 数据集图片
构建方式
在建筑工地的视觉感知中,结构构件常因遮挡而无法完整呈现,现有非模态分割基准多聚焦于日常场景,缺乏对建筑元素的系统性覆盖。ConAmodal的构建策略从源头保障标注可靠性:标注者仅选取遮挡程度不超过5%且接近完整可见的目标,以此将非模态掩膜由推测转化为近乎观测的事实;随后以合成方式施加遮挡,遮罩物依据类别特有的自然尺寸先验进行尺度缩放并遵循深度感知放置,从而生成遮挡率、遮罩物数量与碎片数量均可控的困难样本。整体形成两个子集:生成式训练集与基于五处真实工地影像的场地测试集,另有真实遮挡目录专供稳健性核验,但不计入基准本体。
特点
ConAmodal是首个面向建筑工地的非模态实例分割基准,涵盖结构构件、管道与钢筋三大类共十二个子类,包含1,643个实例与4,925个样本。其突出之处在于以受控合成遮挡取代主观猜测标注,每例同时提供遮挡图像、非模态真值掩膜、模态真值掩膜以及遮挡前图像,使生成式方法获得明确的RGB重建目标。由于同一实例在轻、中、重三档遮挡下共享标注标识,数据集天然支持以遮挡率、遮罩物数目和碎片数作为难度维度开展分层评估。其规模虽小于通用非模态数据集,却以真值完整性作为核心取舍,且配套提供冻结划分清单与机器可读元数据。
使用方法
使用ConAmodal时,应先在Linux、macOS或WSL环境中完成下载,避免因合成子集文件名含双冒号而在原生Windows文件系统上解压失败。载入时通过元数据文件读取样本清单,按路径访问合成图像与对应掩膜,并依据类别字段而非标识前缀解析十二个子类。划分数据须采用官方提供的划分清单,不可按样本编号简单切分,否则同一物理对象将因三档遮挡而泄漏至训练与验证两侧。场地子集与真实遮挡子集应作为整体保留用于评估,不宜在其上调参,其中真实遮挡部分宜仅用于检验模型排名的稳定性。
背景与挑战
背景概述
在计算机视觉领域,非模态实例分割旨在恢复被遮挡物体的完整范围,然而现有基准如COCOA、KINS、D2SA均聚焦于日常场景,对建筑工地中具有长直重复、强形状先验的结构元素缺乏覆盖。ConAmodal作为首个面向建筑工地的非模态实例分割基准,由匿名研究团队于双盲评审阶段发布,包含4,925个样本中的1,643个实例,涵盖结构构件、管道和钢筋三大类。该数据集通过控制合成遮挡与真实场地采集相结合的方式,为建筑场景下的遮挡推理提供了严谨的评测平台,推动了非模态分割在专业领域的应用。
当前挑战
该数据集所解决的领域问题——建筑工地非模态实例分割——面临多重挑战:结构元素的长直重复形态与强形状先验导致传统非模态方法难以泛化,且真实遮挡模式与日常场景差异显著。在构建过程中,为规避标注者主观猜测非模态掩码的固有偏差,数据集仅接受自然遮挡率不超过5%的近乎完整可见对象,再通过合成方式控制遮挡率、遮挡物数量与碎片数量,但这也引入了合成遮挡与真实遮挡之间的域差距。此外,各场地仅单日拍摄导致类别覆盖受施工阶段制约,个别场地甚至缺失管道影像,而真实遮挡子集的标注由摄影师重构而非直接观测,规模有限,仅适用于模型排序稳定性检验而非直接报告性能分数。
常用场景
经典使用场景
在计算机视觉领域,非模态实例分割旨在推断被遮挡物体的完整几何形态,而施工场景中梁柱、管道与钢筋等结构元素因长直、重复且遵循强形状先验,与日常物体存在本质差异。ConAmodal作为首个面向施工场景的非模态实例分割基准,其经典使用场景便是训练与评估模型在此类场景下恢复结构元素被遮挡部分的能力,具体通过合成遮挡的受控生成子集进行模型训练与选择,并以真实施工现场采集的实地子集作为主基准进行测试,同时提供遮挡前图像作为生成式方法的RGB监督目标。
实际应用
在建筑信息模型构建、施工进度监测与自动化巡检等实际场景中,工人、材料与设备对结构元素的频繁遮挡严重制约了视觉系统的感知能力。ConAmodal所支撑的非模态分割模型能够穿透遮挡物推断梁柱与管道的完整轮廓,从而辅助现场机器人进行精准抓取与装配,或支持无人机巡检系统对隐蔽结构进行完整建模。此外,该数据集提供的遮挡前图像可用于训练生成式方法复原被遮挡区域,为数字孪生与竣工模型比对等工程任务提供视觉基础。
衍生相关工作
自发布以来,ConAmodal作为施工场景非模态分割的基准推动了若干相关研究。围绕其合成遮挡与真实遮挡对比设计,后续工作探索了域适应方法以弥合生成训练图像与实地照片之间的域间隙;其类别特定的遮挡物尺寸先验亦被借鉴用于其他长直结构元素的遮挡建模。数据集附带的拆分清单与元数据规范促进了可复现评估流程的建立,而真值完整性优先的策略则启发了后续基准在标注协议上的改进,尽管目前尚待正式发表以形成完整的引用生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务