遇见数据集

hssd-annotations

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

HSSD Annotations数据集是hssd-annotations API的大数据文件层,包含10,963个资产的完整功能标注数据。该数据集提供了大规模的功能掩码和记录文件,这些文件因体积过大而未包含在GitHub代码仓库中。数据集包含两个关键更新:2026年7月20日的物理/质量审计更新,修正了469个类别的碰撞检测和质量先验;以及自发光光度审计更新,为所有记录添加了自发光注释,识别了1,190个发光资产(包括998个灯具、63个发光显示器和129个火焰),并提供基于物理单位(瓦特、流明、坎德拉等)的渲染先验。数据内容主要包括功能掩码(NPZ格式)、功能记录(JSON格式)、合并记录文件、查找表、后替换清单等。数据集源自HSSD和PartNet-Mobility,遵守相应的上游许可证,不包含网格几何数据。该数据集需与GitHub代码库结合使用,以实现完整的API功能,包括搜索、获取、统计、间隙计算、关系分析、自由度处理、规范前向/方向确定和后替换等功能。适用任务包括场景生成、功能推理、间隙分析、物理模拟和自发光渲染等。

The HSSD Annotations dataset is a big data file layer for the hssd-annotations API, containing complete functional annotation data for 10,963 assets. It provides large-scale functional masks and record files that are too large to be included in the GitHub code repository. The dataset includes two key updates: a physical/quality audit update on July 20, 2026, which corrected collision detection and quality priors for 469 categories; and a self-luminous photometric audit update, which added self-luminous annotations to all records, identifying 1,190 luminous assets (including 998 lights, 63 luminous displays, and 129 flames), and providing rendering priors based on physical units (watts, lumens, candelas, etc.). The data mainly consists of functional masks (NPZ format), functional records (JSON format), merged record files, lookup tables, and post-replacement lists. The dataset originates from HSSD and PartNet-Mobility, adheres to the corresponding upstream licenses, and does not include mesh geometry data. It must be used in conjunction with the GitHub codebase to achieve full API functionality, including search, retrieval, statistics, gap calculation, relationship analysis, degree-of-freedom processing, canonical forward/direction determination, and post-replacement. Applicable tasks include scene generation, functional reasoning, gap analysis, physical simulation, and self-luminous rendering.

创建时间:
2026-07-07
原始信息汇总

数据集概述:HSSD Annotations (full data layer)

  • 数据集名称:HSSD Annotations (full data layer)
  • 数据集地址:https://huggingface.co/datasets/P-Kevin/hssd-annotations
  • 许可协议:other(需遵守上游 HSSD 和 PartNet-Mobility 的许可)
  • 任务类型:other
  • 标签:hssd, partnet-mobility, affordance, clearance, scene-generation, articulation

数据集描述

该数据集是 HSSD 注释的全量数据层,与 K-Chronofox/hssd-annotations GitHub 仓库配套使用。GitHub 仓库包含代码(hssd_asset_library:存储 + CLI + REST)、核心查找表以及 12 个资产的样本;本数据集提供完整的 10,963 个资产的功能性注释层,不包含网格几何体。

主要内容与文件

文件 大小 说明
affordance_masks.tar.gz ~477 MB 10,963 个 NPZ 格式功能掩码(masks/hssd_<id>.npz
affordance_records.tar.gz ~4 MB 10,963 个 JSON 格式功能记录(records/HSSD_<id>.json)——标签、部件功能、访问方向、功能依赖
records.jsonl ~81 MB 全部 10,963 条合并后的资产记录(未压缩)
hssd_annotation_lookup.json.gz ~5.8 MB 完整合并的查找表(与 GitHub 仓库相同)
post_replacement_manifest.json ~0.9 MB 静态 ID 到铰接实现(T1 官方 / T2-PM)的映射
index.jsonl ~1.5 MB 功能 asset_id 到记录路径的索引
functional_dependency_priors.jsonlfunctional_descriptions.jsonl 类别级先验
LAYER_SUMMARY.json 极小 功能层摘要
SELF_EMISSION_SUMMARY.json 极小 全覆蓋自发光计数与概况
SELF_EMISSION_AUDIT.json 极小 全面审计:字段、公式、来源、GLB 材质
SELF_EMISSION_PROFILE_AUDIT.csv 极小 每个光度剖面一行
self_emission_profiles.json 极小 版本化、有来源支持的工程先验
HSSD_SELF_EMISSION_AUDIT_AND_API.md 极小 独立的自发光实现与审计响应文档
HSSD_ASSET_NORMALIZATION_ANNOTATION_RESPONSE.md 极小 对材质/质量/摩擦/质量要求的响应
ANNOTATION_RETRIEVAL_GUIDE.zh.md 极小 中文 ID 优先的 Python/CLI/REST 及全层检索指南

数据来源与审计

  • 物理/质量审计(2026-07-20):基于 category-dimension-render-v2-20260720,对所有 469 个类别的原始子串类别冲突和长尾质量先验进行了修正。审计文件包括 ASSET_PHYSICS_QUALITY_AUDIT.json(详尽 ID/公式/渲染筛查)和 ASSET_PHYSICS_CATEGORY_AUDIT.csv(类别级质量分布)。这些是仿真先验,带有明确置信度,非直接测量。
  • 自发光光度审计(2026-07-20):所有 10,963 个记录均包含 self_emission 注释。识别出 1,190 个发光资产(998 个灯具、63 个发光显示器和 129 个火焰),提供以物理单位(瓦特、流明、坎德拉、坎德拉/平方米)表示的渲染器就绪先验。审计文件包括 SELF_EMISSION_AUDIT.jsonSELF_EMISSION_PROFILE_AUDIT.csvHSSD_SELF_EMISSION_AUDIT_AND_API.md,审计报告无缺失记录、无剖面不匹配、无光度计算不匹配、无效数值或未解决的发光体类别候选者。

注释家族

  • 功能相关:功能标签、功能掩码、部件级功能、访问方向、间隙、关系、放置自由度、白名单/合作伙伴、操作空间(参考)、规范正面、替换后实现。
  • 物理相关:材质、质量、摩擦、质量、自发光光度。

使用方式

需要与 GitHub 仓库结合使用:

bash

1) 获取代码和核心查找表

git clone https://github.com/K-Chronofox/hssd-annotations.git cd hssd-annotations

2) 下载本数据集的全量数据层

hf download P-Kevin/hssd-annotations --repo-type dataset --local-dir /tmp/hssd-full

3) 解压功能层到仓库数据目录

tar -xzf /tmp/hssd-full/affordance_masks.tar.gz -C data/affordance tar -xzf /tmp/hssd-full/affordance_records.tar.gz -C data/affordance cp /tmp/hssd-full/records.jsonl data/

4) 可对全部 10,963 个资产使用 get_affordance()/expand=True

python -c "from hssd_asset_library import AssetLibrary; print(AssetLibrary().get(<hssd_id>, expand=True)[affordance_full][parts][0])"

核心 API(搜索、获取、统计、间隙、关系、自由度、规范正面/朝向、替换后)直接从 GitHub 仓库即可使用,本数据集仅用于全量资产级功能记录和 NPZ 掩码。

搜集汇总
数据集介绍
hssd-annotations 数据集图片
构建方式
该数据集为HSSD注释的完整数据层,包含10,963个资产的丰富注释信息。数据集的构建基于HSSD与PartNet-Mobility两大上游资源,通过扩展的注释管道生成。物理与质量审计基于category-dimension-render-v2-20260720版本,修正了469个类别的子字符串碰撞与长尾质量先验。自发射光度审计为全部资产提供了以瓦特、流明、坎德拉等物理单位表述的渲染级先验,并辅以来源URL与推导元数据。注释结果以NPZ掩码、JSON记录、JSONL合并文件等多种格式存储,形成完整的资产功能标注层。
特点
数据集最显著的特点在于其全面的功能注释覆盖。每项资产均包含功能标签、部件级功能、访问方向、间隙、关系、放置自由度、白名单/合作伙伴、操作空间、规范正面及替换后实现等多元注释。2026年7月完成的物理审计与自发射光度审计确保了注释的高质量与一致性,后者覆盖了1190个发射体资产(含998个灯具、63个发光显示屏与129个火焰对象),并以工程先验而非直接测量的方式提供物理值。数据集不包含网格几何信息,严格合规于上游开源许可。
使用方法
数据集的典型使用需与GitHub仓库协同。用户首先克隆K-Chronofox/hssd-annotations仓库以获取代码与核心查找表,随后通过Hugging Face下载完整数据层并解压至仓库的数据目录。核心API(搜索、获取、统计、间隙、关系、自由度、规范正面等)可独立于本数据集运行,而完整资产级功能记录与NPZ掩码的获取则需加载本数据层。Python接口中,通过AssetLibrary的get_affordance方法并设置expand=True即可解析全部10,963个资产的功能详情,同时可参考随附的中文检索指南实现ID优先的完整数据提取。
背景与挑战
背景概述
在三维场景理解与具身智能研究中,物体功能属性(affordance)标注是连接几何模型与物理交互的关键桥梁。HSSD Annotations数据集由K-Chronofox团队于2026年创建,基于HSSD和PartNet-Mobility两大公开资产库,构建了包含10,963个三维物体的全量功能属性标注层。该数据集聚焦于物体部件的功能语义(如抓取方向、操作空间、自发光特性等),旨在为场景生成、物体关节运动分析及机器人操作规划提供标准化训练与评估基准。其核心研究问题是如何在无直接测量的前提下,通过工程先验与类别审计,为大规模三维资产赋予可靠且可复现的功能属性注释。该数据集通过提供细致的物理参数(质量、摩擦、自发光功率)与几何方向标注,显著提升了仿真环境的物理真实性与语义丰富度,对推动具身智能、虚拟现实及自动化场景理解领域的研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战包括:1)三维物体功能属性的语义标注长期依赖人工或昂贵传感器,难以覆盖大规模资产库,HSSD Annotations通过类别级先验与自动化审计流程,实现了万级物体的高效标注;2)自发光物体的光度量(如流明、坎德拉)在仿真中常被忽略或简化为经验值,该数据集以物理工程先验结合源URL推导,提供了统一的可复用标准。在构建过程中,面临的挑战包括:1)子字符串类别冲突与长尾质量先验的校正,需对469个类别进行系统性的物理审计与公式筛查;2)自发光属性审计需确保998个灯具、63个屏幕和129个火焰光源的零遗漏检测与材质一致性检查,同时避免引入虚假正向标注。这些挑战通过双重审计(JSON与CSV)及详细的元数据溯源得以克服,确保了标注的科学性与可重复性。
常用场景
经典使用场景
HSSD-annotations数据集为三维场景理解与生成领域提供了全面而精细的注释层,其核心使用场景在于为大规模室内场景中的物体赋予功能语义信息。研究者可借助该数据集对物体进行部件级功能标注(affordance labels)与访问方向(access directions)的提取,并获取物体间的空间关系(relations)与放置自由度(placement DOF)等重要属性。通过与HSSD和PartNet-Mobility的深度融合,该数据集的11,000余件资产覆盖了从日常家具到电子设备的广泛类别,为场景生成、机器人交互与自主导航等任务提供了坚实的数据基石。
衍生相关工作
基于HSSD-annotations衍生的工作主要集中在场景理解与生成的两大前沿方向。功能导向的场景生成(affordance-driven scene generation)利用其部件级功能标注与关系图谱,实现了从抽象功能需求到具体三维布局的端到端生成。可动部件与机构理解(articulated object understanding)则依托数据集提供的后替换实现(post-replacement realization)与PartNet-Mobility的融合信息,推动了可动关节物体的识别与操作研究。此外,物理属性审计与自发光光度审计的引入催生了一批聚焦于仿真真实性的工作,包括基于数据驱动的材质估计与光照预测方法,这些成果共同拓展了三维场景数据的理论深度与应用边界。
数据集最近研究
最新研究方向
HSSD-Annotations数据集近期在场景生成与交互推理领域的前沿研究聚焦于细粒度功能属性标注的完善与物理仿真质量的提升。最新版本(2026年7月)引入了涵盖10,963个资产的全覆盖自发光光度审计,以物理单位(瓦特、流明、坎德拉)提供可渲染的先验参数,并修正了469个类别的质量分布与碰撞检测偏差,显著增强了数据集在真实感仿真与具身智能任务中的可用性。此外,丰富的功能依赖、操作空间与关节运动注释正推动面向复杂人-物交互的零样本决策推理研究,成为连接大规模3D资产库与下游机器人操作、场景理解应用的关键桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务