amara-spatial-10k
收藏资源简介:
AmaraSpatial-10K 是一个专为空间计算和具身 AI 设计的语义锚定、度量尺度的 3D 数据集,包含 10,071 个 AI 生成的 3D 网格,涵盖 65 个类别。每个资产均经过度量缩放、语义锚定、PBR 准备,并附有丰富的多模态元数据。数据集旨在解决生成 3D 资产在游戏引擎、机器人模拟器和 AR/VR 管道中零样本部署时的空间对齐问题。数据集包含种子图像、主 GLB 网格、碰撞 GLB、五个相机渲染和丰富的元数据,适用于 LLM 驱动的场景组合、具身 AI 和机器人模拟器、文本到 3D 训练与评估、检索系统和游戏引擎原型设计。数据集采用 CC BY 4.0 许可发布。
AmaraSpatial-10K is a semantically anchored, metrically scaled 3D dataset designed for spatial computing and embodied AI, containing 10,071 AI-generated 3D meshes across 65 categories. Each asset is metrically scaled, semantically anchored, PBR-ready, and comes with rich multimodal metadata. The dataset aims to address the spatial alignment challenges of deploying generated 3D assets in game engines, robotics simulators, and AR/VR pipelines with zero-shot deployment. It includes seed images, primary GLB meshes, collision GLBs, five camera renders, and extensive metadata, making it suitable for LLM-driven scene composition, embodied AI and robotics simulators, text-to-3D training and evaluation, retrieval systems, and game engine prototyping. The dataset is released under the CC BY 4.0 license.
数据集概述:AmaraSpatial-10K
基本信息
| 项目 | 内容 |
|---|---|
| 数据集名称 | AmaraSpatial-10K |
| 提供方 | Zero One Creative |
| 许可证 | CC BY 4.0 |
| 任务类别 | 文本到3D、图像到3D |
| 数据规模 | 10,071 个3D网格,>130 GB |
| 类别数量 | 65 个顶级类别,476 个子类别 |
核心特色
该数据集同时具备以下四种属性,且据称在同等规模的公开3D数据集中尚无先例:
- 真实世界度量缩放:资产按米为单位的真实物理尺寸缩放,并通过独立的尺度合理性评分进行验证
- 语义原点锚定:原点根据功能上下文放置——地面物品置于底部中心,悬挂物体置于中心,天花板安装物品置于顶部中心
- 生产级PBR与物理:主网格约50K三角形,配有独立的法线/粗糙度贴图(无烘焙光照),并提供配套的凸碰撞外壳(<500三角形)
- 丰富的多模态元数据:每项资产包含多句描述、2D种子图像和五个相机渲染视图,概念密度约为Objaverse标签的18倍
性能对比
基于9个评估类别(5,247项AmaraSpatial资产 vs. 2,856项Objaverse匹配资产)的平均结果:
| 指标 | AmaraSpatial-10K | Objaverse |
|---|---|---|
| 9类平均边界框高度 | 3.89 m | 1,723 m |
| 同类尺度变异系数均值↓ | 3.40 | 9.92 |
| 座椅类合理高度范围[0.6,1.1]m占比↑ | 40.7% | 7.7% |
| 尺度合理性评分均值↑ | 0.68 | — |
| 锚点距语义目标1cm内占比↑ | 79.7% | 4.2% |
| 锚点落在边界框外占比↓ | 5.2% | 35.2% |
| CLIP文本-3D连贯性↑ | 0.238 | 0.203 |
| LLM概念密度(0-5)↑ | 2.62 | 0.14 |
| UV映射占比↑ | 100% | 94% |
数据内容
每项资产包含:
- 种子图像:用于生成网格的文本条件合成图像
- 主GLB网格:度量缩放、语义锚定、UV展开,约10 MB,2K PBR纹理
- 碰撞GLB:用于物理和光线投射的简化凸外壳
- 五个相机渲染:一个透视视图加四个正交视图(前、后、左、右)
- 丰富元数据:28项几何与质量指标、多句描述、结构化类别标签、空间方向数据
仓库结构
metadata/ train-00000-of-00006.parquet ~2.5 GB each, 6 shards train-00001-of-00006.parquet … meshes/ shard-00000.tar ~5 GB each, 21 shards shard-00001.tar each tar contains <asset_id>.glb + <asset_id>.collision.glb … manifest.parquet asset_id → mesh_shard + category labels top_categories.json 65 sorted ClassLabel names sub_categories.json 476 sorted ClassLabel names figures/ README figures
数据模式
元数据Parquet文件中每行包含:
- 身份信息:资产ID、顶级类别、子类别、资产基名
- 提示信息:简短描述、完整描述
- 视觉内容:种子图像、透视图渲染、前/后/左/右渲染
- 网格指针:网格分片、网格路径、碰撞路径
- 几何信息:顶点数、面数、纹理尺寸、边界框、锚点原点、前进轴
- 质量信息:水密百分比、流形边比率、退化三角形数、非流形顶点数、UV坐标、欧拉数
- 碰撞网格:碰撞体积比、碰撞顶点数、碰撞面数
- 衍生几何:表面积、网格体积、边界框体积、平均边长、长宽比
质量检测指标
| 检测项 | 指标 | 对应列名 |
|---|---|---|
| 封闭表面完整性 | 水密三角化百分比 | watertight_percent |
| 流形几何 | 恰好被两个面共享的边比例 | manifold_edge_ratio |
| 退化三角形 | 零面积/共线三角形数 | degenerate_triangle_count |
| 非流形顶点 | 表面自交顶点数 | non_manifold_vertices |
| 拓扑结构 | 欧拉示性数 | euler_number |
| 碰撞拟合 | 碰撞外壳体积/主网格体积比 | collision_volume_ratio |
| UV覆盖 | UV坐标是否存在 | has_uv_coordinates |
预期用途
- LLM驱动的场景合成:正确尺度和锚点可在无需算法调整的情况下减少漂浮物体和穿透
- 具身AI与机器人模拟器:度量尺度和PBR材料缩小仿真到现实的差距
- 文本到3D/图像到3D训练与评估:对齐的文本-图像-网格三元组支持跨模态目标
- 检索系统:多句描述在CLIP和LLM嵌入相似度下显著优于稀疏标签
- 游戏引擎原型开发:生产就绪的GLB文件含碰撞外壳,可在Unreal、Unity或Godot中开箱即用





