遇见数据集

AffordAny

收藏
github2026-08-18 更新2026-08-25 收录
数据链接:
官方服务:

资源简介:

该基准数据集包含5,334个对象、10,633个经过验证的部分样本以及31,899个生成的指令对,覆盖473个LVIS类别。

This benchmark dataset contains 5,334 objects, 10,633 validated part samples, and 31,899 generated instruction pairs, covering 473 LVIS categories.

创建时间:
2026-08-18
原始信息汇总

AffordAny 数据集概述

AffordAny 是一个用于开放世界 3D 物体可供性(Affordance)定位的数据集。该数据集的核心任务是将单目 RGB 图像与自由形式的交互指令转化为重建 3D 物体上的可供性热力图。

数据集规模

  • 物体总数:5,334 个物体
  • 有效部件样本:10,633 个经过验证的部件样本
  • 指令对:31,899 个生成的指令对
  • 类别覆盖:涵盖 473 个 LVIS 类别

技术框架

该数据集关联的模型包括两个主要阶段:

  1. 监督学习阶段:使用预计算的几何与视觉语言模型(VLM)缓存进行训练
  2. 伪标签自训练阶段:支持置信度加权伪标签、不确定性掩蔽、EMA、课程调度及伪标签刷新等策略

数据构建流程

数据集通过两阶段流水线构建(M0-M11):

  • 阶段1:基于 LVIS 标注和图像运行基础流程
  • 阶段2:利用语言或视觉语言 API 生成指令与伪标签

使用要求

环境依赖

  • 需安装 CUDA 版 PyTorch
  • 重建与分割阶段依赖 SAM 3 和 SAM 3D Objects
  • 语言 API 调用需配置 GEMINI_API_KEYGOOGLE_API_KEY 环境变量

资源分发

  • 生成的数据集、特征缓存、检查点及日志等不包含在仓库中,将通过数据集和模型托管页面单独分发
  • 模型检查点不在初始发布中包含,仅提供实现用于复现

许可与发布

  • 源代码采用 Apache License 2.0 许可
  • 数据集资产按数据集发布文档中的条款单独分发
  • arXiv 标识符和引用元数据将在公开 v1.0.0 发布前补充
搜集汇总
数据集介绍
AffordAny 数据集图片
构建方式
AffordAny数据集的构建依托于LVIS类别体系,从5,334个真实物体中系统性地采集与筛选,最终形成10,633个经过验证的部件样本和31,899条交互指令对。构建流程采用两阶段管线(M0-M11),首先基于LVIS标注与图像数据,通过SAM 3和SAM 3D Objects进行物体重建与部件分割;随后利用视觉-语言模型(VLM)对每个部件生成自由形式的交互指令,并通过API调用(如Gemini)进行语义标注,同时结合人工质量控制确保指令与部件语义的精准对齐。整个流程高度自动化,且保证了数据生成的规模与多样性。
使用方法
使用AffordAny时,用户需先依据README配置环境并安装依赖,包括SAM 3和SAM 3D Objects。数据集通过分布的资源获取,包括预计算的几何特征和VLM缓存。模型训练需运行训练脚本,指定缓存与输出路径;评估则通过evaluate.py加载检查点与测试清单,输出量化指标。对于自训练扩展,提供了专门的脚本以利用伪标签迭代优化。仓库还内含项目页面,可作为交互式展示与探索工具,便于研究者直观分析结果。
背景与挑战
背景概述
AffordAny数据集诞生于开放世界三维可供性理解(3D affordance grounding)领域,由研究团队于2023-2025年间构建,旨在解决如何从单目RGB图像中,依据自由形式的交互指令,定位并重建三维物体的可供性区域这一核心问题。该数据集包含5,334个物体、10,633个验证过的部件样本和31,899个跨473个LVIS类别的指令对,规模与多样性在同类基准中居前。其发布填补了从二维视觉信息到三维可供性映射的空白,推动了具身智能、机器人操作等下游任务的发展,为多模态大模型与三维场景理解提供了新的评测基准,影响力日益彰显。
当前挑战
AffordAny所应对的挑战涵盖领域与构建两大维度。领域上,可供性理解需克服传统二维分割无法传递物体三维可供性结构的局限,同时处理开放世界类别与指令多样性的组合爆炸,以及跨视角、遮挡和光照变化下的鲁棒性难题。构建过程中,从LVIS标注中筛选有效物体并生成高质量指令依赖繁琐的人工与自动校验,确保10,633个部件样本的准确性;此外,三维重建需依赖SAM 3和SAM 3D Objects等第三方工具,而特征缓存、伪标签自训练迭代又引入了计算资源消耗与噪声累积问题,如何平衡数据质量与扩展覆盖面成为持续挑战。
常用场景
经典使用场景
AffordAny数据集在三维物体可供性理解领域树立了新的基准,其经典应用场景聚焦于从单目RGB图像出发,结合自由形式的交互指令,在重建的三维物体表面生成可供性热力图。该数据集涵盖473个LVIS类别,包含5,334个物体和10,633个验证过的部件样本,以及31,899条指令-物体配对,为训练和评估视觉-语言模型引导的三维可供性推理模型提供了大规模、多样化的数据基础。其构建流程整合了物体重建、部件分割和指令生成等多个模块,为三维场景理解任务提供了标准化的研究范式。
解决学术问题
此数据集针对开放世界中三维可供性标注稀缺和跨类别泛化能力不足等核心学术难题,提供了全面的解决方案。通过引入视觉-语言模型(VLMs)自动生成指令与伪标签,AffordAny有效缓解了人工标注成本高昂的问题,并为模型学习语义丰富的可供性表示创造了条件。该数据集支持模型在未见物体上推断用户指定的交互方式,推动了可供性理解从封闭集走向开放式的范式转变,为具身智能、人机交互和三维场景理解等领域的学术研究提供了关键资源。
实际应用
在实际应用层面,AffordAny展现出了广泛的应用潜能,尤其在机器人操作和增强现实(AR)领域。家用机器人可藉此理解用户对日常物体的操作意图,如“抓住壶柄”或“按下按钮”,从而在非结构化环境中自主规划动作。AR系统则能利用该数据集生成的可靠可供性热力图,在用户视野中叠加精确的交互提示,提升辅助操作和远程指导的智能性。其基于伪标签自训练的技术路径,也为持续适应新场景和新兴物体类别,构建数据高效的部署方案提供了可扩展的实践范式。
数据集最近研究
最新研究方向
AffordAny数据集的问世,为开放世界3D物体可供性 grounding 领域注入了新的活力,其研究前沿聚焦于如何从单目RGB图像中精准推断可交互的3D热区。该数据集以其宏大的规模——涵盖5,334个物体、10,633个有效部件样本及31,899对指令数据,横跨473个LVIS类别——为视觉-语言模型(VLM)驱动的3D理解提供了前所未有的训练与评估基石。当前研究热点集中在该数据集所引领的两个维度:一是利用VLM的自由文本交互指令,实现从二维视觉信息到三维空间语义的可供性跨模态映射,这极大拓展了模型对开放词汇的泛化能力;二是通过自训练伪标签学习机制,引入置信度加权、不确定性掩蔽和EMA更新策略,持续强化模型在未见过物体上的零样本迁移表现。其方法学上的革新,使得机器人操作、增强现实交互等下游应用得以从被动感知转向主动理解,为构建具备环境交互智能的具身代理铺设了关键路径,影响着未来视觉理解系统对物理世界可操作性的前瞻性建模。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务