遇见数据集

SceneActBench

收藏
github2026-07-22 更新2026-07-28 收录
官方服务:

资源简介:

一个用于评估视觉条件代理在完整多对象3D场景中行动能力的基准数据集,包含五个任务,覆盖空间定位、自我中心空间推理、运动学推理、形状想象和动态推理能力,数据集包含210个源实例和520个任务案例。

A benchmark dataset for evaluating the action capabilities of vision-conditioned agents in complete multi-object 3D scenes. It includes five tasks covering spatial localization, egocentric spatial reasoning, kinematic reasoning, shape imagination, and dynamic reasoning capabilities. The dataset contains 210 source instances and 520 task cases.

创建时间:
2026-07-22
原始信息汇总

SceneActBench 数据集概述

基本信息

  • 数据集名称: SceneActBench
  • 发布年份: 2026年
  • 许可证: 数据集资产遵循原始来源许可证(3D-FRONT、S2O ACD、Kenney CC0);评估工具代码采用 MIT 许可证
  • 下载地址: Hugging Face

数据集来源

SceneActBench 从三个公开来源组装数据,并将所有资产标准化为统一格式(居中、重新定向、匿名化):

  • 3D-FRONT / M3DLayout: 100 个带家具的房间(每房间 3-7 个物体,27 个类别),每个房间包含 11 个渲染视图
  • S2O ACD: 100 个铰接物体,每个物体包含 32 帧开合视频及逐帧地面真值网格
  • Kenney (CC0): 10 个动态场景,每个场景包含 144 帧参考视频及动画地面真值场景

总计构成 210 个源实例,生成 520 个任务实例

任务设计

数据集包含 5 个任务,每个任务测试不同的视觉条件化 3D 行动能力:

任务 能力目标 评估指标
T1 · Layout(布局) 空间定位 ADD-S(表面距离,米)↓
T2 · Camera(相机) 自我中心空间推理 位置误差/角度误差 ↓
T3 · Articulated(铰接) 运动学推理 平均部件误差 ↓
T4 · Reconstruction(重建) 形状想象 F@5%(5%容差内表面比例)↑
T5 · Dynamic(动态) 动态推理 运动匹配误差/布局误差 ↓

评估框架

  • 评估方式: 智能体通过共享 MCP 工具接口控制 Blender(无头模式),生成 JSON 或 GLB 输出
  • 评分机制: 每个最终输出与隐藏的 3D 地面真值进行对比,使用任务特定的几何度量进行评分
  • 排行榜配置: 已评估 11 种专有 VLM 配置,总体得分范围 38.6–50.2

数据组织格式

下载后数据目录结构为:

data/ benchmark_final/ # 室内场景(Layout / Camera / Reconstruction) benchmark_s2o_final/ # 铰接物体(Articulated) benchmark_t6_final/ # 动态场景(Dynamic)

每个任务实例为一个 JSON 文件,包含字段:id(唯一标识)、task_type(任务类型)、scene_id(源场景标识)、scene_dir(资产路径)、system_prompt(系统提示)、prompt(任务指令)、setup_code(Blender 初始化代码)、references(参考图像/视频帧)。地面真值数据与任务文件分离,不暴露给智能体。

排行榜要点

  • 最高总体得分: Doubao Seed 2.0 Pro High(50.2 分)
  • 任务层面: 没有模型在所有任务上表现一致;GPT 5.4 High 在 Layout(84.1)、Articulated(73.8)、Reconstruction(12.3)三项领先,但在 Dynamic 上表现不佳
  • 关键发现: 重建任务(Reconstruction)对所有模型最具挑战性(最高分 12.3);强调推理的配置并未带来统一的优势

引用信息

bibtex @misc{zhao2026sceneactbench, title = {SceneActBench: Can Agents Act on the 3D Scenes They See?}, author = {Zhao, Yifei and Zhou, Xiangxin and Yang, Wenhao and Tang, Jiaqi and Jian, Pu and Yao, Huanjin and Yao, Jiarui and Lin, Haowei and Chen, Zhuo and Lyu, Wenkai and Ma, Jianzhu and Wang, Xueqian and Zhu, Wenxi and Pang, Tianyu}, year = {2026}, note = {Tencent Hunyuan}, url = {https://github.com/Feinaldo2/SceneActBench} }

搜集汇总
数据集介绍
SceneActBench 数据集图片
构建方式
SceneActBench数据集的构建基于三个公开数据源,包括3D-FRONT与M3DLayout提供的100个室内场景、S2O ACD贡献的100个铰接物体,以及Kenney平台的10个动态场景。所有源数据经过标准化处理,包括中心化、方位重定向与匿名化,以避免坐标或命名泄露答案。数据集共产生210个源实例,进一步衍生出520个任务案例,每个任务案例以JSON格式存储,包含任务标识、场景路径、系统提示、指令文本、Blender初始化代码以及参考图像或视频帧,而真实标注数据则与任务文件分离保存。这种设计确保了评估的公正性与任务的可复现性。
使用方法
使用SceneActBench首先需要通过Hugging Face下载数据集至本地,并设置环境变量文件配置API密钥与数据根目录。运行评估时,通过调用harness模块的run.py脚本,可指定模型配置文件和单个任务或整个任务目录,并启用Blender无头模式自动分配端口。执行过程中,智能体通过MCP工具接口与Blender通信,生成JSON或GLB格式的输出结果,最终存储于runs目录下,包含完整智能体轨迹、最终分数以及导出的场景文件。该框架支持断点续跑功能,每完成十个案例自动保存检查点,便于大规模评测的稳健执行。
背景与挑战
背景概述
在视觉语言模型(VLM)与三维场景交互的研究浪潮中,现有基准测试多聚焦于文本描述评分或单物体操作评估,难以衡量模型在完整多物体三维场景中的可执行动作能力。为填补这一空白,腾讯混元联合清华大学、南京大学等机构的研究者于2026年发布了SceneActBench基准测试集。该数据集基于3D-FRONT、S2O ACD及Kenney等公开来源构建,经标准化处理形成520个任务实例,涵盖空间布局、相机位姿恢复、关节物体动画、三维重建与动态场景生成五项核心能力。其核心研究问题在于检验智能体能否将视觉感官证据转化为精确、可执行的三维输出,而非仅仅停留在语言层面的描述。该基准通过统一的智能体-环境闭环架构,开创性地将三维动作执行形式化为可量化评估问题,确立了视觉驱动三维动作研究的新范式,对推动具身智能与空间理解领域的发展具有里程碑意义。
当前挑战
SceneActBench所应对的领域挑战在于,现有视觉语言模型普遍具备静态场景描述能力,却难以完成从视觉输入到三维结构化输出的认知跃迁——这要求模型同时具备空间定位、几何推理、动态时序建模等多维度能力,而11种主流模型配置整体得分仅38.6至50.2的区间充分揭示了该任务的潜在难度。在基准构建过程中,研究团队面临三重挑战:首先,需将来自不同来源的三维资产统一标准化,消除坐标偏移与名称泄漏等潜在干扰因素;其次,五项任务各自依赖差异化的几何度量指标(如ADD-S表面距离、F@5%重建精度等),设计统一的评分框架需兼顾任务特异性与可比性;最后,构建隐藏三维真值评估机制,确保智能体在无法直接访问标准答案的前提下完成动作输出,这要求测试框架具备高度密封性。重建任务在所有模型中最高得分仅12.3,成为最具挑战性的子任务,凸显了从多视角二维图像恢复完整三维场景这一长期未解难题。
常用场景
经典使用场景
SceneActBench被设计用于评估视觉语言模型在完整多对象三维场景中执行可执行动作的能力,其经典使用场景涵盖五种不同维度的三维推理任务。具体而言,研究者可借助该基准测试模型在空间布局规划(根据参考图像精确摆放和定向标准化家具)、自我中心空间推理(从参考视角恢复相机位姿)、运动学推理(对铰接部件如门或抽屉进行动画化)、形状想象(基于多视角图像重建室内场景)以及动态推理(生成场景随时间变化的动画)等方面的综合表现。所有任务均在同一固定的智能体-环境循环框架下运行,智能体通过共享的MCP工具接口控制Blender引擎,输出可被几何度量直接评分的JSON或GLB格式结果。
解决学术问题
SceneActBench系统性地填补了现有三维基准测试在评估智能体动作能力方面的空白。以往的研究大多侧重于文本描述或单对象操作,缺乏对完整多对象场景下可执行动作的评估框架。该数据集通过将视觉条件化三维动作定义为一个可执行的评估问题,引入了隐藏的三维真实标签与任务特定的几何度量,从而从根本上超越了传统的文本评分方式。它帮助学术界深入理解并诊断当前顶尖模型在空间理解与执行能力上的结构性缺陷——例如在11种模型配置中,重建任务的最高得分仅为12.3分,揭示了模型在形状想象与复杂场景建模方面存在的显著瓶颈,为后续研究指明了亟待突破的方向。
实际应用
SceneActBench的实际应用场景广泛分布于需要视觉理解与空间操作结合的前沿领域。在自主机器人领域,该基准测试的核心能力可迁移至室内导航、物体抓取与家具摆放等具体操作任务,使机器人能基于视觉输入自主规划动作序列。在虚拟现实与游戏开发中,SceneActBench评估的能力可用于自动场景布置、摄像机轨迹规划以及动态场景生成,极大提升内容创作效率。此外,其在建筑可视化与数字孪生领域也展现出潜力,通过智能体自动从设计图像生成三维室内布局或动画演示,为设计师提供快速的方案迭代工具。该基准测试为连接视觉感知与物理执行架起了一座关键桥梁,推动了从“看见”到“做到”的技术跃迁。
数据集最近研究
最新研究方向
SceneActBench聚焦于多模态大模型在三维场景中的可执行动作能力评估,揭示了当前视觉-语言模型在空间定位、运动学推理、动态场景理解等前沿方向上的显著短板。与以往仅评测文本描述或单物体操作的基准不同,该工作构建了涵盖布局、相机姿态、关节物体、三维重建与动态动画五大任务的统一智能体闭环评测框架。研究显示,即使是GPT-5.4、Doubao Seed 2.0等顶尖闭源模型,在三维重建任务上的最优得分也仅达12.3分,整体能力跨度在38.6至50.2分之间,无一模型能全面胜任所有任务。这一发现为具身智能与空间智能领域指明了关键瓶颈,推动了从视觉理解到三维交互执行的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务