SceneActBench
收藏资源简介:
一个用于评估视觉条件代理在完整多对象3D场景中行动能力的基准数据集,包含五个任务,覆盖空间定位、自我中心空间推理、运动学推理、形状想象和动态推理能力,数据集包含210个源实例和520个任务案例。
A benchmark dataset for evaluating the action capabilities of vision-conditioned agents in complete multi-object 3D scenes. It includes five tasks covering spatial localization, egocentric spatial reasoning, kinematic reasoning, shape imagination, and dynamic reasoning capabilities. The dataset contains 210 source instances and 520 task cases.
SceneActBench 数据集概述
基本信息
- 数据集名称: SceneActBench
- 发布年份: 2026年
- 许可证: 数据集资产遵循原始来源许可证(3D-FRONT、S2O ACD、Kenney CC0);评估工具代码采用 MIT 许可证
- 下载地址: Hugging Face
数据集来源
SceneActBench 从三个公开来源组装数据,并将所有资产标准化为统一格式(居中、重新定向、匿名化):
- 3D-FRONT / M3DLayout: 100 个带家具的房间(每房间 3-7 个物体,27 个类别),每个房间包含 11 个渲染视图
- S2O ACD: 100 个铰接物体,每个物体包含 32 帧开合视频及逐帧地面真值网格
- Kenney (CC0): 10 个动态场景,每个场景包含 144 帧参考视频及动画地面真值场景
总计构成 210 个源实例,生成 520 个任务实例。
任务设计
数据集包含 5 个任务,每个任务测试不同的视觉条件化 3D 行动能力:
| 任务 | 能力目标 | 评估指标 |
|---|---|---|
| T1 · Layout(布局) | 空间定位 | ADD-S(表面距离,米)↓ |
| T2 · Camera(相机) | 自我中心空间推理 | 位置误差/角度误差 ↓ |
| T3 · Articulated(铰接) | 运动学推理 | 平均部件误差 ↓ |
| T4 · Reconstruction(重建) | 形状想象 | F@5%(5%容差内表面比例)↑ |
| T5 · Dynamic(动态) | 动态推理 | 运动匹配误差/布局误差 ↓ |
评估框架
- 评估方式: 智能体通过共享 MCP 工具接口控制 Blender(无头模式),生成 JSON 或 GLB 输出
- 评分机制: 每个最终输出与隐藏的 3D 地面真值进行对比,使用任务特定的几何度量进行评分
- 排行榜配置: 已评估 11 种专有 VLM 配置,总体得分范围 38.6–50.2
数据组织格式
下载后数据目录结构为:
data/ benchmark_final/ # 室内场景(Layout / Camera / Reconstruction) benchmark_s2o_final/ # 铰接物体(Articulated) benchmark_t6_final/ # 动态场景(Dynamic)
每个任务实例为一个 JSON 文件,包含字段:id(唯一标识)、task_type(任务类型)、scene_id(源场景标识)、scene_dir(资产路径)、system_prompt(系统提示)、prompt(任务指令)、setup_code(Blender 初始化代码)、references(参考图像/视频帧)。地面真值数据与任务文件分离,不暴露给智能体。
排行榜要点
- 最高总体得分: Doubao Seed 2.0 Pro High(50.2 分)
- 任务层面: 没有模型在所有任务上表现一致;GPT 5.4 High 在 Layout(84.1)、Articulated(73.8)、Reconstruction(12.3)三项领先,但在 Dynamic 上表现不佳
- 关键发现: 重建任务(Reconstruction)对所有模型最具挑战性(最高分 12.3);强调推理的配置并未带来统一的优势
引用信息
bibtex @misc{zhao2026sceneactbench, title = {SceneActBench: Can Agents Act on the 3D Scenes They See?}, author = {Zhao, Yifei and Zhou, Xiangxin and Yang, Wenhao and Tang, Jiaqi and Jian, Pu and Yao, Huanjin and Yao, Jiarui and Lin, Haowei and Chen, Zhuo and Lyu, Wenkai and Ma, Jianzhu and Wang, Xueqian and Zhu, Wenxi and Pang, Tianyu}, year = {2026}, note = {Tencent Hunyuan}, url = {https://github.com/Feinaldo2/SceneActBench} }




