遇见数据集

3DHarnessBench

收藏
github2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

3DHarnessBench是一个基准测试,用于评估前沿视觉语言模型(VLM)从多种输入(如单视角图像、多视角图像、主动视觉探索和完整3D交互)中恢复3D几何结构并生成Blender Python代码的代理能力。该基准测试包含100个实例,并提供了四种逐步增强的代理设置,以测试模型的视觉感知、主动推理、工具调用和自我纠正能力。

3DHarnessBench is a benchmark designed to evaluate the agentic capabilities of state-of-the-art vision-language models (VLMs) in recovering 3D geometric structures and generating Blender Python code from diverse inputs, including single-view images, multi-view images, active visual exploration, and full 3D interactions. This benchmark comprises 100 instances and provides four stepwise enhanced agentic setups to test the models' abilities in visual perception, active reasoning, tool invocation, and self-correction.

创建时间:
2026-09-03
原始信息汇总

3DHarnessBench 数据集概述

基本信息

  • 数据集名称:3DHarnessBench
  • 数据集地址:https://github.com/llada60/3DHarnessBench
  • 项目主页:https://llada60.github.io/3DHarnessBench/
  • 论文地址:https://arxiv.org/abs/2609.06535
  • Benchmark 下载地址:https://huggingface.co/datasets/lingada/3DHarnessBench

数据集简介

3DHarnessBench 是一个用于评估前沿视觉语言模型(VLM)智能体能力的基准,任务是将多种输入恢复为 Blender Python 代码形式的 3D 几何。与以往使用固定输入(如单张渲染图或文本描述)的框架不同,3DHarnessBench 评估四种独立的 harness 设置,逐步启用主动式智能体探索,由 Blender MCP 功能支持。

四级递进设置包括:

  1. Single-view(单视图)
  2. Multi-view(多视图)
  3. Active Visual(主动视觉,任意视点访问)
  4. Full 3D Interaction(完整 3D 交互,通过 Blender 函数调用完整访问目标对象)

该层级体系考察模型在视觉感知、主动推理、工具调用和自我纠正方面的能力。观察结果表明,随着函数调用访问权限的丰富,所有前沿模型恢复 3D 几何的能力显著提升,但提升幅度高度依赖模型,揭示出智能体 3D-to-Code 能力分布极不均衡。

数据集规模与内容

  • 完整基准包含 100 个实例
  • 每个实例包含带纹理/灰色的 GLB 文件及参考渲染图。

项目结构

text . ├── scripts/ # 四个基准入口点 │ ├── Single-view/run.py │ ├── Multi-view/run.py │ ├── ActiveVisual/run.py │ └── Full3DInteraction/run.py ├── evaluation/ │ ├── evaluate.py # 统一评估入口 │ ├── core/ # 渲染与 GLB 导出 │ └── metrics/ # Usage、Chamfer、图像与 Uni3D 指标 ├── raw_agents/ # 共享 runner 与图像智能体适配器 ├── cli_agents/ # MCP 智能体适配器与检查点 ├── BlenderMCP/ # Blender MCP 服务 ├── prompting/ # 图像重建提示词 ├── skills/ # MCP 重建指令 ├── packages/ # 本地 VirtualGL Pixi 包配方 ├── tests/ # 轻量级离线单元测试 ├── data/benchmark/ # 下载的基准实例 ├── outputs/ # 生成结果与指标 ├── teaser.png # 论文总览图 ├── .env.example # Blender 路径与 API-key 模板 ├── pyproject.toml # Pixi 依赖与命令 ├── pixi.lock # 锁定的依赖版本 ├── INSTALL.md # Linux 安装说明 ├── CONTRIBUTING.md # 贡献与本地检查工作流 └── LICENSING.md # GPL、CC BY 与捆绑 MIT 边界

环境与安装

  • 目标平台:Linux x86-64 + NVIDIA GPU
  • 需要安装 Pixi、Blender 5.1.2 及智能体 CLI,配置 .env,并准备评估权重。
  • ActiveVisual 与 Full3DInteraction 使用 Xvfb。
  • 命令需在仓库根目录(3DHarnessBench/)运行,所有入口点自动加载 .env,导出的 shell 变量优先。
  • 安装需参考 INSTALL.md。

数据集下载

从 Hugging Face 下载 3DHarnessBench,将实例目录放置在 data/benchmark/ 下,遵循 data layout(参见 data/benchmark/README.md)。

支持的模型(Agent)

gpt-6-astragpt-5-6-solkimi-k3opus-5fable-5qwen3-8-max-previewgemini3-1-prominimax-m3

运行方式

Single-view 与 Multi-view

  • Single-view 默认使用一张参考图像(Image_005.png);Multi-view 使用四张基准参考图像。
  • 两者生成 Python 代码并渲染,随后进行指定轮数的编辑。

关键参数:

  • --agent:运行的智能体。
  • --data-path:基准目录,默认 data/benchmark
  • --output-dir:输出基目录,默认 outputs
  • --texture-renders:使用彩色参考(True,默认)或灰色参考(False)。
  • --iterations:初始生成之后的编辑轮数,默认 3;设为 0 则仅生成。
  • --num-parallel:并发实例数,默认 8
  • 可添加 --tasks VaseFactory 选择实例,--limit 5 选择前五个,--dry-run 检查输入而不调用模型。
  • 完整数据集应显示 Tasks: 100

ActiveVisual 与 Full3DInteraction

  • ActiveVisual:智能体检查受限的参考 Blender,并在单独的可编辑 Blender 中构建。
  • Full3DInteraction:提供对包含参考对象的一个 Blender 的完整 MCP 访问。

关键参数:

  • --texture-renders:加载带纹理参考 GLB(True,默认)或其灰色版本(False)。
  • --num-parallel:并发实例数,默认 4
  • --timeout:每次 CLI 尝试的秒数,默认 9600,非总运行限制。
  • --max-retries:超时后同会话重连次数,默认 5;Qwen/MiniMax 也使用该预算进行会话续接。
  • 这些模式为交互式,没有 --iterations 参数。

评估

评估需使用与生成相同的设置、智能体、输出目录和纹理选择。

关键参数:

  • --setting必填Single-viewMulti-viewActiveVisualFull3DInteraction
  • --agent必填
  • --device:模型推理设备,默认 cuda
  • --batch-size:图像编码器批大小,默认 16
  • --num-parallel:并发 Blender 准备任务数;默认 1 个渲染 worker 和 4 个 GLB worker。
  • --tasks VaseFactory:评估子集。
  • --overwrite-metrics--overwrite-artifacts:覆盖已有指标/产物。
  • 无 DINOv3 访问时可使用 --image-encoders siglip2 dinov2 运行部分编码器评估;Uni3D 仍会运行。

评估计算的指标包括:Usage、Chamfer、图像相似度(SigLIP2、DINOv2、DINOv3)以及 Uni3D

结果输出

生成的脚本与渲染保存在:

text outputs/<setting>/<w_texture|wo_texture>/<agent>/<instance>/

评估写入智能体的 _metrics/ 目录:

  • evaluation_run.json:阶段状态与已评估实例名称/数量。
  • final_metrics.json:聚合分数。
  • 逐指标 JSON 文件:详细分数与覆盖率。

需检查 statusn_instances;评估会跳过未完成的图像迭代,成功不代表所有 100 个实例均被评估。

许可证

  • 项目软件:GPL-3.0-only
  • 原始文档、独立提示词模板、skills、项目图像及 3DHarnessBench 内容:CC BY 4.0,署名 llada60
  • 捆绑的 BlenderMCP 衍生代码:MIT
  • 第三方模型、权重和下载依赖保留其自身条款;基准资产、输出、模型缓存和本地 .env 不纳入 Git。
搜集汇总
数据集介绍
3DHarnessBench 数据集图片
构建方式
在三维视觉与语言模型交叉研究不断深入的背景下,3DHarnessBench的构建围绕递进式代理探索能力评估展开。该基准从单一视角、多视角、主动视觉到完整三维交互四个层级设置测试环境,依托Blender MCP功能,使视觉语言模型能够通过函数调用主动获取目标物体的几何信息。每个实例均配备带纹理与灰度两种GLB模型及参考渲染图,模型需据此生成Blender Python代码,并经过多轮编辑与渲染迭代,最终形成可复现的完整评估链路。
特点
该数据集的核心特征在于其分层递进的评估架构,能够系统区分模型在被动感知与主动推理、工具调用及自我修正等方面的能力差异。基准包含100个实例,覆盖多样化的三维物体,并提供统一的运行框架与多维度评价指标,包括Chamfer距离、图像相似度以及Uni3D等。四类测试设置使模型能力的比较不再局限于单一输入形式,从而揭示不同前沿模型在三维到代码任务中的表现差异与不均衡性。
使用方法
使用者需在Linux x86-64与NVIDIA GPU环境下,依照安装说明配置Pixi、Blender 5.1.2及代理命令行工具,并从Hugging Face下载基准数据置于指定目录。随后可根据评估层级选择single-view、multi-view、active-visual或full-3d-interaction命令,指定代理名称、数据路径、输出目录及纹理渲染选项。生成结果统一保存于输出目录,评估阶段调用evaluate.py脚本,按相同设置计算各项指标,并可通过任务筛选、断点续跑与覆盖选项灵活控制流程。
背景与挑战
背景概述
三维几何重建长期依赖专用传感器或人工建模流程,而视觉语言模型在二维感知任务中的成功自然引发了将其能力延伸至三维空间的探索。3DHarnessBench由llada60研究团队构建,旨在系统评测前沿视觉语言模型以Blender Python代码形式恢复三维几何的智能体能力。该基准的核心研究问题在于:当模型仅能获取单视角、多视角、主动视觉或完整三维交互等不同层次的信息时,其三维到代码的生成能力如何变化。通过将信息访问权限从被动的固定输入逐步扩展至主动探索与工具调用,该基准为理解视觉语言模型的具身化三维推理提供了可复现的评测框架,对三维内容生成、机器人感知与程序化建模等领域具有基础性影响。
当前挑战
该基准所面对的领域挑战在于三维几何的代码化重建本质上是一个高维、非唯一的逆问题,模型需从稀疏视觉线索中推断出完整拓扑与几何细节。构建过程中的主要困难包括:设计四种递进式信息获取范式以隔离感知、主动探索与工具使用等能力的贡献;在Blender环境中搭建稳定可扩展的智能体交互接口,并处理渲染、导出与并发执行中的工程复杂性;建立涵盖使用有效性、倒角距离、图像相似度与三维语义一致性的多维度评价体系;以及确保模型在有限交互预算下的自我纠错行为能够被公平、可复现地测量。
常用场景
经典使用场景
在三维视觉与多模态学习交汇的前沿领域,3DHarnessBench构筑了一套层次分明的评测体系,其经典使用场景在于系统性地检验前沿视觉语言模型将三维几何信息转化为可执行Blender Python代码的能力。区别于传统固定输入范式,该基准通过单视图、多视图、主动视觉与全三维交互四种递进式程序框架,从被动感知逐步过渡到主动探索,使模型在函数调用、工具使用与自我纠错等维度接受全方位考验,从而揭示智能体在三维到代码任务中的真实水平。
解决学术问题
该数据集直面三维重建与程序化生成研究中长期存在的关键难题,即如何客观衡量模型从视觉输入中主动推断几何结构并生成精确代码的能力。过往评测多局限于单次渲染或文本描述,难以捕捉智能体在多轮交互与工具调用中的自适应表现。3DHarnessBench通过分层探针设计,有效分离了视觉感知、主动推理与代码生成等子能力,为理解模型在三维任务中的泛化边界与失效模式提供了可复现的量化依据,推动了三维评测从静态输出向动态智能体范式的转变。
衍生相关工作
围绕3DHarnessBench的发布,已衍生出一系列聚焦智能体三维推理与程序化生成的经典工作。其开源代码、智能体轨迹与多模态评测基线,为后续研究提供了可扩展的实验平台,激发了在工具增强型三维重建、跨模态代码生成与自校正智能体等方向的探索。相关成果进一步推动了视觉语言模型与三维创作工具的深度融合,并在三维基准测试的标准化、评测维度的多元化以及开源生态的协同构建方面产生了持续影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务