遇见数据集

3DHarnessBench

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

3DHarnessBench 是一个用于评估前沿视觉语言模型(VLM)从多种目标证据形式恢复 3D 几何形状(作为可执行的 Blender Python 代码)的智能体能力的基准测试。该基准测试不限制所有系统使用单一固定输入,而是比较四种逐渐丰富的设置:单视图(Single-view)、多视图(Multi-view)、主动视觉(Active Visual,允许任意视点访问)和完整 3D 交互(Full 3D Interaction,通过 Blender 函数调用暴露目标)。这种层次结构同时测试视觉感知、主动推理、工具使用和自我修正能力。发布内容包含 100 个目标实例和 2,800 次智能体运行,覆盖所有四种设置、七个模型和 100 个目标实例的组合。评估的模型包括:fable-5、gemini-3-1-pro、gpt-5-6-sol、kimi-k3、minimax-m3、opus-5 和 qwen3-8-max-preview。数据以 HuggingFace 数据集形式提供,默认加载 `metadata/runs.jsonl` 作为训练集,每行记录一次运行,包含设置、模型、实例、运行目录路径、最终代码和重建 GLB 的 SHA-256 哈希值、轨迹类型以及是否被无种子随机性启发式标记。生成的程序、图像、GLB、评估工件和完整智能体轨迹存储在仓库文件中,由每行引用的路径定位。该数据集适用于评估 VLM 的 3D 到代码的智能体能力,并可进行可重复分析。

3DHarnessBench is a benchmark for evaluating the agentic ability of cutting-edge vision-language models (VLMs) to recover 3D geometry (as executable Blender Python code) from multiple forms of target evidence. Instead of restricting all systems to a single fixed input, the benchmark compares four progressively richer settings: Single-view, Multi-view, Active Visual (allowing arbitrary viewpoint access), and Full 3D Interaction (exposing the target via Blender function calls). This hierarchy simultaneously tests visual perception, active reasoning, tool use, and self-correction. The release includes 100 target instances and 2,800 agent runs, covering all combinations of four settings, seven models, and 100 target instances. The evaluated models include: fable-5, gemini-3-1-pro, gpt-5-6-sol, kimi-k3, minimax-m3, opus-5, and qwen3-8-max-preview. The data is provided as a HuggingFace dataset, with `metadata/runs.jsonl` loaded by default as the training set. Each line records a single run, containing the setting, model, instance, run directory path, final code and SHA-256 hash of the reconstructed GLB, trajectory type, and whether it is flagged by a seed-free randomness heuristic. The generated programs, images, GLBs, evaluation artifacts, and full agent trajectories are stored in repository files, located by the paths referenced in each line. This dataset is suitable for evaluating VLMs 3D-to-code agentic ability and enables reproducible analysis.

创建时间:
2026-09-06
原始信息汇总

数据集概述

3DHarnessBench 是一个用于评估前沿视觉语言模型(VLMs)从多种目标证据形式中恢复3D几何结构(以可执行的 Blender Python 代码形式)的智能体能力基准。

核心内容

  • 基准规模:包含 100 个目标实例,4 种 Harness 设置,7 种模型,共 2,800 次智能体运行。
  • 四种 Harness 设置Single-view(单视图)、Multi-view(多视图)、ActiveVisual(主动视觉,允许任意视点访问)、Full3DInteraction(完整3D交互,通过 Blender 函数调用暴露目标)。
  • 评估模型:包括 fable-5gemini-3-1-progpt-5-6-solkimi-k3minimax-m3opus-5qwen3-8-max-preview 七种模型。

数据内容与结构

  • benchmark/:每个实例包含基准源程序(.py)、带纹理/PBR参考几何体(.glb)及中性灰色参考几何体(_grey.glb)、四视图彩色渲染和四视图中性灰色渲染。
  • runs/:按设置和模型组织,包含最终生成的 Blender 程序、验证渲染图、GLB 输出、智能体轨迹(trajectory/README.md 与 trajectory/index.json)以及完整执行证据(raw/ 目录)。
  • metadata/runs.jsonl 为数据集查看器索引(共 2,800 行),记录每次运行的设置、模型、实例、结果文件路径、SHA-256 哈希、轨迹类型等信息;trajectory_selection.json 记录了 7 条异常 ActiveVisualFull3DInteraction 轨迹的详情。

智能体轨迹说明

  • ActiveVisualFull3DInteraction,轨迹包含一个逻辑会话(从最早连接至最终成功重建),所有重试视为同一会话的连续片段。
  • Single-viewMulti-view,轨迹包含完整过程:初始生成(iteration 0)、三轮精化迭代(iteration 1-3)、所有重试及原始响应。
  • 用于查看器的默认 split 为 default/train

质量与安全

  • 所有 render_log.json 报告为 OK,GLB 构建后已检查网格数据。
  • 释放版本为审计后的公开副本,日志中的凭据值已被替换为 [REDACTED_…],事件顺序和 JSON/JSONL 结构不变。

入口与链接

搜集汇总
数据集介绍
3DHarnessBench 数据集图片
构建方式
3DHarnessBench数据集旨在评估前沿视觉语言模型(VLMs)从多种目标证据中恢复三维几何并生成可执行Blender代码的代理能力。构建过程涉及四个递进式设定,即Single-view、Multi-view、Active Visual及Full 3D Interaction,分别限制视角为单视图、多视图、任意视角选择以及通过Blender函数调用完整交互。每个设定下,模型被要求针对100个目标实例生成Blender程序,从而形成4种设定、7种模型与100个实例的2,800次完整运行的组合矩阵。所有运行输出、渲染图像、重建的GLB文件、评估材料及代理轨迹均被系统化收录,并附带SHA-256哈希以确保数据完整性。
特点
该数据集的核心特色在于其分层递进的基准设计,能够精细剖析VLM在三维重建任务中的视觉感知、主动推理、工具调用与自我修正能力。通过比较不同设定下的性能差异,揭示模型在代理型三维转代码任务上的能力不均衡性。每一条运行记录均包含元数据索引,涵盖设定、模型、实例、轨迹类型及随机性启发式标记,便于快速检索。此外,数据集还提供了人类可读与机器可读两种轨迹格式,便于深入分析模型的决策过程。所有输出文件均存放于固定浅层路径,确保复现实验的便捷性与可靠性。
使用方法
使用3DHarnessBench时,研究者可通过Hugging Face数据集查看器加载metadata/runs.jsonl作为默认训练分割,该文件包含2,800条运行元数据,每条记录指向对应的运行目录。用户可从目录中的README.md或index.json访问实例的最终生成代码、四视图渲染、GLB重建结果及完整代理轨迹(包括提示、助手消息、工具调用及MCP数据)。对于Active Visual和Full 3D Interaction设定,轨迹以带内重连会话形式组织,需按时间顺序阅读以便完整理解重建过程。数据集还提供轨迹选择说明文档,用于深入分析异常情况,并支持通过固定路径访问所有输出文件以复现实验。
背景与挑战
背景概述
3DHarnessBench,作为一项前沿的3D重建基准测试,由活跃于视觉-语言模型(VLM)与3D几何理解交叉领域的研究团队于近期推出。其核心研究问题在于探求前沿VLM在从多种形式的视觉及交互证据中恢复可执行的3D几何代码(即Blender Python代码)的代理能力。该基准通过构建从单一视图到全3D交互的分级线索体系,系统性地评估视觉感知、主动推理、工具利用与自我修正等复杂能力的协同效应。由于该数据集精细记录了每个模型的推理轨迹及输出结果,它为量化和对比不同VLM在3D结构化任务中的泛化能力提供了标准化平台,对评估《青蛙》中的AI几何推理研究范式、推动具身智能体的发展具有显著影响力。
当前挑战
数据集面临的主要挑战涵盖领域问题与构建过程两方面。在领域问题层面,现有前沿VLM在从静态视觉输入到3D结构化代码的转化中,常表现出几何推理不精确、光照与纹理区分能力弱以及对复杂遮挡空间感知不足等固有难题;且不同模型对这些任务处理能力的差异显著,难以实现统一的性能预测与优化。在构建过程层面,开发团队须在保证任务复杂度的前提下,设计分级线索的可控性与公平性,确保四种情境的条件分布一致。同时,多视角渲染需精确对齐颜色、纹理与几何信息,而完整3D交互需模拟复杂的Blender环境,这些都要求高质量的数据生成、严密的执行监控(如记录并验证每个实例的输出),以及克服数据规模有限(仅100个实例、2,800次运行)带来的统计效力与可泛化性挑战。
常用场景
经典使用场景
3DHarnessBench是用于评估前沿视觉语言模型(VLMs)将3D几何信息恢复为可执行的Blender Python代码能力的基准测试。该基准通过四种逐渐增强的输入形式(单视图、多视图、主动视觉和完整3D交互)来测试模型的视觉感知、主动推理、工具使用和自我修正能力。每个模型需要在给定的输入条件下生成精确的3D重建代码,并经过渲染和网格验证。此基准特别适用于衡量模型在代码生成中的空间理解能力和执行精确性,是当前研究生成式3D建模和程序化建模能力的重要工具。
衍生相关工作
3DHarnessBench的设计和结果促进了多项相关研究,包括基于VLMs的交互式3D重建、程序化建模中的自我修正策略、以及多模态输入下的空间推理评估方法。该基准的发布推动了未来工作,如探索更深层的工具调用机制、优化模型在有限视觉信息下的推理能力,以及设计更细粒度的评估指标来区分模型性能差异,从而进一步推动领域发展。
数据集最近研究
最新研究方向
3DHarnessBench数据集的发布标志着视觉-语言模型在三维几何恢复与程序合成交叉领域的前沿探索,其革新之处在于引入了从单视图到全3D交互的层次化输入范式,系统性地度量了模型在主动感知、工具调用与自我纠错等方面的智能体能力。该基准通过Blender Python代码这一可执行媒介,将模型输出与真实几何结构紧密耦合,为评估前沿多模态模型的具身推理水平树立了新标杆。2,800条轨迹的开放共享为研究社区提供了丰富的研究素材,有望推动从被动识别迈向主动推断的新一代三维视觉理解算法发展,并为虚拟现实、机器人操控等实体智能应用铺平道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务