workspace
收藏资源简介:
该工作空间的核心是VSI-Bench数据集,这是一个用于评估模型在真实3D室内场景中进行视觉空间推理能力的基准测试。数据集包含来自ScanNet、ARKitScenes和ScanNet++等多个真实世界扫描数据集的场景视频。每个场景都附带一系列需要空间理解和推理的问题,例如物体计数、空间关系、距离比较、物体出现顺序和路径规划等。数据集中提供了每个问题的标准格式(`test.jsonl`),包括问题文本、多项选择选项(如适用)以及真实答案。此外,数据集还包含了官方的3D标注信息(物体边界框、房间尺寸等),存储在`data/meta_info/*.json`中,这些标注被用作构建完美感知空间代码的地面实况来源。该数据集旨在推动视觉语言模型和几何推理系统在复杂、接地气的空间推理任务上的发展。
At the core of this workspace is the VSI-Bench dataset, a benchmark for evaluating models visual-spatial reasoning capabilities in real-world 3D indoor scenes. The dataset includes scene videos sourced from multiple real-world scanning datasets such as ScanNet, ARKitScenes, and ScanNet++. Each scene is accompanied by a series of questions that require spatial understanding and reasoning, such as object counting, spatial relationships, distance comparisons, object occurrence order, and path planning. The dataset provides a standard format (`test.jsonl`) for each question, including the question text, multiple-choice options (where applicable), and ground-truth answers. Additionally, it includes official 3D annotation information (e.g., object bounding boxes, room dimensions) stored in `data/meta_info/*.json`, which serves as the ground truth source for building perfect perception spatial code. The dataset aims to advance the development of visual-language models and geometric reasoning systems in complex, grounded spatial reasoning tasks.
数据集详情概述:Spatial Code VSI-Bench Workspace
数据集基本信息
- 数据集名称:Spatial Code VSI-Bench Workspace
- 数据集链接:https://huggingface.co/datasets/AntonioJun/workspace
- 用途:用于评估 VSI-Bench 问答任务,支持多种输入模式(原始视频帧、感知空间码、真实空间码、确定性符号求解器)
核心功能与工作流
三大工件分类
- 源代码与测试:位于
/workspace - 数据、缓存与模型检查点:位于
/root/data和/root/models - 生成结果与报告:位于
/root/results和/workspace/reports
标准工作流
- 运行感知缓存(
inference.run或inference.launch) - 构建感知空间码(
encoder.run或encoder.launch) - 运行 VLM 测试集 A-C 或符号测试集 F
- 生成报告(
analysis.letters_reports) - 备份选定输出(
backup.py)
主要组件与命令参考
设置与备份
./setup.sh:安装包、克隆仓库、下载数据/模型./setup.sh支持跳过模型、数据、工作空间等选项backup.py:备份代码、报告、空间码或特定测试集结果到 Hugging Face 数据集
推理:原始模型缓存
- 支持 SAM3 和 Depth Anything 3 模型后端
- 支持单场景和批量运行
- 重要文件:
inference/__init__.py、inference/adapters.py、inference/prompts.py、inference/run.py、inference/launch.py
编码器:空间码生成
- 从现有 SAM3/DA3 缓存构建空间码
- 支持显式 JSON 格式输出
- 重要文件:
encoder/config.py、encoder/adapters.py、encoder/geometric.py、encoder/render.py、encoder/run.py、encoder/launch.py
符号求解器
- 确定性 VSI-Bench 回答逻辑
- 支持显式/紧凑格式的空间码输入
- 重要文件:
symbolic/adapters.py、symbolic/solver.py、symbolic/run.py、symbolic/launch.py
测试集 A-C 及符号测试集 F
| 测试集 | 输入类型 | 说明 |
|---|---|---|
| 测试集 A | 原始视频帧 | 支持帧选择或完整视频,多种 VLM 模型 |
| 测试集 B | 空间码文本 | 仅使用空间码文本,支持多种深度/跟踪配置 |
| 测试集 C | 帧 + 空间码 | 结合视觉输入和空间码的双输入模式 |
| 测试集 F | 符号求解器 | 将符号求解器封装为测试集格式 |
实验:几何假设
- 支持多种几何假设分支(如 "Compute Gravity Before Building Object Instances")
- 可从已有缓存构建假设空间码并进行符号评估
默认输出布局
| 生产者 | 默认输出路径 |
|---|---|
| SAM3 推理 | /root/data/caches/sam3/<tracking>/frames/<input>/<frames>/<scene>.pt |
| DA3 推理 | /root/data/caches/depth-anything-3/<depth>/frames/<input>/<frames>/<scene>.pkl |
| 编码器组合缓存 | /root/data/caches/sam3+depth-anything-3/<tracking>/frames/<input>/<frames>/<scene>.pkl.gz |
| 感知空间码 | $VSI_CODES/sam3+depth-anything-3/<tracking>/frames/<input>/<frames>/explicit/<scene>.json |
| A 结果 | `/root/results/A/<model>/{<selection>/<frames> |
| B/C/F 结果 | 类似路径结构,包含深度/跟踪/输入选择等维度 |
| 报告 | /workspace/reports/*_report.json |
可再现性保证
- 固定输入、包、检查点、命令/配置及冻结的 SAM3/DA3 缓存下,空间码生成可代码级别再现
- VLM 调用使用固定提示和确定性解码配置
- 测试集输出按所有有意义的配置轴组织以避免碰撞
- 测试使用合成夹具,无需真实数据、结果、缓存或检查点




