遇见数据集

Skill-3D

收藏
github2026-06-08 更新2026-06-10 收录
数据链接:
官方服务:

资源简介:

Skill-3D是一个用于代理3D空间推理的框架,其数据集部分包含四个3D空间推理基准测试:VSI-Bench、BLINK、CV-3D/CV-Bench和MMSI-Bench。数据集布局包括skill3d_splits文件夹,其中包含训练和测试JSONL文件,用于技能演化、后训练和评估。数据集通过Hugging Face发布,仅从训练样本中收集教师生成的rollouts。

Skill-3D is a framework for agent 3D spatial reasoning. Its dataset component includes four 3D spatial reasoning benchmarks: VSI-Bench, BLINK, CV-3D/CV-Bench, and MMSI-Bench. The dataset layout consists of the skill3d_splits folder, which contains training and test JSONL files for skill evolution, post-training, and evaluation. The dataset is released via Hugging Face, with only teacher-generated rollouts collected from training samples utilized.

创建时间:
2026-06-06
原始信息汇总

数据集概述:Skill-3D

Skill-3D 是一个用于智能体3D空间推理(Agentic 3D Spatial Reasoning)的框架与数据集。其核心创新在于通过构建“场景记忆”(Scene Memory)和演化“技能库”(Skill Library),使多模态大语言模型(MLLM)智能体能够针对不同3D场景自适应地选择和使用外部感知与几何工具,从而提升空间推理任务的性能。

关键特性

  • 场景感知技能提取:成功使用工具的路径被提炼为可复用的工作流(技能),失败的路径被保留为纠正性教训。
  • 场景记忆与技能库:从所有基准测试的训练集样本中构建共享的记忆与技能库,确保测试样本不被用于技能构建或后训练。
  • 显著提升工具利用率:在VSI-Bench基准上,有效工具使用率从39%提升至78%。

数据集构成与评估基准

Skill-3D在以下四个3D空间推理基准上进行评估:

基准名称 主要评估任务
VSI-Bench 物体计数、公制距离、物体大小、房间大小、相对方向、路线规划、外观顺序
BLINK 多视图空间推理
CV-3D / CV-Bench 深度顺序和相对距离推理
MMSI-Bench 位置关系推理

数据布局与发布

  • 数据集在Hugging Face上发布,包含用于技能演化、后训练和评估的 skill3d_splits 文件。
  • 典型的本地数据布局如下(dataset/ 为根目录):

text dataset/ |-- skill3d_splits/ | |-- vsi_train.jsonl | |-- vsi_test.jsonl | |-- mmsi_pr_train.jsonl | |-- mmsi_pr_test.jsonl | |-- cv3d_train.jsonl | |-- cv3d_test.jsonl | |-- blink_multiview_train.jsonl | -- blink_multiview_test.jsonl |-- VSI-Bench/ |-- MMSI-Bench/ |-- CV-3D/ -- BLINK/

工具服务与环境

Skill-3D集成了多个外部专家工具,均需独立部署服务。典型工具及其环境变量和默认端口如下:

工具名称 环境变量 默认URL 功能
Depth-Anything-3 DEPTH_SERVER_URL http://127.0.0.1:20019 公制深度估计
SAM3 SEGMENTATION_SERVER_URL http://127.0.0.1:20020 图像分割
GroundingDINO DETECTION_SERVER_URL http://127.0.0.1:20022 开放词汇目标检测
Pi3 PI3_SERVER_URL http://127.0.0.1:20030 3D重建
SwinIR SWINIR_SERVER_URL http://127.0.0.1:20032 超分辨率/图像恢复
Orient-Anything v2 ORIENT_ANYTHING_SERVER_URL http://127.0.0.1:20034 物体方向估计

后训练与推理

  • 训练:提供SFT(监督微调)和GRPO(基于组相对策略优化)的Shell脚本和提示模板。已训练好的4B/8B参数检查点已在Hugging Face上发布。
  • 推理:支持通过OpenAI兼容的API或本地vLLM服务器进行推理。

仓库结构

项目核心代码位于 skill3d/ 目录下,包括智能体、记忆、技能、工具注册和模型封装等模块。

许可证

该项目采用 Apache-2.0 许可证。

搜集汇总
数据集介绍
Skill-3D 数据集图片
构建方式
Skill-3D数据集的构建基于多模态大语言模型代理在三维场景中的自主探索与经验沉淀。研究团队将VSI-Bench、BLINK、CV-3D和MMSI-Bench四个三维空间推理基准的训练样本进行汇聚,通过代理在各类三维场景中执行工具调用任务,收集成功与失败的交互轨迹。成功的工具使用轨迹被提炼为可复用的场景感知技能,而失败的案例则被保留作为矫正性经验,共同构成一个动态演进的技能库。所有测试样本均被严格排除在技能构建与后训练过程之外,确保了评估的公正性。
特点
该数据集的核心特色在于其创新的场景记忆与技能库双模块架构。场景记忆模块存储了代理对异构三维环境的感知信息,而技能库则收录了针对特定场景与任务的优化工具调用策略。这种设计使得代理能够根据当前场景与任务检索最相关的技能,从而将有效的工具使用率从39%显著提升至78%。数据集还涵盖了丰富的空间推理任务类型,包括目标计数、度量距离、物体尺寸估算、房间尺度感知、相对方向判断、路径规划、外观顺序推理、多视角空间推理、深度排序及位置关系推理等,为三维空间推理研究提供了全面而系统的评估平台。
使用方法
使用Skill-3D数据集时,研究者首先需配置包含Depth-Anything-3、SAM3、GroundingDINO、Pi3、SwinIR和Orient-Anything v2等多种外部专家工具的服务环境,这些工具分别提供深度估计、分割、检测、三维重建、超分辨率和朝向估计等功能。数据集以JSONL格式提供训练与测试拆分文件,用户可基于预设的评分脚本进行模型推理评估。研究团队同时发布了基于Qwen3-VL-4B/8B的SFT与GRPO训练脚本,并提供了已训练的检查点,支持技能引导的轨迹微调,使紧凑的多模态大语言模型能够继承场景感知的工具使用行为。
背景与挑战
背景概述
Skill-3D数据集由浙江大学李浩源等研究人员于2026年创建,旨在解决多模态大语言模型在三维空间推理任务中的核心难题。该数据集围绕视觉空间智能领域,构建了涵盖物体计数、距离估计、方向判断等多样化空间推理能力的评估基准,整合了VSI-Bench、BLINK、CV-3D与MMSI-Bench四大主流三维空间推理测试集。Skill-3D的提出标志着从传统工具增强式智能体向场景感知式技能演化范式的转变,通过在异构三维场景中构建场景记忆与技能库,实现了工具调用策略的自适应优化,显著提升了智能体在复杂三维环境中的推理效能与泛化能力,对推动具身人工智能与空间智能研究具有重要学术价值。
当前挑战
Skill-3D所应对的核心挑战在于现有工具增强型智能体在面对异构三维场景时普遍采用统一的工具调用策略,导致证据匹配失准、工具调用冗余,相较于非智能体基线方法性能增益有限。数据构建过程中面临的挑战包括:如何从海量异构场景中提取可复用的场景感知技能,并将成功的工具调用轨迹蒸馏为结构化的技能工作流,同时保留失败案例作为修正经验;技能库的场景敏感性与跨场景泛化能力之间存在平衡难题;此外,多模态大语言模型对三维空间关系的理解受限于单目视觉输入的几何信息缺失,需借助深度估计、三维重建等外部工具补充空间线索,而工具服务的精度与计算资源开销之间的取舍构成了工程实现层面的严峻考验。
常用场景
经典使用场景
Skill-3D数据集专为三维空间推理中的智能体任务而设计,其经典使用场景聚焦于多模态大语言模型(MLLM)在异构3D场景中的工具调用与推理能力。通过构建场景记忆与技能库,该数据集支持模型在物体计数、度量距离估计、物体尺寸判断、房间尺度感知、相对方向推理、路径规划及外观顺序识别等精细任务上进行场景感知的智能决策。研究者可借助Skill-3D训练智能体在复杂3D环境中动态检索并应用与任务相关的空间技能,从而显著提升工具使用的有效性与推理的准确性。
解决学术问题
Skill-3D数据集着力解决了现有工具增强型智能体在三维空间推理中面临的工具调用策略单一、证据匹配失当与冗余调用的学术难题。传统方法往往对不同3D场景施以统一的工具使用策略,导致性能瓶颈。该数据集通过将成功工具调用轨迹转化为可复用的场景感知工作流,并保留失败案例作为纠正经验,实现了场景自适应工具规划与答案定位。其意义在于为智能体赋予结构化、可演化的空间推理能力,推动了从静态工具堆砌到动态技能演化的范式转变,为具身智能与空间理解研究提供了关键数据支撑。
衍生相关工作
Skill-3D数据集衍生了多项开创性工作,包括基于场景记忆的技能提取算法、技能引导的智能体监督微调(SFT)与组相对策略优化(GRPO)框架。研究团队发布了Qwen3-VL-4B和8B版本的SFT与GRPO训练检查点,推动了紧凑型MLLM在3D空间推理领域的轻量化部署。此外,该数据集与Think3D/SPAgent代码库深度集成,并整合了GroundingDINO、SAM3、Depth-Anything-3等专家工具,形成了从技能演化到推理泛化的完整技术生态,为后续空间智能体研究奠定了基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务