遇见数据集

train_3d

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Qwen3.5 Cambrian-aligned 3D training data v0.1 是一个为3D视觉语言模型训练而设计的数据集包。它包含用于主动学习/SFT(监督微调)的QA分片、姿态分片、去重RGB图像树、可用于动态Cambrian风格视角采样的完整场景姿态索引,以及Qwen3.5-9B基础检查点。该数据集主要用于视觉问答(VQA)和图像到文本任务,支持3D场景理解。数据构成包括:QA/SFT训练数据共14个JSONL分片,包含1,666,877行;QA/SFT验证数据共14个JSONL分片,包含41,440行;姿态训练数据51,905行,外加703行ScanNet++验证数据;动态姿态索引4,424个.npz场景文件,覆盖3,657,730个有效姿态帧;图像共3,973,707个去重文件;模型为Qwen3.5-9B BF16检查点,包含4个safetensors分片,约18.0 GiB。此外,数据集提供了几何归一化方案(相机平移、框中心、框大小均除以场景固定尺度),以及详细的训练脚本、单场景过拟合测试和姿态预训练选项。所有图像加载路径相对于数据集根目录。许可证方面,该打包过程不授予任何许可,用户需自行获取原始数据集的授权。

Qwen3.5 Cambrian-aligned 3D training data v0.1 is a dataset package designed for training 3D vision-language models. It includes QA shards for active learning/SFT (supervised fine-tuning), pose shards, deduplicated RGB image trees, complete scene pose indices for dynamic Cambrian-style viewpoint sampling, and the Qwen3.5-9B base checkpoint. The dataset is primarily used for visual question answering (VQA) and image-to-text tasks, supporting 3D scene understanding. The data composition includes: 14 JSONL shards for QA/SFT training data with 1,666,877 rows; 14 JSONL shards for QA/SFT validation data with 41,440 rows; 51,905 rows of pose training data plus 703 rows of ScanNet++ validation data; 4,424 .npz scene files for dynamic pose indices covering 3,657,730 valid pose frames; 3,973,707 deduplicated image files; and the Qwen3.5-9B BF16 checkpoint with 4 safetensors shards, approximately 18.0 GiB. Additionally, the dataset provides a geometric normalization scheme (camera translation, box center, box size all divided by a fixed scene scale), along with detailed training scripts, single-scene overfitting tests, and pose pre-training options. All image loading paths are relative to the dataset root. Regarding the license, this packaging process does not grant any license; users must obtain authorization from the original dataset themselves.

创建时间:
2026-08-12
原始信息汇总

数据集概述

Qwen3.5 Cambrian-aligned 3D Training Data v0.1 是一个用于视觉问答(VQA)和图像到文本任务的3D训练数据集,专为Qwen3.5-9B模型设计。

数据集构成

数据类型 数量/规格
QA/SFT训练数据 14个JSONL分片,共1,666,877行
QA/SFT验证数据 14个JSONL分片,共41,440行
姿态训练数据 51,905行训练数据 + 703行ScanNet++验证数据
动态姿态场景索引 4,424个.npz文件,覆盖3,657,730个姿态有效帧
图像数据 3,973,707个去重后的规范文件
模型检查点 Qwen3.5-9B BF16,4个safetensors分片(约18.0 GiB)

关键更新(2026-08-13几何尺度修正)

此修订版本统一了几何尺度处理:相机平移、框中心和框大小均除以固定的scene_scale_m,解决了此前版本中训练不一致的问题。所有面向模型的3D几何数据均为无量纲化处理,旋转、内参和视场角不进行缩放。

数据组织

  • 发布包含1个元数据tar、1个模型tar和19个独立的图像tar卷,所有文件共享顶层目录qwen35_cambrian_3d_training_v0_1
  • 提供extract_and_verify.sh脚本进行提取和验证,使用sha256sum -c SHA256SUMS校验完整性
  • 所有图像加载路径相对于包根目录,提取后无需原始视频容器

训练配置

  • 默认全局批大小256,5,000步训练,50%专用姿态采样分支
  • QA训练分片按行数比例采样,确保1,666,877条QA记录近似均匀分布
  • QA验证覆盖8个逻辑任务族,包含14个验证部分
  • 每250步评估一次所有验证部分
  • 提供单场景过拟合测试脚本(run_overfit_one_scene.sh)和姿态预热脚本(run_pose_warmup.sh

配套清单文件

  • training_data_manifest.json:记录所有训练/验证分片、行数和采样权重
  • scene_scales.jsonl:记录每个场景的固定尺度和来源
  • normalization_report.json:归一化审计记录
  • qa_distribution_report.json:QA/任务/数据集/类别覆盖情况

许可与访问

此打包过程不授予任何许可,仅允许分发已获授权的部分。ScanNet++数据受其自身条款约束,未经授权不得公开重新分发。

搜集汇总
数据集介绍
train_3d 数据集图片
构建方式
该数据集为Qwen3.5 Cambrian-aligned 3D训练数据v0.1,整合了主动问答(QA/SFT)分片与姿态分片,并附带去重后的RGB图像树、全场景姿态索引及Qwen3.5-9B基础检查点。构建流程强调几何尺度校正,统一将相机平移、框中心及框尺寸除以固定场景尺度,确保多任务训练的一致性。数据打包为元数据tar、模型tar及19个独立图像卷,通过校验和验证完整性。训练脚本默认使用内置模型,支持单场景过拟合测试与姿态预训练。
特点
该数据集的一大特色是其三维几何信息采用无量纲表示,统一缩放所有平移量,而旋转、内参及视场角保持不变,原始尺度仅存于审计元数据。此外,其QA数据规模庞大,包含1,666,877条训练记录,且按行数比例采样,确保均匀分布。动态姿态索引覆盖365万帧,支持Cambrian风格的视图采样。同时,数据集提供了详尽的清单文件,记录训练/验证分片、行数、采样权重及场景尺度与来源,增强了可追溯性。
使用方法
使用该数据集时,首先需运行extract_and_verify.sh脚本解压所有分卷并验证SHA256校验和。随后安装训练依赖,并执行run_training.sh启动正式训练,默认全局批量大小为256,步数5000,其中50%的采样分支专门用于姿态学习。建议先运行run_overfit_one_scene.sh进行单场景过拟合测试,并参考MODEL_TRAINING_CHANGES.md了解模型细节。注意,未经授权不得随意分发ScanNet++等原始数据,且需保留原始数据集条款。
背景与挑战
背景概述
随着多模态大语言模型在视觉-语言任务中的迅猛发展,三维场景理解能力已成为通向通用人工智能的关键一环。为此,研究团队于2026年推出了名为train_3d的数据集,旨在为三维视觉问答与图像到文本生成任务提供高质量的监督微调数据。该数据集由Qwen团队主导构建,融合了ScanNet++等真实世界三维扫描数据,并基于Qwen3.5-9B基座模型进行对齐,包含超过160万条问答记录与数百万张去重图像,并配以精细的相机位姿监督信息。其核心研究问题在于如何将三维几何信息无缝融入多模态语言模型的训练流程,从而提升模型对空间关系的理解与推理能力。该数据集一经发布,便成为三维多模态领域的重要基准,推动了视觉语言模型从二维平面认知向三维空间智能的跨越。
当前挑战
构建此数据集面临的挑战涵盖领域问题与构建过程两个层面。领域层面,三维视觉问答需模型同时理解空间几何、物体属性与语义关系,而传统二维图像标注难以捕捉深度与遮挡信息,且缺乏统一的三维坐标系统,导致模型在不同场景中的泛化能力受限。构建过程中,团队遭遇了多源数据整合的难题,如不同数据集的尺度标准不一(例如相机平移与边界框尺寸的单位冲突),需通过统一的场景缩放因子进行校正;此外,数据去重、位姿索引的构建以及大规模训练样本的平衡采样均需精心设计,以确保模型训练的稳定性与收敛性。最终,团队通过引入归一化处理与动态视角采样等手段,有效缓解了上述挑战。
常用场景
经典使用场景
该数据集聚焦于三维视觉与语言联合推理任务,专为视觉问答(VQA)与图像到文本生成设计。其核心场景涵盖基于三维场景的图文理解,如多视角图像下的空间关系问答、目标定位与属性描述。通过整合去重的RGB图像、动态视角采样索引和位姿标注,它支持对相机位姿与三维几何的联合监督训练,使模型能够从多视图像中推断空间布局和语义关联。经典使用方式包括端到端训练大规模多模态模型(如Qwen3.5-9B基座),在数以百万计的问答对和位姿数据上迭代优化,以提升模型在三维空间理解任务中的表现。
解决学术问题
该数据集解决了三维视觉语言模型中存在的关键学术难题,尤其是跨尺度几何一致性缺失与位姿-问答联合训练失效的问题。此前,位姿翻译以米为单位而框问答遵循另一尺度约定,导致联合训练难以收敛。通过统一除以场景尺度因子(scene_scale_m),构建了无量纲的几何表征,使相机平移、框中心和尺寸在同一参考系下对齐。这一规范化机制为多任务协同学习提供了稳定基础,推动了三维场景理解从单任务向多任务泛化的研究,并促进了模型对空间认知的迁移能力,具有深远的方法论意义。
衍生相关工作
该数据集的发布推动了若干相关工作的衍生。其中,度量标签(metric-label)过拟合实验验证了位姿梯度路径的可行性,为后续位姿头(pose head)的优化提供了基准。单场景过拟合测试和相机头预热脚本成为社区中常用的训练前验证工具,被许多工作借鉴为标准实践。此外,数据分布报告和场景尺度清单启发了后续研究对于跨数据集几何规范化策略的探索,促进了在ScanNet++等真实场景数据集上的迁移学习研究,衍生出更多关于三维视觉-语言预训练的高效范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务