train_3d
收藏资源简介:
Qwen3.5 Cambrian-aligned 3D training data v0.1 是一个为3D视觉语言模型训练而设计的数据集包。它包含用于主动学习/SFT(监督微调)的QA分片、姿态分片、去重RGB图像树、可用于动态Cambrian风格视角采样的完整场景姿态索引,以及Qwen3.5-9B基础检查点。该数据集主要用于视觉问答(VQA)和图像到文本任务,支持3D场景理解。数据构成包括:QA/SFT训练数据共14个JSONL分片,包含1,666,877行;QA/SFT验证数据共14个JSONL分片,包含41,440行;姿态训练数据51,905行,外加703行ScanNet++验证数据;动态姿态索引4,424个.npz场景文件,覆盖3,657,730个有效姿态帧;图像共3,973,707个去重文件;模型为Qwen3.5-9B BF16检查点,包含4个safetensors分片,约18.0 GiB。此外,数据集提供了几何归一化方案(相机平移、框中心、框大小均除以场景固定尺度),以及详细的训练脚本、单场景过拟合测试和姿态预训练选项。所有图像加载路径相对于数据集根目录。许可证方面,该打包过程不授予任何许可,用户需自行获取原始数据集的授权。
Qwen3.5 Cambrian-aligned 3D training data v0.1 is a dataset package designed for training 3D vision-language models. It includes QA shards for active learning/SFT (supervised fine-tuning), pose shards, deduplicated RGB image trees, complete scene pose indices for dynamic Cambrian-style viewpoint sampling, and the Qwen3.5-9B base checkpoint. The dataset is primarily used for visual question answering (VQA) and image-to-text tasks, supporting 3D scene understanding. The data composition includes: 14 JSONL shards for QA/SFT training data with 1,666,877 rows; 14 JSONL shards for QA/SFT validation data with 41,440 rows; 51,905 rows of pose training data plus 703 rows of ScanNet++ validation data; 4,424 .npz scene files for dynamic pose indices covering 3,657,730 valid pose frames; 3,973,707 deduplicated image files; and the Qwen3.5-9B BF16 checkpoint with 4 safetensors shards, approximately 18.0 GiB. Additionally, the dataset provides a geometric normalization scheme (camera translation, box center, box size all divided by a fixed scene scale), along with detailed training scripts, single-scene overfitting tests, and pose pre-training options. All image loading paths are relative to the dataset root. Regarding the license, this packaging process does not grant any license; users must obtain authorization from the original dataset themselves.
数据集概述
Qwen3.5 Cambrian-aligned 3D Training Data v0.1 是一个用于视觉问答(VQA)和图像到文本任务的3D训练数据集,专为Qwen3.5-9B模型设计。
数据集构成
| 数据类型 | 数量/规格 |
|---|---|
| QA/SFT训练数据 | 14个JSONL分片,共1,666,877行 |
| QA/SFT验证数据 | 14个JSONL分片,共41,440行 |
| 姿态训练数据 | 51,905行训练数据 + 703行ScanNet++验证数据 |
| 动态姿态场景索引 | 4,424个.npz文件,覆盖3,657,730个姿态有效帧 |
| 图像数据 | 3,973,707个去重后的规范文件 |
| 模型检查点 | Qwen3.5-9B BF16,4个safetensors分片(约18.0 GiB) |
关键更新(2026-08-13几何尺度修正)
此修订版本统一了几何尺度处理:相机平移、框中心和框大小均除以固定的scene_scale_m,解决了此前版本中训练不一致的问题。所有面向模型的3D几何数据均为无量纲化处理,旋转、内参和视场角不进行缩放。
数据组织
- 发布包含1个元数据tar、1个模型tar和19个独立的图像tar卷,所有文件共享顶层目录
qwen35_cambrian_3d_training_v0_1 - 提供
extract_and_verify.sh脚本进行提取和验证,使用sha256sum -c SHA256SUMS校验完整性 - 所有图像加载路径相对于包根目录,提取后无需原始视频容器
训练配置
- 默认全局批大小256,5,000步训练,50%专用姿态采样分支
- QA训练分片按行数比例采样,确保1,666,877条QA记录近似均匀分布
- QA验证覆盖8个逻辑任务族,包含14个验证部分
- 每250步评估一次所有验证部分
- 提供单场景过拟合测试脚本(
run_overfit_one_scene.sh)和姿态预热脚本(run_pose_warmup.sh)
配套清单文件
training_data_manifest.json:记录所有训练/验证分片、行数和采样权重scene_scales.jsonl:记录每个场景的固定尺度和来源normalization_report.json:归一化审计记录qa_distribution_report.json:QA/任务/数据集/类别覆盖情况
许可与访问
此打包过程不授予任何许可,仅允许分发已获授权的部分。ScanNet++数据受其自身条款约束,未经授权不得公开重新分发。




