遇见数据集

navbench_8in8_15k

收藏
魔搭社区2026-06-23 更新2026-07-15 收录
官方服务:

资源简介:

# NavBench 8in8 15k XPoints 短思考版 NavBench BEV 未来轨迹点预测数据集,已整理为 **ShareGPT + XPoints grounding** 格式,可直接用于多模态 SFT / RL(GRPO)训练。 - **样本数**:15,784 - **任务**:给定 egocentric RGB + BEV RGB + 8 个 past/current 轨迹点 + 导航指令,预测 **exactly 8** 个 future BEV footprint 点 - **输出格式**:`<thinking>短句</thinking>` + `<answer>[{"label","point_2d":[x,y]}, ...]</answer>` - **坐标系**:BEV 归一化坐标 `[0, 1000]`,原点在左上角 > 数据源自 NavBench(非 MatchBench)。为兼容 XPoints reward dispatch,`data_source=match`,`extra_info.question_type=grounding`。 ## 下载与解压 本数据集在 ModelScope 上以 **单个 tar.gz 压缩包** 发布(避免数万小文件上传过慢): ```bash modelscope download --dataset MLLM-RL/navbench_8in8_15k --local_dir ./navbench_release cd navbench_release tar -xzf navbench_8in8_15k.tar.gz cd navbench_8in8_15k ``` ## 目录结构 解压 `navbench_8in8_15k.tar.gz` 后应包含: ```text navbench_8in8_15k/ ├── qa_sharegpt.jsonl # 训练标注(15,784 条) ├── images/ # egocentric RGB,路径如 images/ep4991/obs0048.png ├── bevs_rgb/ # BEV RGB,路径如 bevs_rgb/ep4991/step0048.png ├── summary.json # 转换摘要 ├── navbench_reward.py # reward 函数(RL/评测参考) ├── navbench_8in8_xpoints_reward.md ├── validate_training_ready.py # 训练前校验 ├── convert_to_files.py # 媒体合并脚本(复现用) ├── sharegpt_converter.py # 格式转换脚本(复现用) └── run_conversion.sh # 一键复现脚本 ``` ## 快速开始 ### 1. 解压 ```bash tar -xzf navbench_8in8_15k.tar.gz cd navbench_8in8_15k ``` ### 2. 校验数据完整性 ```bash python validate_training_ready.py ``` 期望输出 `"ok": true`,且 15,784 条样本均为 8 点 ground truth。 ### 3. 读取 JSONL ```python import json from pathlib import Path root = Path("navbench_8in8_15k") # 或解压后的实际路径 with open(root / "qa_sharegpt.jsonl", encoding="utf-8") as f: sample = json.loads(f.readline()) print(sample["id"]) print(sample["images"]) # 2 张图:egocentric + BEV print(sample["ground_truth"]) # 8 个 future point_2d print(sample["conversations"][-1]["value"][:200]) ``` ### 4. 加载图片 ```python from PIL import Image img_paths = [root / p for p in sample["images"]] images = [Image.open(p).convert("RGB") for p in img_paths] print([im.size for im in images]) ``` ### 5. 从 ModelScope 下载(上传后) ```python from modelscope.hub.snapshot_download import snapshot_download local_dir = snapshot_download( "MLLM-RL/navbench_8in8_15k", repo_type="dataset", ) print(local_dir) ``` 或使用 CLI: ```bash modelscope download --dataset MLLM-RL/navbench_8in8_15k --local_dir ./navbench_8in8_15k ``` ## 单条样本格式 | 字段 | 说明 | |------|------| | `id` | 唯一 ID,如 `navbench_bev_rgb:train:ep4991:step0048` | | `conversations` | ShareGPT 格式:`system` / `human` / `gpt` | | `images` | 2 个相对路径:`images/...` + `bevs_rgb/...` | | `ground_truth` | 8 个 `{"label": "future_bev_footprint_N", "point_2d": [x, y]}` | | `data_source` | 固定为 `match`(兼容 XPoints loader) | | `extra_info` | 含 `question_type=grounding` 等元信息 | Human prompt 中包含 8 个 past/current BEV 点(JSON),最后一个点为当前机器人位置。GPT 回复示例: ```text <thinking>The BEV past points define the local motion direction.</thinking> <answer>[{"label":"future_bev_footprint_1","point_2d":[501,471]}, ...]</answer> ``` **注意**:reward / parser 应只解析 `<answer>...</answer>` 中的 JSON,不评估 `<thinking>` 文本。 ## Reward 使用 目录内 `navbench_reward.py` 提供自包含 reward 函数,可直接接入 XPoints / GRPO 训练: ```python import importlib.util from pathlib import Path spec = importlib.util.spec_from_file_location( "navbench_reward", Path("navbench_reward.py") ) mod = importlib.util.module_from_spec(spec) spec.loader.exec_module(mod) score = mod.compute_score( solution_str=model_output, ground_truth=sample["ground_truth"], ) ``` 详细设计见 `navbench_8in8_xpoints_reward.md`。 ## 与 MatchBench 的关系 JSONL schema 与 MatchBench ShareGPT grounding 格式一致(`id`, `images`, `conversations`, `ground_truth`, `extra_info`),但任务不同: - **MatchBench**:图像区域匹配 - **NavBench(本数据集)**:BEV 未来轨迹点预测 ## 数据复现(可选) 从原始 sharded 数据重新生成: ```bash bash run_conversion.sh \ /path/to/navbench_8in8_15k_sharded \ /path/to/output/navbench_8in8_15k ``` ## 上传到 ModelScope 1. 在 [ModelScope 数据集页](https://modelscope.cn/datasets) 创建数据集:`MLLM-RL/navbench_8in8_15k` 2. 登录(需有效 Access Token): ```bash modelscope login --token <YOUR_ACCESS_TOKEN> ``` 3. 上传整个目录(推荐解压后的目录,或 tar.gz 文件): ```bash modelscope upload MLLM-RL/navbench_8in8_15k \ /path/to/navbench_8in8_15k \ --repo-type dataset \ --commit-message "add navbench 8in8 15k xpoints dataset" ``` 大文件上传建议使用 `--max-workers 8` 提高并发。 ## 许可与引用 - 本数据集整理自 **NavBench**,使用前请遵循 NavBench 原始数据许可条款 - 如用于公开发布,请确认导航场景图像的使用权限 ## 校验结果(2026-06-04) XPoints 真实 ShareGPT loader 全量解析结果: ```text loaded 15784 bad [] ok True ``` 本地训练前校验结果: ```json { "rows": 15784, "gt_counts": {"8": 15784}, "roles": {"system|human|gpt": 15784}, "data_sources": {"match": 15784}, "question_types": {"grounding": 15784}, "ok": true } ```

提供机构:
maas
创建时间:
2026-06-04
二维码
社区交流群
二维码
科研交流群
商业服务