遇见数据集

testicra2027-data

收藏
魔搭社区2026-09-01 更新2026-09-06 收录
官方服务:

资源简介:

# HarnessVLN 监控与恢复数据集 配套代码:https://github.com/ZHAJIANGMIAN2002/testicra2027 ## 数据集简介 一条冻结的视觉语言导航策略在 R2R-CE / RxR-CE 上滚出轨迹,本数据集提供在其之上训练两个模块所需的全部素材: - **监控判官(monitor judge)**:在每个决策点判断策略是否已经偏离指令描述的路线。训练行由路线规则自动标注,标签为 `OK` / `lost`。 - **恢复策略(recovery policy)**:判官报警、策略被清空历史重启之后接管本段导航。以 GRPO 从"首次偏离路线"的状态出发训练。 同时提供两个已训练好的 LoRA 适配器,可直接用于推理与复现评测。 ## 数据集结构 ``` drift_critic_rows_route/ 判官训练数据 train.jsonl 259,014 行(r2r + rxr 合并) holdout_select.jsonl 22,680 行 留出集:选检查点 holdout_calib.jsonl 23,611 行 留出集:校准阈值 holdout_full_select.jsonl 69,741 行 同上,未下采样版本 holdout_full_calib.jsonl 72,472 行 r2r/ train.jsonl (76,580) / holdout.jsonl (12,604) train.meta.json 标注规则参数 frames.tar.000.part ... 26 个分卷,帧图像,合计 13.9 GB rxr/ train.jsonl (182,434) / holdout.jsonl (33,687) frames.tar.000.part ... 74 个分卷,帧图像,合计 39.6 GB grpo_recovery/ GRPO 训练起点状态 train_states_le40.json 1,254 个起点(train 划分、非留出场景、首次报警 ≤ 40 步) train_states_all.json 1,957 个起点,不限报警步数 route_states_stage2_{r2r,rxr,r2r_rxr}.json 按数据集切分的起点 adapters/ monitor_judge_ck1800/ 监控判官 LoRA(checkpoint 1800) grpo_recovery_iter8/ 恢复策略 LoRA(GRPO 第 8 轮) ``` 留出划分按路径哈希在 path 级别切分,训练与留出不共享场景,`grpo_recovery` 的 `holdout_scenes` 字段列出被排除的 7 个场景。 ## 数据字段 `drift_critic_rows_route/*.jsonl` 每行一个决策点: | 字段 | 类型 | 说明 | |---|---|---| | `task` | str | 固定为 `drift_critic` | | `dataset` | str | `r2r` 或 `rxr` | | `scene_id` | str | Matterport3D 场景的 glb 路径 | | `episode_id` / `step_id` | int | 集与步的编号 | | `instruction` | str | 该集的自然语言指令 | | `frame_paths` | list[str] | 该决策点的视觉历史帧,仓库相对路径 | | `last_actions` / `recent_actions` | list[str] | 上一动作与近期动作窗口 | | `proposed_chunk` | list[str] | 基座策略提出的候选动作块 | | `action_idx` | int | 动作块在该集中的序号 | | `decision_point` | bool | 是否为判官打分的决策点 | | `distance_to_goal` | float | 当前位置到终点的测地距离(米) | | `label` | str | `OK`(在路线上)/ `lost`(已偏离)。train 划分中 187,593 / 71,421 | | `task_mode` | str | 标注模式,`mid` 表示中途判定 | | `weight` | float | 该行在损失中的权重 | | `success` | bool | 该集最终是否成功 | `grpo_recovery/*.json` 的 `states` 每项为一个恢复起点:`episode_id`、`scene`、`alarm_step`(首次报警的步)、`alarm_dtg`(报警时到终点的距离)。文件另带 `depth_cutoff`、`group_size`、`holdout_scenes` 等生成参数。 ## 使用方式 数据被代码按仓库相对路径引用(`frame_paths` 形如 `data/drift_critic_rows_route/...`),因此需放到 checkout 的 `data/` 下: ```bash modelscope download --dataset jmzhou/testicra2027-data --local_dir ./ms_data cd /path/to/testicra2027 mv ms_data/drift_critic_rows_route ms_data/grpo_recovery data/ ``` 帧图像共约 142 万个 jpg(r2r 6,758 集、rxr 11,363 集),远超单仓库文件数上限,按数据集打成一个 tar 后切为 512 MB 分卷。下载后合并并原地解压: ```bash cd data/drift_critic_rows_route for s in r2r rxr; do cat $s/frames.tar.*.part > $s/frames.tar tar -xf $s/frames.tar -C $s/ && rm $s/frames.tar $s/frames.tar.*.part done ``` ### 适配器 两个 LoRA 都以 `navida_qwen3vl_stage2`(NaVIDA / Qwen3-VL-4B)为基座,需自行准备基座权重。 - `monitor_judge_ck1800/` 作为 `--judge-lora` 传入。判官必须配合校准过的阈值才会触发重启:论文中部署的 `c1` 臂在 `val_unseen` 上使用 `--drift-threshold 3.96 --risk-window 3 --judge-every 1`,`restart_max_depth 0`,不清空近期动作。`trainer_state.json` 记录训练曲线。 - `grpo_recovery_iter8/` 作为 `--restart-lora` 传入,来自 Qwen3-VL 线 `80g8` 配置、SPL 奖励的第 8 轮,是全量 1839 集评测所用的检查点。`iter_summary.json` 记录该轮的奖励与停止统计。 两者均只含推理所需的权重与配置,不含优化器状态,可用于推理和评测,不能直接续训。 ## 数据来源与许可 指令与集划分来自 R2R-CE 与 RxR-CE(RxR 为 CC-BY-4.0),场景与帧渲染自 Matterport3D。**帧图像属于 Matterport3D 的衍生数据,其使用条款不允许公开再分发,因此本数据集为非公开。** 使用前请自行确认已签署 Matterport3D 的使用协议。 代码部分以 Apache License 2.0 发布。

提供机构:
maas
创建时间:
2026-08-31
二维码
社区交流群
二维码
科研交流群
商业服务