minihack-ablations-20260821-tmp
收藏资源简介:
该数据集包含针对 MiniHack-ReMDM-planner 的完整消融实验套件,共 25 个消融实验(每个实验使用 3 个种子),旨在评估不同算法变体对规划器性能的影响。数据集内容包括:实验结果文件(results.json)包含每个消融的得分、标准差、与预训练基线的差异以及完整配置;诊断报告(diagnosis.md)和 17 个表格、113 个图片用于可视化分析;预训练检查点(pretrained_checkpoint/)和离线行为克隆检查点(offline_bc_checkpoint/)及其评估结果(inference/)。所有实验在 UCL RTX 3090 Ti 上运行,预训练基线平均 ID win rate 为 0.4750,离线 BC 检查点平均 ID win rate 为 0.7100。该数据集适用于消融研究、算法比较和可重复性验证,尤其关注 MiniHack 环境中的强化学习规划器调优。注意:该数据集为临时上传,尚未正式发布。
This dataset contains a complete ablation study suite for MiniHack-ReMDM-planner, comprising 25 ablation experiments (each with 3 seeds) to evaluate the impact of different algorithm variants on planner performance. The dataset includes: experiment result files (results.json) containing scores, standard deviations, differences from pretrained baseline, and full configurations for each ablation; a diagnostic report (diagnosis.md) along with 17 tables and 113 images for visualization; pretrained checkpoints (pretrained_checkpoint/) and offline behavioral cloning checkpoints (offline_bc_checkpoint/) along with their evaluation results (inference/). All experiments were run on UCL RTX 3090 Ti, with a pretrained baseline average ID win rate of 0.4750 and offline BC checkpoint average ID win rate of 0.7100. This dataset is suitable for ablation studies, algorithm comparison, and reproducibility verification, with a focus on reinforcement learning planner tuning in the MiniHack environment. Note: This dataset is temporarily uploaded and not yet formally released.
MiniHack消融套件(临时数据集)
基本信息
- 数据集名称:MiniHack ablation suite — complete, 25 of 25 (TEMPORARY)
- 来源:从检查点仓库迁移至独立私有数据集仓库,内容与源文件夹逐字节一致
- 状态:临时文件夹,非正式发布产物
- 关联仓库:
minihack-ReMDM-planner - 配置:
ablations_final_minihack_ucl.yaml(batch_size 4608,max_iter 500) - 预训练检查点:
checkpoint-iter563:v1(W&B运行pm4p9re8) - 种子数:每个消融3个种子
- 预训练基线:平均ID胜率 0.4750
数据来源
- 2026-08-20在UCL RTX 3090 Ti上运行24个消融实验(
run_20260820_002747),因机器维护中断,reward_model于2026-08-21单独运行并合并 - 合并验证通过:128个配置键全部相同,预训练基线精确复现(0.4750)
reward_model在RTX 4070 Ti SUPER上交叉验证:0.3333 ± 0.0412,与3090 Ti上的0.3208 ± 0.0118相差0.0125,在种子波动范围内
消融结果
共25个消融项,按得分排序:
| 消融 | 得分 | 标准差 | 与预训练差异 |
|---|---|---|---|
head_only |
0.4958 | 0.0386 | +0.0208 |
gradient_surgery |
0.4875 | 0.0354 | +0.0125 |
layer_ablation_top1 |
0.4875 | 0.0204 | +0.0125 |
frozen_backbone |
0.4667 | 0.0059 | -0.0083 |
bc_wins |
0.4583 | 0.0358 | -0.0167 |
entropy_bonus |
0.4458 | 0.0328 | -0.0292 |
kl_penalty |
0.4417 | 0.0212 | -0.0333 |
reward_filtering |
0.4417 | 0.0503 | -0.0333 |
baseline_rl |
0.4375 | 0.0612 | -0.0375 |
ffn_only |
0.4375 | 0.0102 | -0.0375 |
ewc |
0.4333 | 0.0118 | -0.0417 |
lora |
0.4333 | 0.0156 | -0.0417 |
t_curriculum |
0.4292 | 0.0257 | -0.0458 |
trust_region_kl |
0.4250 | 0.0102 | -0.0500 |
low_t |
0.4208 | 0.0524 | -0.0542 |
llrd |
0.4208 | 0.0118 | -0.0542 |
mixed_replay |
0.4125 | 0.0468 | -0.0625 |
layer_ablation_top2 |
0.4042 | 0.0156 | -0.0708 |
attention_only |
0.3958 | 0.0236 | -0.0792 |
layer_ablation_top3 |
0.3917 | 0.0257 | -0.0833 |
running_stats |
0.3833 | 0.0312 | -0.0917 |
action_diversity |
0.3750 | 0.0408 | -0.1000 |
advantage_clip |
0.3375 | 0.0510 | -0.1375 |
reward_model |
0.3208 | 0.0118 | -0.1542 |
normalized_adv |
0.1208 | 0.0412 | -0.3542 |
- 仅有三个消融项超过预训练规划器,且每个超出量都小于其自身的种子波动范围
内容构成
results.json— 得分、各种子值、完整配置、按消融的历史记录diagnosis.md— 套件生成的报告tables/(17个)— 主要结果、组摘要、显著性检验、假设判定figures/(113个)- 排除各消融的检查点
预训练检查点
- W&B运行:
myopic-planner/minihack-ReMDM-planner/pm4p9re8(seq64_d256_L4_lr3e-05_bs2048_eta0.15_conf_s0) - 工件:
checkpoint-iter563:v1(6个日志中的最后一个;迭代93/190/285/382/467/563) - 内容:
iter563.pth(84 MB)+config.yaml(完整训练配置) - 配置记录来源DAgger运行(
dagger_20260819_195240_ad84,batch 2048,lr 3e-05)
推理评估
重新评估捆绑检查点(2026-08-21,UCL RTX 3090 Ti,50集/环境,EMA权重,--seed 0):
- 平均ID胜率:0.4850
- 平均OOD胜率:0.0467
跨硬件和cuDNN路径变化,所有win_rate、wins、avg_steps和n_episodes均相同,仅avg_reward在两个环境第三位小数有浮动(浮点累积而非行为差异)。
离线BC检查点
- W&B运行:
myopic-planner/minihack-ReMDM-planner/nggmpc05 - 训练配置:
--mode offline --config configs/final_minihack_ucl.yaml --seed 0 - 数据集:20,000条轨迹,1,912,931步,0失败,4个ID环境 x 5000集
- 预算:
offline_total_grad_steps60,000(固定,覆盖total_timesteps) - 文件:
offline_final.pth(42 MB:model_state_dict+ema_state_dict,优化器已剥离)
与DAgger检查点对比
| 环境 | 分裂 | 离线BC | DAgger iter563 |
差异 |
|---|---|---|---|---|
Room-Random-5x5 |
ID | 0.98 | 0.82 | +0.16 |
Room-Random-15x15 |
ID | 0.92 | 0.38 | +0.54 |
Corridor-R2 |
ID | 0.66 | 0.52 | +0.14 |
MazeWalk-9x9 |
ID | 0.28 | 0.22 | +0.06 |
Room-Dark-15x15 |
OOD | 0.12 | 0.12 | +0.00 |
Corridor-R5 |
OOD | 0.04 | 0.02 | +0.02 |
MazeWalk-45x19 |
OOD | 0.02 | 0.00 | +0.02 |
| 平均ID | 0.7100 | 0.4850 | +0.2250 | |
| 平均OOD | 0.0600 | 0.0467 | +0.0133 |
- 离线BC比DAgger平均ID胜率高+0.225,主要由
Room-Random-15x15(+0.54)驱动
检查点选择
offline_final.pth是最终步骤(60,000),未通过验证选择- 按ID最佳步骤为50,000(0.7350),最终步骤ID为0.7200
- 从步骤10,000起ID基本持平,60,000步预算在最初10,000步后收益有限





