遇见数据集

minihack-ablations-20260821-tmp

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集包含针对 MiniHack-ReMDM-planner 的完整消融实验套件,共 25 个消融实验(每个实验使用 3 个种子),旨在评估不同算法变体对规划器性能的影响。数据集内容包括:实验结果文件(results.json)包含每个消融的得分、标准差、与预训练基线的差异以及完整配置;诊断报告(diagnosis.md)和 17 个表格、113 个图片用于可视化分析;预训练检查点(pretrained_checkpoint/)和离线行为克隆检查点(offline_bc_checkpoint/)及其评估结果(inference/)。所有实验在 UCL RTX 3090 Ti 上运行,预训练基线平均 ID win rate 为 0.4750,离线 BC 检查点平均 ID win rate 为 0.7100。该数据集适用于消融研究、算法比较和可重复性验证,尤其关注 MiniHack 环境中的强化学习规划器调优。注意:该数据集为临时上传,尚未正式发布。

This dataset contains a complete ablation study suite for MiniHack-ReMDM-planner, comprising 25 ablation experiments (each with 3 seeds) to evaluate the impact of different algorithm variants on planner performance. The dataset includes: experiment result files (results.json) containing scores, standard deviations, differences from pretrained baseline, and full configurations for each ablation; a diagnostic report (diagnosis.md) along with 17 tables and 113 images for visualization; pretrained checkpoints (pretrained_checkpoint/) and offline behavioral cloning checkpoints (offline_bc_checkpoint/) along with their evaluation results (inference/). All experiments were run on UCL RTX 3090 Ti, with a pretrained baseline average ID win rate of 0.4750 and offline BC checkpoint average ID win rate of 0.7100. This dataset is suitable for ablation studies, algorithm comparison, and reproducibility verification, with a focus on reinforcement learning planner tuning in the MiniHack environment. Note: This dataset is temporarily uploaded and not yet formally released.

创建时间:
2026-08-22
原始信息汇总

MiniHack消融套件(临时数据集)

基本信息

  • 数据集名称:MiniHack ablation suite — complete, 25 of 25 (TEMPORARY)
  • 来源:从检查点仓库迁移至独立私有数据集仓库,内容与源文件夹逐字节一致
  • 状态:临时文件夹,非正式发布产物
  • 关联仓库minihack-ReMDM-planner
  • 配置ablations_final_minihack_ucl.yaml(batch_size 4608,max_iter 500)
  • 预训练检查点checkpoint-iter563:v1(W&B运行 pm4p9re8
  • 种子数:每个消融3个种子
  • 预训练基线:平均ID胜率 0.4750

数据来源

  • 2026-08-20在UCL RTX 3090 Ti上运行24个消融实验(run_20260820_002747),因机器维护中断,reward_model于2026-08-21单独运行并合并
  • 合并验证通过:128个配置键全部相同,预训练基线精确复现(0.4750)
  • reward_model在RTX 4070 Ti SUPER上交叉验证:0.3333 ± 0.0412,与3090 Ti上的0.3208 ± 0.0118相差0.0125,在种子波动范围内

消融结果

共25个消融项,按得分排序:

消融 得分 标准差 与预训练差异
head_only 0.4958 0.0386 +0.0208
gradient_surgery 0.4875 0.0354 +0.0125
layer_ablation_top1 0.4875 0.0204 +0.0125
frozen_backbone 0.4667 0.0059 -0.0083
bc_wins 0.4583 0.0358 -0.0167
entropy_bonus 0.4458 0.0328 -0.0292
kl_penalty 0.4417 0.0212 -0.0333
reward_filtering 0.4417 0.0503 -0.0333
baseline_rl 0.4375 0.0612 -0.0375
ffn_only 0.4375 0.0102 -0.0375
ewc 0.4333 0.0118 -0.0417
lora 0.4333 0.0156 -0.0417
t_curriculum 0.4292 0.0257 -0.0458
trust_region_kl 0.4250 0.0102 -0.0500
low_t 0.4208 0.0524 -0.0542
llrd 0.4208 0.0118 -0.0542
mixed_replay 0.4125 0.0468 -0.0625
layer_ablation_top2 0.4042 0.0156 -0.0708
attention_only 0.3958 0.0236 -0.0792
layer_ablation_top3 0.3917 0.0257 -0.0833
running_stats 0.3833 0.0312 -0.0917
action_diversity 0.3750 0.0408 -0.1000
advantage_clip 0.3375 0.0510 -0.1375
reward_model 0.3208 0.0118 -0.1542
normalized_adv 0.1208 0.0412 -0.3542
  • 仅有三个消融项超过预训练规划器,且每个超出量都小于其自身的种子波动范围

内容构成

  • results.json — 得分、各种子值、完整配置、按消融的历史记录
  • diagnosis.md — 套件生成的报告
  • tables/(17个)— 主要结果、组摘要、显著性检验、假设判定
  • figures/(113个)
  • 排除各消融的检查点

预训练检查点

  • W&B运行myopic-planner/minihack-ReMDM-planner/pm4p9re8seq64_d256_L4_lr3e-05_bs2048_eta0.15_conf_s0
  • 工件checkpoint-iter563:v1(6个日志中的最后一个;迭代93/190/285/382/467/563)
  • 内容iter563.pth(84 MB)+ config.yaml(完整训练配置)
  • 配置记录来源DAgger运行(dagger_20260819_195240_ad84,batch 2048,lr 3e-05)

推理评估

重新评估捆绑检查点(2026-08-21,UCL RTX 3090 Ti,50集/环境,EMA权重,--seed 0):

  • 平均ID胜率0.4850
  • 平均OOD胜率0.0467

跨硬件和cuDNN路径变化,所有win_ratewinsavg_stepsn_episodes均相同,仅avg_reward在两个环境第三位小数有浮动(浮点累积而非行为差异)。

离线BC检查点

  • W&B运行myopic-planner/minihack-ReMDM-planner/nggmpc05
  • 训练配置--mode offline --config configs/final_minihack_ucl.yaml --seed 0
  • 数据集:20,000条轨迹,1,912,931步,0失败,4个ID环境 x 5000集
  • 预算offline_total_grad_steps 60,000(固定,覆盖total_timesteps
  • 文件offline_final.pth(42 MB:model_state_dict + ema_state_dict,优化器已剥离)

与DAgger检查点对比

环境 分裂 离线BC DAgger iter563 差异
Room-Random-5x5 ID 0.98 0.82 +0.16
Room-Random-15x15 ID 0.92 0.38 +0.54
Corridor-R2 ID 0.66 0.52 +0.14
MazeWalk-9x9 ID 0.28 0.22 +0.06
Room-Dark-15x15 OOD 0.12 0.12 +0.00
Corridor-R5 OOD 0.04 0.02 +0.02
MazeWalk-45x19 OOD 0.02 0.00 +0.02
平均ID 0.7100 0.4850 +0.2250
平均OOD 0.0600 0.0467 +0.0133
  • 离线BC比DAgger平均ID胜率高+0.225,主要由Room-Random-15x15(+0.54)驱动

检查点选择

  • offline_final.pth是最终步骤(60,000),通过验证选择
  • 按ID最佳步骤为50,000(0.7350),最终步骤ID为0.7200
  • 从步骤10,000起ID基本持平,60,000步预算在最初10,000步后收益有限
搜集汇总
数据集介绍
minihack-ablations-20260821-tmp 数据集图片
构建方式
该数据集是MiniHack领域内一项针对强化学习规划器的系统性消融研究产物,涵盖25种消融配置。其构建过程严谨且具有可追溯性,所有消融均在UCL RTX 3090 Ti上运行,并严格遵循统一的训练设置,包括批量大小、最大迭代次数及预训练检查点。特别地,由于硬件维护中断,reward_model消融单独运行后,通过合并守卫验证了128个配置键的完全一致及预训练基线的精确复现,确保了数据集的完整性。预训练检查点、推理结果及离线BC检查点均被包含,使数据集自包含且支持后续研究。
特点
该数据集的核心特点在于其全面的消融覆盖和精确的基准对照。25种消融方法涵盖从头部微调、梯度手术到正则化策略等多种技术,每种均提供三个种子的均值与标准差,确保了统计可靠性。预训练基线的平均ID胜率为0.4750,消融结果从最高0.4958(head_only)到最低0.1208(normalized_adv)的广泛分布,揭示了各组件对规划器性能的差异化影响。此外,数据集记录了跨硬件与cuDNN路径的推理一致性验证,以及离线BC与DAgger检查点的对比,提供了多维度参考价值。
使用方法
该数据集旨在支撑强化学习与规划算法的比较与可复现研究。使用者可直接加载results.json获取各消融的每种子分数、完整配置及历史数据,也可利用诊断报告和17张表格进行深度分析。包含的预训练检查点与离线BC检查点允许研究者从相同起点开展新实验,或验证现有方法的鲁棒性。推理脚本支持在自定义环境中复现评估协议,确保结果可比较。建议研究者关注消融间胜率差异与种子方差,以区分真实效应与随机波动,同时利用提供的数据进行假设检验与显著性分析。
背景与挑战
背景概述
该数据集源于伦敦大学学院(UCL)在2026年8月开展的MiniHack环境下的强化学习规划器消融研究,旨在系统评估myopic-planner(ReMDM-planner)中各项算法组件对智能体性能的贡献。研究围绕一个预训练基线(DAgger迭代563)展开,通过25种消融配置(如head_only、gradient_surgery、lora等)在RTX 3090 Ti上运行,并以平均分布内(ID)胜率作为核心指标。该数据集由mathisweil团队创建,作为craftax消融套件的姊妹项目,其完整性与严谨性(含跨硬件复现验证)为可复现的强化学习研究提供了重要基准,对理解模型组件敏感性及离线与在线学习对比具有显著参考价值。
当前挑战
该数据集面临的挑战主要体现在两方面:其一,领域层面,MiniHack环境具有组合性、部分可观测性与稀疏奖励特性,导致智能体在分布外(OOD)泛化能力极弱(如OOD胜率仅0.0467),且多数消融配置(22/25)未能超越预训练基线,凸显算法组件对性能影响的非单调性。其二,构建层面,实验流程因机器维护中断导致reward_model需单独补跑并合并,需验证配置一致性(128个键完全匹配)与基线复现;跨GPU(RTX 3090 Ti与4070 Ti SUPER)复现中需处理cuDNN路径差异及浮点累积误差;此外,数据规模与训练预算(如60,000步)的效益平衡亦构成挑战。
常用场景
经典使用场景
MiniHack-ablations-20260821-tmp 数据集为强化学习与模仿学习领域的研究者提供了一个精心设计的消融实验基准,专用于评估规划器在部分可观测环境下的微调策略。该套件包含25项消融实验,覆盖了从头部微调、梯度手术、层冻结到奖励建模等广泛的算法变体,每项均以固定的预训练检查点为基础,确保对比的公平性。研究者可借此系统剖析模型组件与训练范式对任务性能的贡献,尤其适用于验证新提出的改进模块是否真正超越基线,从而推动算法设计的科学化与严谨性。
衍生相关工作
该数据集的开创性消融框架催生了多项后续研究,包括对层间交互动态的深入分析、跨任务泛化的鲁棒性评估,以及基于DAgger与离线BC对比的模仿学习效率研究。其提供的完整配置与诊断报告成为新算法(如信任区域KL约束或课程学习)的验证基石,后续工作常引用此套件作为标准消融测试床。此外,数据集对浮点累积误差的细致探讨亦推动了评估协议的重现性标准化,影响了多个后续基准数据集的设计哲学,形成了以精细消融为核心的研究脉络。
数据集最近研究
最新研究方向
在强化学习与模仿学习交叉领域,该数据集聚焦于离线规划器微调策略的消融研究,系统评估了25种干预手段对预训练模型性能的影响。研究前沿指向通过精细的组件级消融(如梯度手术、层冻结、知识蒸馏正则化)来剖析模型鲁棒性与泛化能力,同时对比了离线行为克隆与DAgger算法在分布内与分布外环境下的表现差异。此消融套件为可复现的模型诊断提供了标准化基准,其关于奖励模型、优势裁剪及归一化等模块的量化评估,揭示了当前算法的脆弱性边界,对推动稳健强化学习算法的设计具有方法论指导意义,并为多硬件环境下的实验一致性验证树立了典范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务