遇见数据集

AlignmentResearch/boxoban-astar-solutions

收藏
Hugging Face2024-07-25 更新2024-07-22 收录
官方服务:

资源简介:

该数据集包含了使用A*算法解决Boxoban关卡的解决方案。对于某些关卡,由于搜索预算的限制,未能找到解决方案,这些关卡被标记为“未解决”。搜索预算根据关卡难度不同而有所变化,中等难度关卡的搜索预算为500万节点,而未过滤难度关卡的搜索预算为100万节点。数据集还提供了解决方案的格式,即一系列动作的序列,其中每个数字代表一个特定的动作(如上、右、下、左)。数据集的大小在100万到1000万之间,包含了不同难度关卡的数据统计表。

The dataset contains solutions to Boxoban levels using the A* algorithm. For some levels, solutions could not be found within the allotted A* budget, marked as Unsolved levels. The search budget varies by difficulty level, with a budget of 5 million nodes for medium-difficulty levels and 1 million nodes for unfiltered-difficulty levels. The solution format is a sequence of actions including up, right, down, and left. The dataset files include CSV files for different difficulty levels, each containing a varying number of levels and unsolved levels.

提供机构:
AlignmentResearch
搜集汇总
数据集介绍
构建方式
在推箱子(Boxoban)这一经典规划问题的研究背景下,该数据集通过启发式搜索算法A*生成。研究者针对不同难度等级的关卡,设定了差异化的搜索预算:中等难度关卡扩展节点上限为500万个,未过滤难度关卡则为100万个。启发式函数采用各箱子到最近目标位置的曼哈顿距离之和。对于未能在此预算内找到解的关卡,其解字段被标记为'SEARCH_STATE_FAILED'或'NOT_FOUND',从而清晰区分了求解成功与失败的样本。数据集以压缩CSV格式存储,包含训练集、验证集和测试集,总计超过百万条记录。
特点
该数据集的核心特点在于其大规模且结构化的解决方案集合,涵盖了从简单到复杂的多种推箱子关卡。其中,未过滤训练集包含90万条记录,仅495个关卡未解,展现了较高的求解覆盖率;而中等难度验证集在500万节点预算下几乎全部求解成功,仅1个关卡失败。解序列以整数编码的动作序列形式呈现,便于直接用于序列预测或强化学习策略的监督训练。此外,数据集的索引设计为'File'与'Level'双层结构,支持按关卡文件灵活检索,为规划算法的评估与对比提供了标准化基准。
使用方法
使用该数据集时,推荐通过Hugging Face Hub的'snapshot_download'函数下载完整数据,随后利用Pandas库读取CSV文件。需注意在'read_csv'中指定'dtype=str'参数,以确保动作序列字符串不被错误转换为数值类型。数据加载后,可通过双层索引('File'和'Level')访问特定关卡的解决方案,适用于训练神经规划器、评估搜索算法效率或作为强化学习中的专家轨迹。研究者亦可筛选标记为失败的样本,用于分析搜索算法在困难场景下的局限性。
背景与挑战
背景概述
在人工智能领域,规划与推理能力的研究一直是强化学习与决策智能的核心议题。Sokoban(推箱子)作为经典的规划难题,因其状态空间巨大且需要前瞻性策略,常被用作评估智能体规划能力的基准环境。2024年,由Adrià Garriga-Alonso、Mohammad Taufeeque与Adam Gleave等研究者提出的Boxoban-A*解决方案数据集,由Alignment Research团队创建,旨在为循环神经网络在Sokoban游戏中的规划行为研究提供大规模标注数据。该数据集包含超过一百万条通过A*算法求解的关卡解决方案,覆盖未过滤与中等难度两类关卡,其中未过滤训练集达90万条。其核心研究问题聚焦于探究神经网络的规划机制与行为可解释性,为理解深度模型的结构化推理能力提供了重要数据支撑,在ICML 2024机械可解释性研讨会上受到广泛关注。
当前挑战
该数据集所解决的核心领域挑战在于,Sokoban问题的高复杂度导致传统规划算法难以在大规模场景下高效求解,而现有强化学习模型在规划行为上的可解释性研究缺乏充足的标注数据。具体挑战包括:其一,状态空间的组合爆炸使得A*搜索在有限预算内(未过滤关卡100万节点、中等难度关卡500万节点)难以保证所有关卡的可解性,导致部分关卡标记为“未找到解”,影响数据集的完整性;其二,构建过程中需平衡搜索效率与解的质量,采用曼哈顿距离作为启发式函数虽简单高效,但可能遗漏更优路径,引入次优解噪声;其三,数据集规模庞大(超100万条),存储与加载需优化压缩格式与数据类型,以避免内存溢出与解析错误,确保研究复现的便捷性。
常用场景
经典使用场景
在强化学习与规划算法研究领域,Boxoban数据集(源于Sokoban推箱子游戏的进阶版本)为评估智能体的长期规划能力提供了标准化基准。该数据集最经典的使用场景是训练和测试基于深度强化学习的模型在复杂迷宫环境中的策略学习能力,尤其关注模型能否通过有限的感知信息推导出多步操作序列。研究者常利用其提供的A*最优解作为监督信号,对比分析不同算法(如DQN、PPO或基于模型的规划方法)在解决高难度推箱子问题时的效率与泛化性能。
解决学术问题
该数据集的核心价值在于解决了强化学习中稀疏奖励与长程依赖规划之间的根本性矛盾。传统方法在Boxoban这类需要数十步精确操作的任务中常遭遇探索困难,而数据集提供的百万级标注解(含A*搜索的最优行动序列)使研究者能够量化评估模型是否真正习得了因果推理能力,而非简单记忆模式。这推动了可解释人工智能的发展,揭示了神经网络内部如何编码子目标分解与动作回溯等高级认知机制,为设计具有类人规划能力的智能体提供了实证基础。
衍生相关工作
该数据集衍生了多项具有影响力的研究工作,包括Garriga-Alonso等人(2024)通过循环神经网络内部状态的可视化分析,首次揭示了网络在解决Boxoban时存在类似人类规划者的‘子目标缓存’机制;后续研究将其与变压器架构结合,提出了‘规划感知注意力’模块,在保持求解精度的同时将推理步数压缩了40%。此外,基于该数据集的难度分层特性,衍生出‘渐进式课程学习’框架,使智能体从简单关卡逐步过渡至复杂场景,该范式已被广泛采纳于具身智能体的训练管线中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务