遇见数据集

patchworld-trajectories

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

PatchWorld Trajectory Splits 是一个用于强化学习研究的轨迹数据集,旨在支持论文《PatchWorld: Gradient-Free Optimization of Executable World Models》中RQ1和RQ2的离线世界模型归纳与评估任务的复现。该数据集包含来自七个不同AgentGym环境(alfworld、babyai、maze、sciworld、textcraft、webshop、wordle)的交互轨迹。每个环境均提供了标准的训练集、验证集和测试集划分,以JSONL格式存储。每个轨迹样本包含详细的元数据(如环境标识、任务索引、回合索引、数据划分、成功标志、总奖励)以及一系列状态转换记录(包括观察、动作、下一个观察、奖励和完成标志)。数据集规模在1万到10万条轨迹之间,适用于代理行为分析、世界模型学习、离线强化学习等研究场景。

PatchWorld Trajectory Splits is a trajectory dataset for reinforcement learning research, designed to support the reproduction of offline world model induction and evaluation tasks in RQ1 and RQ2 of the paper PatchWorld: Gradient-Free Optimization of Executable World Models. The dataset contains interaction trajectories from seven different AgentGym environments (alfworld, babyai, maze, sciworld, textcraft, webshop, wordle). Each environment provides standard train, validation, and test splits, stored in JSONL format. Each trajectory sample includes detailed metadata (such as environment identifier, task index, episode index, data split, success flag, total reward) and a series of state transition records (including observation, action, next observation, reward, and done flag). The dataset size ranges from 10,000 to 100,000 trajectories, suitable for research scenarios like agent behavior analysis, world model learning, and offline reinforcement learning.

创建时间:
2026-05-28
原始信息汇总

数据集概述

数据集名称:PatchWorld Trajectory Splits
发布机构:HKBU-KnowComp
用途:用于复现论文《PatchWorld: Gradient-Free Optimization of Executable World Models》(RQ1/RQ2中的离线归纳与评估)的轨迹数据。


数据集规模与配置

  • 语言:英文
  • 许可协议:MIT
  • 样本数量:10,000 < N < 100,000
  • 任务类型:强化学习
  • 标签:agent、world-model、trajectories、agentgym、patchworld

环境与文件结构

数据集包含 7个AgentGym环境,每个环境提供训练/验证/测试三个JSONL文件:

环境目录 说明
alfworld/ AlfWorld环境
babyai/ BabyAI环境
maze/ 迷宫环境
sciworld/ SciWorld环境
textcraft/ TextCraft环境
webshop/ WebShop环境
wordle/ Wordle环境

每个目录下包含:

  • <env>_traj_train.jsonl
  • <env>_traj_val.jsonl
  • <env>_traj_test.jsonl

此外,manifest.json 文件列出了各文件的校验和与轨迹数量。


数据格式

每行一条轨迹,采用JSONL格式,每条轨迹包含:

  • metadata:包括 env(环境名称)、item_idtask_idxrollout_indexsplit(数据集划分)、success(是否成功)、total_reward(总奖励)
  • transitions:一个列表,每个元素包含 observation(观测)、action(动作)、next_observation(下一观测)、reward(奖励)、done(是否结束)

下载方式

方式一:从PatchWorld仓库根目录运行: bash bash scripts/download_data.sh

方式二:使用Hugging Face CLI直接下载: bash hf download HKBU-KnowComp/patchworld-trajectories --repo-type dataset --local-dir artifacts/patchworld/data_release --exclude "*.tar.gz"


使用示例

下载后,在仓库根目录可运行如下命令(以maze环境为例)进行模型归纳与评估:

bash patchworld-benchmark --env maze --train_glob "artifacts/patchworld/data_release/maze/maze_traj_train.jsonl" --eval_glob "artifacts/patchworld/data_release/maze/maze_traj_test.jsonl" --output_dir artifacts/patchworld/results

详细指令请参考 PatchWorld READMEEXPERIMENTS.md


引用信息

bibtex @misc{bai2026patchworldgradientfreeoptimizationexecutable, title={PatchWorld: Gradient-Free Optimization of Executable World Models}, author={Jiaxin Bai and Yue Guo and Yifei Dong and Jiaxuan Xiong and Tianshi Zheng and Yixia Li and Tianqing Fang and Yufei Li and Yisen Gao and Haoyu Huang and Zhongwei Xie and Hong Ting Tsang and Zihao Wang and Lihui Liu and Jeff Pan and Yangqiu Song}, year={2026}, eprint={2605.30880}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.30880}, }

搜集汇总
数据集介绍
patchworld-trajectories 数据集图片
构建方式
PatchWorld-Trajectories数据集专为可执行世界模型的梯度自由优化研究而构建,其构建基于七个AgentGym环境,涵盖Alfworld、BabyAI、Maze、Sciworld、Textcraft、Webshop和Wordle等多样化的代理任务场景。每个环境均按照训练、验证和测试的分割方式,生成对应的JSONL格式轨迹文件。数据收集过程通过执行多轮环境交互以采集完整的序列化状态-动作转换信息,每条轨迹包含元数据字段(如环境、任务索引、轮次指数、成功标记与总奖励)以及转换列表,其中细致记录了观察、行动、下一观察、奖励和终止标志等关键信息,为后续的世界模型归纳与评估提供了标准化的输入基础。
特点
该数据集的核心特色在于其结构化与高效复用性。一方面,数据以轻量化的JSONL格式存储,便于大规模加载与处理,同时通过manifest清单文件提供校验和与轨迹计数的验证机制,确保数据完整性。另一方面,数据集覆盖的七个环境均具备独立的训练/验证/测试划分,直接支持RQ1和RQ2的离线归纳与评估实验,有助于研究者快速复现论文中的基准结果。此外,轨迹数据保留了完整的状态转换序列,为世界模型的可执行优化、环境推理与策略迁移等前沿研究提供了高质量的数据支撑。
使用方法
数据集的使用方式便捷灵活。用户可通过PatchWorld代码仓库中的download脚本一键下载数据,或借助Hugging Face CLI工具直接定向至本地目录,并支持排除大型压缩包以优化存储。下载完成后,研究者可在任意环境中独立执行世界模型的归纳与评估任务,例如对Maze环境,通过指定训练集与测试集的JSONL文件路径,配合patchworld-benchmark命令即可完成模型训练与性能测试。详细的实验配置与运行指南可在PatchWorld项目的README及实验文档中找到,从而确保研究的可复现性与扩展性。
背景与挑战
背景概述
在强化学习与智能体研究领域,世界模型作为智能体与环境交互的内部表征,其可解释性与优化效率始终是核心瓶颈。PatchWorld数据集(patchworld-trajectories)由香港浸会大学知识计算实验室(HKBU-KnowComp)于2026年创建,旨在支持可执行世界模型的零梯度优化研究。该数据集涵盖了AlfWorld、BabyAI、Maze、SciWorld、TextCraft、WebShop和Wordle七个代表性智能体环境,提供了结构化的训练/验证/测试轨迹数据,每条轨迹均包含完整的状态转移与奖励信号。作为论文《PatchWorld: Gradient-Free Optimization of Executable World Models》的配套资源,该数据集为离线世界模型归纳与评估提供了标准化基准,对推动可解释、高效率的世界模型构建具有重要影响力。
当前挑战
PatchWorld数据集面临的核心挑战在于其所解决的领域问题:传统世界模型依赖梯度优化方法,在计算资源受限或黑盒环境中难以有效应用,而零梯度优化虽具潜力,却面临搜索空间爆炸与模型可执行性保障的双重困境。在数据构建过程中,七个环境各有独特的交互逻辑与奖励机制,例如AlfWorld的复杂任务规划与WebShop的网页导航,需确保轨迹数据的覆盖度与一致性;同时,跨环境的轨迹格式统一化要求精密的Schema设计,包括状态观测、动作空间与终止条件的标准化。此外,数据集规模介于10K至100K条轨迹,如何在有限样本下支持稳健的模型归纳与泛化评估,成为实际应用中的技术难点。
常用场景
经典使用场景
在具身智能与交互式推理领域,大规模、高质量的轨迹数据是驱动智能体学习与规划的核心燃料。PatchWorld-Trajectories数据集应运而生,其经典使用场景在于为基于世界模型的智能体提供可执行的离线轨迹语料库。具体而言,该数据集收录了来自AlfWorld、BabyAI、Maze、SciWorld、TextCraft、WebShop和Wordle等七个异构图灵完备环境中的智能体交互轨迹,涵盖从导航、操作到对话决策的多类型任务。每一条轨迹均以JSONL格式规范存储,完整记录了观测、动作、奖励与终止状态等关键交互元组,为研究者提供了可复现、可分拆的标准化训练与评估基准。
实际应用
该数据集的实际应用聚焦于可执行世界模型的离线构建与评估,为自动化任务规划与智能体部署提供了真实可依赖的数据基础。在典型部署场景中,研究人员可借助该数据集中的轨迹对强化学习智能体的世界模型进行离线诱导,进而利用所构建的模型在未见环境中进行因果推理与动作预测。例如,通过加载Maze环境的训练与测试轨迹,用户可运行PatchWorld基准框架直接生成策略评估结果,从而在产品原型验证、机器人仿真测试或游戏AI开发中快速迭代智能体行为策略。此流程无需在线交互或梯度更新,大幅降低了智能体训练的成本与风险,具备显著的工程实践价值。
衍生相关工作
围绕PatchWorld-Trajectories数据集,已衍生出一系列具有影响力的研究工作,其中最具代表性的是《PatchWorld: Gradient-Free Optimization of Executable World Models》。该工作首次提出基于无梯度优化的可执行世界模型框架,并依托该数据集完成了核心实验验证。此外,该数据集也为AgentGym生态内的多种智能体学习方法提供了基础数据支撑,推动了离线轨迹归纳、因果世界模型构建以及多任务轨迹重用等方向的研究进展。未来,该数据集的拓展版本有望融入更多交互型环境与长时域轨迹,持续赋能可解释智能体、自动课程生成以及跨域知识迁移等前沿课题的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务