遇见数据集

HKBU-KnowComp/patchworld-trajectories

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为PatchWorld Trajectory Splits,是用于复现PatchWorld论文实验(RQ1/RQ2离线归纳和评估)的轨迹数据。它包含七个AgentGym环境(alfworld、babyai、maze、sciworld、textcraft、webshop、wordle),每个环境都提供了训练、验证和测试的JSONL格式分割文件。每个轨迹数据包括元数据(如环境、项目ID、任务索引、成功状态等)和转换列表(观察、动作、下一个观察、奖励、完成状态)。数据集旨在支持离线强化学习研究,特别是世界模型和智能体轨迹分析。

The dataset is named PatchWorld Trajectory Splits and contains trajectory data for reproducing experiments from the PatchWorld paper (RQ1/RQ2 offline induction and evaluation). It includes seven AgentGym environments (alfworld, babyai, maze, sciworld, textcraft, webshop, wordle), each with train, validation, and test splits in JSONL format. Each trajectory consists of metadata (e.g., env, item_id, task_idx, success) and a list of transitions (observation, action, next_observation, reward, done). The dataset is designed to support offline reinforcement learning research, particularly for world models and agent trajectory analysis.

提供机构:
HKBU-KnowComp
搜集汇总
数据集介绍
HKBU-KnowComp/patchworld-trajectories 数据集图片
构建方式
该数据集为复现论文《PatchWorld: Gradient-Free Optimization of Executable World Models》中的离线归纳与评估实验(RQ1/RQ2)而构建,涵盖七个AgentGym环境,包括alfworld、babyai、maze、sciworld、textcraft、webshop和wordle。每个环境均划分为训练集、验证集和测试集,以JSONL格式存储。数据收集过程中,每条轨迹包含元数据(如环境名称、任务索引、滚动次数、成功标志及总奖励)与一系列状态转换记录,每个转换由观测、动作、下一观测、奖励和终止标志组成。所有文件通过HuggingFace数据集发布,并附带manifest.json文件以记录校验和与轨迹数量,确保数据完整性与可复现性。
使用方法
使用该数据集时,首先可通过PatchWorld仓库提供的脚本一键下载所有数据文件,或借助Hugging Face CLI直接拉取至本地目录。下载完成后,研究人员可利用patchworld-benchmark命令行工具,选择特定环境(如maze)并指定训练集与测试集路径,即可启动离线模型归纳与评估流程。数据集中的JSONL格式易于解析,支持Python等语言便捷读取。详细的使用指南与实验参数配置可参考PatchWorld仓库中的README与EXPERIMENTS.md文件,帮助研究者快速上手并复现论文中的关键实验结果。
背景与挑战
背景概述
PatchWorld-Trajectories数据集诞生于强化学习与世界模型交叉领域的前沿探索,由香港浸会大学知识计算实验室(HKBU-KnowComp)于2026年创建,相关研究成果发表于arXiv预印本(论文ID: 2605.30880)。该数据集旨在支持可执行世界模型的梯度自由优化研究,核心科学问题在于如何通过离线轨迹数据有效归纳并评估智能体的世界模型,从而摆脱传统强化学习中对梯度信息的依赖。数据集覆盖AlfWorld、BabyAI、Maze等七个AgentGym基准环境,提供结构化的训练、验证与测试轨迹文件,为世界模型的可复现性研究与跨环境泛化能力评估提供了标准化的数据基础。其发布在HuggingFace平台上的开源形式,显著降低了该领域研究者的数据获取门槛,推动了基于轨迹的世界模型建模方法的发展。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:智能体在多样化的交互式环境中(如文本游戏、迷宫导航、网页操作)生成的高维轨迹数据富含噪声与稀疏奖励,使得从中归纳出准确、可迁移的世界模型尤为困难,传统监督学习方法在此类部分可观测环境中难以捕捉长程因果依赖。其次,数据集构建过程本身也充满挑战:七类环境各自的观测空间、动作空间与任务目标差异显著,需统一轨迹格式与JSONL模式以确保跨环境可比性,但标准化的数据描述难免丢失原始环境的时序细节与语义特征。此外,轨迹划分中如何平衡不同难度任务的比例、避免数据泄露并保持训练集与测试集的分布一致性,亦对构建质量提出了严格的要求。
常用场景
经典使用场景
在具身智能体与交互式决策研究的浪潮中,PatchWorld轨迹数据集为离线世界模型的归纳与评估提供了标准化的数据基石。该数据集覆盖AlfWorld、BabyAI、Maze、SciWorld、TextCraft、WebShop和Wordle七大AgentGym环境,每个环境均精心划分了训练、验证与测试三元组,确保了跨任务场景下模型学习的公平性与可复现性。经典使用方式是在给定离散轨迹序列——包括观测、动作、奖励与终止信号——的基础上,利用这些轨迹诱导出具备执行能力的可运行世界模型,并在测试集上完成闭环评估,以衡量模型对环境的理解与泛化能力。
解决学术问题
长期以来,离线世界模型的构建面临两大瓶颈:一是缺乏统一且规模适中的轨迹数据以支撑跨环境比较,二是梯度优化方法在可执行模型搜索中计算成本高昂且易陷入局部最优。PatchWorld数据集通过提供七种异质环境的高质量轨迹拆分,有效解决了离线诱导与评估中的标准化问题,使研究者能够专注于探索无需梯度的世界模型优化策略。这一数据集的出现,显著推动了可执行世界模型从概念验证迈向系统化基准测试,为理解智能体如何从静态经验中抽象环境动态规律提供了坚实的实验平台。
实际应用
在实际部署层面,PatchWorld轨迹数据集的应用场景可延伸至多个依赖智能体交互的领域。例如,在自动化游戏测试中,可利用离线轨迹诱导出的世界模型模拟玩家行为,从而高效检测游戏逻辑漏洞;在机器人任务规划中,基于BabyAI与Maze环境的轨迹可训练轻量级世界模型,以辅助机器人在未见环境中进行符号规划与动作推断。此外,WebShop环境中的轨迹还能用于构建电子商务场景下的用户行为模拟器,助力推荐系统与对话代理的离线策略优化,显著降低在线试错成本。
数据集最近研究
最新研究方向
面向智能体与可执行世界模型的梯度自由优化轨迹数据集
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务