遇见数据集

plfb

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

本数据集为Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting (URI)研究提供配套生成产物,旨在支持相关代码发布的复现工作。数据集主要包含两部分核心内容:一是针对Google Research Football(足球)环境的离线强化学习轨迹数据、由URI方法生成的想象演练数据以及大语言模型(LLM)的处理结果;二是针对Tic-Tac-Toe(井字棋)游戏的教程与模拟器相关产物。此外,数据集还提供了精选的最终模型检查点、评估日志以及详细的文件清单。数据总规模为29,668个文件,约37.03 GB。具体目录包括足球离线数据集、足球想象数据集、足球LLM生成结果、井字棋数据以及各类评估和模型文件。数据集适用于离线强化学习、基于教程的策略学习等研究任务。请注意,原始RedPajama书籍文本未包含在此公开版本中,且数据集内涉及的第三方模拟器代码和资产需遵循其原有许可。

This dataset is the supporting generated data artifact for the research titled *Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting (URI)*, aiming to support the reproducibility of the associated code release. The dataset mainly consists of two core parts: 1) Offline reinforcement learning trajectory data for the Google Research Football (GRF) environment, imagined rehearsal data generated by the URI method, and processing results from Large Language Models (LLMs); 2) Tutorials and simulator-related artifacts for the Tic-Tac-Toe game. In addition, the dataset also provides curated final model checkpoints, evaluation logs, and a detailed file inventory. The dataset includes a total of 29,668 files and has an overall size of approximately 37.03 GB. The specific directory structure encompasses the football offline dataset, football imagined rehearsal dataset, LLM-generated results for the football environment, Tic-Tac-Toe data, and various evaluation and model files. This dataset is applicable to research tasks including offline reinforcement learning and tutorial-based policy learning. Please note that the original RedPajama book texts are not included in this public release, and any third-party simulator code and assets included in the dataset must adhere to their original licenses.

创建时间:
2026-06-03
原始信息汇总

数据集概述:Policy Learning from Tutorial Books Data (PLFB)

该数据集是 Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting (URI) 论文的配套数据,用于复现公开的 PLfB/URI 代码。数据集中包含 Football 和井字棋 (Tic-Tac-Toe) 两大领域的生成产物与训练评估工件。

数据集信息

  • 许可证:Apache-2.0
  • 任务类别:强化学习 (Reinforcement Learning)
  • 语言:英文
  • 标签:强化学习、离线强化学习、语言模型、Google Research Football、井字棋

数据集内容

数据集共包含 29,668 个文件,总大小约 37.03 GB,按目录分类如下:

目录 文件数 大小 内容说明
football/offline_dataset-v4/ 26,421 36.06 GB Football 离线轨迹、BC/ORL 缓冲区、代码/语言标签
football/imaginary_dataset_0204/ 66 630.00 MB URI 生成的 Football 排练数据
football/generated_llm_results/ 3,062 200.90 MB 生成的 LLM 输出(排除调试视频)
tictactoe/ 49 61.07 MB 井字棋教程/模拟器工件
artifacts/football/final_uri_best/ 18 47.42 MB 最佳 Football URI 检查点、参数和评估 CSV
artifacts/football/paper_uri_seed60/ 51 61.18 KB 论文 URI seed60 评估 CSV 和参数
artifacts/tictactoe/final_model/ 1 28.73 MB 井字棋最终模型检查点

目录结构

football/offline_dataset-v4/ football/offline_dataset-v4/sample_data/ football/imaginary_dataset_0204/ football/generated_llm_results/ tictactoe/ artifacts/football/final_uri_best/ artifacts/football/paper_uri_seed60/ artifacts/tictactoe/final_model/ .gitattributes manifests/inventory.jsonl manifests/inventory_summary.json

加载注意事项

  • .npz 文件可能包含对象数组,需使用 numpy.load(..., allow_pickle=True) 加载。
  • 部分 .pkl 文件为 HDF5 容器,需使用 h5py 打开。
  • 部分 .jsonl 文件为多行 JSON 字典格式,非严格的 JSON Lines。
  • 可使用验证脚本 validate_data_release.py 检查数据集的完整性。

数据路径与环境变量

通过 inspect_plfb_dataset.py 脚本可导出以下环境变量:

  • PLFB_DATASET_PATH
  • PLFB_OFFLINE_DATASET_PATH
  • PLFB_SAMPLED_DATA_PATH
  • PLFB_IMAGINARY_DATASET_PATH
  • PLFB_GENERATED_LLM_RESULTS_PATH
  • PLFB_TTT_DATA_PATH

也可直接设置 PLFB_HF_DATASET_ROOT 指向下载的数据集根目录。

引用

bibtex @inproceedings{NEURIPS2024_21cf8411, author = {Chen, Xiong-Hui and Wang, Ziyan and Du, Yali and Jiang, Shengyi and Fang, Meng and Yu, Yang and Wang, Jun}, booktitle = {Advances in Neural Information Processing Systems}, doi = {10.52202/079017-0600}, editor = {A. Globerson and L. Mackey and D. Belgrave and A. Fan and U. Paquet and J. Tomczak and C. Zhang}, pages = {18940--18987}, publisher = {Curran Associates, Inc.}, title = {Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting}, url = {https://proceedings.neurips.cc/paper_files/paper/2024/file/21cf8411ed825614e00006a1d9aab7e4-Paper-Conference.pdf}, volume = {37}, year = {2024} }

相关链接

  • 论文:https://proceedings.neurips.cc/paper_files/paper/2024/file/21cf8411ed825614e00006a1d9aab7e4-Paper-Conference.pdf
  • 项目页面:https://plfb-football.github.io/
搜集汇总
数据集介绍
plfb 数据集图片
构建方式
该数据集源自Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting (URI)研究工作,旨在通过从教程书籍中理解、演练与反思的策略学习范式,推动离线强化学习领域的发展。构建过程围绕两大应用场景展开:Google Research Football与Tic-Tac-Toe。对于足球场景,数据集包含了超过2.6万条离线轨迹,由CIQL风格的训练框架生成,并辅以BC/ORL缓冲区以及代码与语言标签;同时集成了URI框架生成的演练数据与大语言模型输出结果。Tic-Tac-Toe部分则提供了教程与模拟器相关的人工产物。此外,最终评估日志与模型检查点也被系统化整理,形成完整的可复现实验资产。
特点
该数据集具有明显的多层次与异构特性。数据总量达37 GB,涵盖近3万个文件,格式包括Numpy数组(.npz)、序列化对象(.pkl)、JSON行文件(.jsonl)等多种类型,以适应不同的强化学习与语言模型研究需求。其突出特色在于将离线轨迹数据与语言模型生成结果有机融合,为行为克隆、离线策略学习及语言引导的决策推理提供了丰富素材。数据集遵循Apache-2.0许可,并明确分离了原始书籍文本与生成产物,以兼顾合规性与实用性。精心设计的清单文件(inventory manifests)确保了数据资产的完整追踪与验证。
使用方法
使用PLFB数据集需先通过Hugging Face Hub下载完整快照,推荐利用`inspect_plfb_dataset.py`脚本验证布局并进行样本加载测试。用户可通过环境变量`PLFB_HF_DATASET_ROOT`指向数据集根目录,脚本会自动导出`PLFB_DATASET_PATH`、`PLFB_OFFLINE_DATASET_PATH`等关键路径变量,便于训练与评估流程的集成。由于部分历史文件采用遗留格式,加载离线轨迹时需在`numpy.load`中启用`allow_pickle=True`,HDF5格式的`.pkl`文件则需借助`h5py`库。建议在正式使用前运行官方发布的验证器,以确保数据完整性,并参考代码仓库中的环境配置与依赖说明进行复现。
背景与挑战
背景概述
在离线强化学习领域,智能体通常依赖预先收集的静态数据集进行策略学习,然而现有数据集多由专业专家或模拟器生成,缺乏对文本知识(如教程书籍)的理解与利用。为此,Xiong-Hui Chen、Ziyan Wang等人于2024年在NeurIPS上提出了策略学习从教程书籍理解、演练与内省(URI)方法,并配套发布了PLFB数据集。该数据集由北京大学、华为等机构的研究人员共同创建,旨在通过离线轨迹、URI生成的演练数据以及大型语言模型输出,弥合语言知识与策略学习之间的鸿沟。数据集涵盖Google Research Football和井字棋两大领域,包含近3万份文件、总容量超37 GB,为探索语言引导的离线强化学习提供了标准化的测试平台,对推动多模态策略学习研究具有重要影响力。
当前挑战
PLFB数据集所应对的核心领域挑战在于,如何让强化学习智能体从非结构化的文本教程中自主提取可操作的策略知识,并将其转化为有效的决策行为,而非仅依赖传统的高质量专家演示数据。这一问题的复杂性体现在语言歧义性、知识迁移效率以及虚拟演练的真实性等多个方面。在数据集构建过程中,研究人员面临多重技术挑战:首先,离线轨迹数据需处理多样的二进制格式(如.npz和.pkl),部分文件依赖特定库的向后兼容参数;其次,由于版权限制,原始RedPajama书籍文本未被纳入公开发布,使得知识源的完整性受到制约;此外,跨模态数据的对齐、大规模仿真数据的存储与验证(如36 GB的足球轨迹数据)也对基础设施与校验流程提出了严格要求。
常用场景
经典使用场景
该数据集的核心应用在于离线强化学习与语言模型交叉领域的策略学习研究。研究者可利用其中收录的Google Research Football离线轨迹数据,结合CIQL等离线算法对智能体进行训练,同时借助Tic-Tac-Toe教程与模拟器数据探索基于教程书的策略生成范式。通过调用URI框架生成的想象回放数据与大语言模型推理结果,开发者能够复现从书本理解、行为排演到自我反思的完整学习流程,从而评估智能体在复杂竞技环境中的决策能力。
衍生相关工作
围绕该数据集衍生出一系列具有影响力的研究工作,包括URI框架中结合大语言模型进行策略理解与反省的创新方法,以及CIQL算法在离线数据上的扩展应用。此外,基于PLFB中足球离线轨迹的基准测试催生了多项对比研究,探索不同离线强化学习算法在复杂环境下的表现差异。Tic-Tac-Toe模块的教程数据则被后续工作引用,用于验证语言引导策略在极小状态空间中的可解释性与鲁棒性。
数据集最近研究
最新研究方向
在强化学习与大型语言模型交叉的前沿领域,plfb数据集专注于探索如何使智能体通过理解教程书籍、进行内心排练与自我反思(URI框架)来习得策略,从而突破传统离线强化学习依赖大量专家轨迹数据的局限。该数据集紧密关联近期语言模型驱动的规划与推理研究热点,通过提供足球模拟与井字棋两大场景的离线轨迹、语言标注以及大语言模型生成结果,为弥合文本知识向操作策略迁移的鸿沟提供了关键实验基底。其生成的想象数据集与评估日志,为验证智能体能否从概念性描述中自主衍生出有效行为模式开辟了实证路径,对推进通用智能体在复杂决策环境中的语义理解与自主演进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务