遇见数据集

causal-gpt-rl-unity-envs

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

该数据集(仓库)提供了Causal GPT-RL项目所使用的八个Unity ML-Agents环境及其相关策略文件。每个环境均以模型移除(model-removed)的Unity构建形式提供,即引擎二进制文件不含内置策略,策略需在运行时外部提供。配套提供了每个环境的库存内置ONNX策略文件(stock built-in policy),以及四个离散动作环境的logits暴露变体(存放于tier_policies/目录下)。八个环境包括:Crawler(10个智能体,158维观察,连续动作Box(20))、3DBallHard(12个智能体,45维观察,连续动作Box(2))、PushBlock(32个智能体,210维观察,离散动作Discrete(7))、DungeonEscape(36个智能体,371维观察,离散动作Discrete(7))、SoccerTwos(32个智能体,336维观察,多离散动作MultiDiscrete([3,3,3]))、Pyramids(16个智能体,172维观察,离散动作Discrete(5))、Worm(10个智能体,64维观察,连续动作Box(9))和Walker(10个智能体,243维观察,连续动作Box(39))。所有构建均基于ML-Agents release-23定制项目,移除了内置模型,并可在无头模式下运行。该数据集主要用于运行Causal GPT-RL策略、记录轨迹以及进行强化学习评估与实验。

This dataset (repository) provides eight Unity ML-Agents environments used in the Causal GPT-RL project, along with their associated policy files. Each environment is provided as a model-removed Unity build, meaning the engine binary does not contain a built-in policy; the policy must be supplied externally at runtime. It includes a stock built-in ONNX policy for each environment, as well as logits-exposed variants for four discrete action environments (located in the tier_policies/ directory). The eight environments are: Crawler (10 agents, 158-dimensional observation, continuous action Box(20)), 3DBallHard (12 agents, 45-dimensional observation, continuous action Box(2)), PushBlock (32 agents, 210-dimensional observation, discrete action Discrete(7)), DungeonEscape (36 agents, 371-dimensional observation, discrete action Discrete(7)), SoccerTwos (32 agents, 336-dimensional observation, multi-discrete action MultiDiscrete([3,3,3])), Pyramids (16 agents, 172-dimensional observation, discrete action Discrete(5)), Worm (10 agents, 64-dimensional observation, continuous action Box(9)), and Walker (10 agents, 243-dimensional observation, continuous action Box(39)). All builds are based on a customized ML-Agents release-23 project with built-in models removed and can run in headless mode. This dataset is primarily used for running Causal GPT-RL policies, recording trajectories, and conducting reinforcement learning evaluation and experiments.

创建时间:
2026-07-18
原始信息汇总

Causal GPT-RL — Unity ML-Agents 环境数据集

数据集概述

该数据集提供用于在 Unity ML-Agents 中运行 Causal GPT-RL 策略的公开材料。每个环境都是一个移除模型后的 Unity 构建——即不包含内置策略的引擎二进制文件,策略在运行时提供。所有八个环境都配有内置的原始策略,其中四个离散动作环境额外提供暴露 logits 的变体(位于 tier_policies/ 目录下)。

环境详情

环境 构建目录 原始策略文件 智能体数量 观测维度 动作空间
Crawler Crawler/ Crawler.onnx 10 158(126 + 32) Box(20) 连续
3DBallHard 3DBallHard/ 3DBallHard.onnx 12 45(27 + 18) Box(2) 连续
PushBlock PushBlock/ PushBlock.onnx 32 210(105 + 105) Discrete(7)
DungeonEscape DungeonEscape/ DungeonEscape.onnx 36 371 Discrete(7)
SoccerTwos SoccerTwos/ SoccerTwos.onnx 32 336(264 + 72) MultiDiscrete([3,3,3])
Pyramids Pyramids/ Pyramids.onnx 16 172(56 + 56 + 56 + 4) Discrete(5)
Worm Worm/ Worm.onnx 10 64 Box(9) 连续
Walker Walker/ Walker.onnx 10 243 Box(39) 连续

目录结构

数据集包含以下主要组成部分:

  • 8 个环境构建目录:每个目录包含可执行文件(如 .exe)、UnityPlayer.dllUnityCrashHandler64.exe*_Data/MonoBleedingEdge/ 等运行时组件
  • 8 个原始策略 ONNX 文件:与各环境对应,作为收集驱动策略
  • tier_policies/ 目录:包含 4 个离散策略的 logits 暴露变体(PushBlock、Pyramids、DungeonEscape、SoccerTwos),附带 README.md 说明各层级的校准温度带
  • 许可证文件LICENSE(Apache-2.0)和 NOTICE(归属及修改声明)

关键特征

  • 模型移除构建:所有构建均未内置策略,需在运行时提供策略(可以是原始策略或 Causal GPT-RL 策略),所有构建均支持无头启动
  • 构建来源:基于定制的 ML-Agents release-23 项目生成,其中 Crawler、PushBlock、Pyramids、Worm、Walker、DungeonEscape 和 SoccerTwos 源自 ml-agents-release_23
  • 不可从原始 ML-Agents 源码重新构建:项目修改存在于编译后的二进制文件中,构建按原样提供
  • 已排除内容:各构建均排除了 *_BurstDebugInformation_DoNotShip/ 文件夹(Burst 调试符号)
  • Windows SmartScreen 提示:构建未进行代码签名,首次启动时 Windows SmartScreen 可能显示警告

环境特定说明

  • Crawler:行为标识为 Crawler?team=0;配套数据集中观测存储为 Tuple(Box(126), Box(32))
  • 3DBallHard:ONNX 将两个传感器通道作为单独输入obs_0 [27]obs_1 [18]),而非拼接的 [45] 向量;返回 continuous_actions(采样)和 deterministic_continuous_actions(贪心),均为 float32[B, 2]
  • PushBlock:动作 0 表示无操作,1–6 表示移动/转向;配套数据集中观测存储为 Tuple(Box(105), Box(105))
  • DungeonEscape:36 个智能体按 12 个竞技场 × 3 个协作智能体 排列;同一竞技场内的三个智能体共享协作目标,但每次策略调用接收各自的自我观测
  • SoccerTwos:按 8 个 2v2 场地 排列,行为分别为 SoccerTwos?team=0SoccerTwos?team=1,各 16 个智能体;原始图与 release-23 源码策略计算等价,仅移除了引用无图值的悬空输出声明以便当前 ONNX Runtime 版本加载

配套资源

  • 策略模型仓库:https://huggingface.co/ccnets/causal-gpt-rl-unity (ONNX 策略)
  • 轨迹数据与复现方案:https://huggingface.co/datasets/ccnets/causal-gpt-rl-unity-datasets (记录轨迹及复现配方)
  • 复现方法:https://github.com/ccnets-team/causal-gpt-rl/tree/main/examples/unity_collection (轨迹收集与测量配方)
  • 评估教程:https://github.com/ccnets-team/causal-gpt-rl/tree/main/examples/unity (包含 DungeonEscape 评估及 SoccerTwos 因果对比教程)

许可证

Unity 构建、原始策略(全部 8 个 .onnx 文件)以及由此衍生的 tier_policies/ 导出均采用 Apache-2.0 许可证(Unity ML-Agents)。构建为修改后的衍生作品,修改内容在 NOTICE 中描述。Unity 运行时组件(UnityPlayer.dllUnityCrashHandler64.exeMonoBleedingEdge/)作为已构建播放器的一部分重新分发,受 Unity Technologies 软件条款约束。

搜集汇总
数据集介绍
causal-gpt-rl-unity-envs 数据集图片
构建方式
该数据集为Causal GPT-RL策略在Unity ML-Agents环境中的运行提供了基础材料,涵盖八个精心构建的模型移除Unity可执行环境。每个环境均剥离了内置策略,使得外部策略可在运行时注入,从而支持灵活的策略部署与评估。这些环境源自定制化的ML-Agents release-23项目,涵盖连续与离散动作空间,并配备对应的内置stock策略,确保环境与策略的兼容性。对于四个离散动作环境,额外提供了暴露logits的tier_policies变体,以支持更细粒度的策略分析。
使用方法
使用该数据集时,用户需从配套的模型仓库(ccnets/causal-gpt-rl-unity)获取Causal GPT-RL策略,或使用随附的stock策略,在运行时注入到对应的Unity构建中。可参考examples/unity_collection中的配方来记录轨迹,或参照examples/unity中的教程进行策略评估。由于构建未进行代码签名,Windows系统用户需手动验证下载并允许运行。数据集采用Apache-2.0许可,修改内容已在NOTICE文件中声明,确保合规使用。
背景与挑战
背景概述
Causal GPT-RL Unity ML-Agents environments 数据集由 ccnets 团队于近年创建,旨在支撑因果强化学习(Causal Reinforcement Learning)研究,通过提供模型移除的 Unity 环境构建(model-removed builds)及配套策略,使研究者能够在多样化的连续与离散控制任务中评估和部署因果 GPT-RL 策略。该数据集涵盖八个经典 ML-Agents 环境,如 Crawler、Walker、Pyramids 等,每个环境均配备原始内置策略,并针对离散动作环境额外提供暴露 logits 的变体,为因果干预与反事实推理提供了标准化的实验平台。其核心研究问题聚焦于如何将因果结构学习与序列决策相结合,以提升策略的泛化性与可解释性。通过公开环境与复现配方,该数据集显著降低了因果 RL 研究的复现门槛,推动了该领域在 Unity 物理仿真平台上的实证发展,对后续工作具有较高的参考价值。
当前挑战
该数据集在解决领域问题与构建过程中面临多重挑战。领域层面,强化学习策略通常依赖复杂的高维观测(如 158-243 维)与异构动作空间(连续、离散、多离散),导致因果结构难以有效辨识;同时,多智能体场景(如 SoccerTwos、DungeonEscape)引入的合作与竞争机制进一步增加了因果推断的难度。构建层面,模型移除的 Unity 构建需确保原始策略的忠实性,例如 SoccerTwos 的 ONNX 图需要移除冗余输出以兼容现代运行时,且部分环境(如 Crawler、3DBallHard)采用多输入传感器通道,要求策略接口严格匹配。此外,所有构建未进行代码签名,Windows 用户可能触发 SmartScreen 警告,且项目无法从原始 ML-Agents 源码重建,只能以二进制形式分发,这限制了自定义修改的灵活性。这些挑战共同构成了数据集使用与扩展中的核心障碍。
常用场景
经典使用场景
该数据集为强化学习研究者提供了一套基于Unity ML-Agents框架的八种多样化环境构建体,其核心特色在于所有环境均剔除了内嵌策略,允许研究者在运行时注入自定义策略。这一设计使得该数据集成为评估和比较不同强化学习算法在连续控制(如Crawler、3DBallHard)与离散决策(如PushBlock、Pyramids)任务中表现的标准测试平台。研究者可借助配套的原始策略(ONNX文件)作为基线,通过收集轨迹数据,系统性地分析算法在复杂观察空间、多智能体协作(如DungeonEscape、SoccerTwos)等挑战下的鲁棒性与泛化能力,从而推动强化学习算法从仿真环境向实际应用迁移的科学研究。
解决学术问题
该数据集直面强化学习研究中可复现性与公平比较的长期痛点。通过提供模型移除的Unity可执行文件与对应内置策略,它解决了传统基准测试中环境实现细节不透明、策略耦合度高的问题,使研究者能精确控制策略输入,独立评估算法性能。其环境覆盖从单智能体连续控制到多智能体协作的广泛任务谱系,为探索因果推理与强化学习的融合(如Causal GPT-RL)提供了理想实验场。该数据集显著降低了研究门槛,促进了算法在复杂部分可观测环境中的稳健性验证,对推动智能决策系统的理论发展具有范式意义。
实际应用
在实际应用中,该数据集可作为游戏AI、机器人控制及自动化决策系统的原型测试床。例如,游戏开发者可利用其无模型环境快速验证NPC行为策略,或通过模仿学习从内置策略中提取专家轨迹,加速游戏内智能体的开发。机器人领域研究者可将其连续控制环境(如Walker、Worm)作为模拟平台,测试控制策略在噪声观察下的适应能力,为真实硬件部署提供先验评估。此外,多智能体环境(如SoccerTwos)可用于训练协同对抗策略,在自动驾驶车队调度、多机器人协作等场景中具有直接参考价值,缩短了从算法研究到产业落地的转化路径。
数据集最近研究
最新研究方向
该数据集围绕因果强化学习(Causal RL)与生成式预训练(GPT)的交叉领域,聚焦于将因果推断能力注入智能体决策过程。其最新研究方向是利用无模型Unity环境(model-removed builds)作为标准化基准,系统评估因果GPT策略在连续控制(如Crawler、Walker)与离散决策(如Pyramids、DungeonEscape)任务中的泛化性与可解释性。关联热点包括多智能体协作(SoccerTwos、DungeonEscape)中的因果归因分析,以及通过分层策略(tier_policies)探索动作对数概率暴露下的行为调优。该数据集提供可复现的轨迹采集流程与配套策略库,为因果表示学习、离线强化学习及世界模型的可控性研究提供了重要实验平台,推动了从黑箱策略向可解释因果决策机制的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务