遇见数据集

3D-dungeon-crawler-interventions

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

该数据集名为“3D Dungeon Crawler Interventions”,包含 9,000 个确定性、时长 23 秒的 Unity 3D 地牢爬行者干预片段。数据集针对 9 个因果变量(D, Z, V, W, X, M, A, Y, R)分别执行 do(0) 和 do(1) 干预,每个变量下的每个干预 arm 提供 500 个样本,共计 9×2×500=9,000 个片段。每个 do(0)/do(1) 对共享相同的布局种子和每变量对齐的随机流,确保比较的因果性。数据按 400 训练、50 验证、50 测试划分,且同一对干预始终在同一划分中。原始渲染分辨率为 512×288 用于超采样,随后区域下采样并存储为 256×144、30 fps 的 MP4 文件。训练时每三帧采样一次,得到 230 帧和 18×32 的 tokenizer 网格。此外,每个片段对应的 arrays/*.npz 文件包含 dag_ticks、action_tokens、final_state 以及一个 27 维的 intervention 向量。该数据集适用于因果推断、世界模型学习、视频预测和干预效果评估等任务。

The dataset is named "3D Dungeon Crawler Interventions", containing 9,000 deterministic, 23-second Unity 3D dungeon crawler intervention clips. The dataset targets 9 causal variables (D, Z, V, W, X, M, A, Y, R) with do(0) and do(1) interventions respectively, providing 500 samples per intervention arm per variable, totaling 9×2×500=9,000 clips. Each do(0)/do(1) pair shares the same layout seed and per-variable aligned random stream to ensure causal comparability. Data is split into 400 training, 50 validation, and 50 test, with the same intervention pair always in the same split. The original rendering resolution is 512×288 for supersampling, then regionally downsampled and stored as MP4 files at 256×144, 30 fps. During training, every third frame is sampled, yielding 230 frames and an 18×32 tokenizer grid. Additionally, each clip has an arrays/*.npz file containing dag_ticks, action_tokens, final_state, and a 27-dimensional intervention vector. The dataset is suitable for tasks such as causal inference, world model learning, video prediction, and intervention effect evaluation.

创建时间:
2026-08-17
原始信息汇总

数据集概述

3D 地牢爬行者干预数据集是一个用于世界模型和因果推断研究的视频数据集,基于 Unity 引擎生成。

数据集内容

  • 总规模:包含 9,000 个确定性、时长 23 秒的 Unity 干预情节。
  • 干预变量:针对 D、Z、V、W、X、M、A、Y、R 共 9 个变量,每个变量分别执行 do(0) 和 do(1) 两种干预,每种干预各 500 个样本(总计 9 变量 × 2 干预 × 500 = 9,000)。
  • 配对设计:每组 do(0)/do(1) 对共享相同的布局种子和对齐的逐变量随机流,确保干预效果对比的公平性。
  • 数据划分:每对干预样本保持在同一个划分中;每个干预分支提供 400 个训练集、50 个验证集和 50 个测试集情节。

数据格式与技术规格

  • 渲染规格:Unity 渲染分辨率为 512×288 用于超采样;最终输出 clips/*.mp4 文件经面积降采样后存储为 256×144、30 fps。
  • 帧采样:训练时每三帧采样一次,得到 230 帧,对应 18×32 的 tokenizer 网格。
  • 配套数组:匹配的 arrays/*.npz 文件包含:
    • dag_ticks:有向无环图(DAG)时间步信息
    • action_tokens:动作令牌
    • final_state:最终状态
    • intervention:27 维干预向量
搜集汇总
数据集介绍
3D-dungeon-crawler-interventions 数据集图片
构建方式
该数据集基于Unity引擎构建,模拟了一个三维地牢爬行环境,生成了9,000个确定性的23秒干预片段。构建过程中,针对D、Z、V、W、X、M、A、Y和R九个变量,分别执行了do(variable=0)和do(variable=1)两种干预操作,每种干预对应500个示例。为确保因果推断的严谨性,每一对do(0)/do(1)干预共享相同的布局种子和对齐的逐变量随机流,从而排除了无关变异。数据划分严格,每对干预的样本被分配至同一数据分割,其中训练集占400个片段,验证集和测试集各占50个。渲染分辨率设定为512x288,通过超采样后,剪辑视频经由面积下采样存储为256x144分辨率、30帧每秒的MP4格式。训练时每三帧采样一次,最终生成230帧,对应18x32的tokenizer网格。配套的NPZ数组文件包含了干预过程的详细记录,如DAG时间步、动作令牌、最终状态及27维干预向量,为后续因果模型训练提供了完备的数据基础。
使用方法
该数据集主要面向世界模型、因果推断和强化学习研究领域,使用方式灵活多样。研究者可直接加载MP4视频帧作为视觉输入,配合每三帧采样得到的230帧序列,与18x32的tokenizer网格兼容,便于接入视觉Transformer或卷积网络。NPZ文件中的action_tokens和intervention向量可用于条件生成或干预建模,而final_state和dag_ticks则支持状态预测和因果图学习。典型应用包括:训练世界模型预测干预下的未来状态,评估模型对do算子的响应;或利用干预数据学习因果关系,对比不同干预臂下的行为变化。数据集的确定性设计允许研究者进行跨干预的配对分析,如比较do(X=0)和do(X=1)下的状态差异,从而提取因果效应。此外,数据分割明确,便于遵循标准训练-验证-测试流程,实现结果的可复现性。
背景与挑战
背景概述
3D-dungeon-crawler-interventions数据集诞生于因果推断与视频世界模型交叉研究的前沿,由致力于探索结构化环境干预效用的研究团队于近期构建。该数据集旨在提供一种可控的、确定性的三维游戏环境,用以系统评估干预操作(do-operator)对后续状态与观测的影响。通过生成9000个时长23秒的Unity模拟片段,涵盖D、Z、V、W、X、M、A、Y、R等变量,每个变量均配备do(0)和do(1)两种干预臂,且共享布局种子和随机流,以严密的配对设计确保了因果对比的纯净性。这一资源为因果表征学习、干预响应预测以及世界模型的可解释性研究提供了坚实的基准,推动了视频数据中因果关系精细化建模的进程。
当前挑战
该数据集所应对的核心挑战在于,现实世界中的视频数据混杂着大量无关变因,难以分离特定干预的因果效应,而传统数据集缺乏对干预变量的精确控制。3D-dungeon-crawler-interventions通过引入确定性的Unity环境和系统化的do-干预设计,显著缓解了这一难题,使模型能够学习到干预带来的结构性变化。在构建过程中,团队面临了多重技术挑战:首先,确保每对do(0)/do(1)序列除干预外完全一致,需精确对齐每变量的随机流;其次,在512x288超采样后降尺度至256x144并保持30fps,同时保留足够的视觉细节供模型处理;此外,设计紧凑的27维干预向量并兼容tokenizer网格,要求对状态空间和动作语义进行精细编码,这些努力共同确保了数据集的可靠性和可用性。
常用场景
经典使用场景
该数据集作为世界模型与因果推断交叉领域的基准测试平台,其核心应用在于评估和训练具备干预感知能力的视频预测模型。具体而言,研究者利用其结构化的干预变量(do运算)与确定性生成的视频序列,系统测试模型在给定干预条件下对未来帧的预测精度,从而量化模型对因果机制的表征能力。此类研究通常以视频帧序列为输入,以干预向量为条件,驱动模型学习场景中的动态演变规律,最终应用于机器人规划、交互式仿真等需实时决策的智能系统。
解决学术问题
该数据集直面因果推断与序列预测之间的理论鸿沟,解决了传统视频模型仅捕捉相关性而无法区分因果干预效应的问题。通过提供严格成对的do(0)/do(1)对照数据,使得研究者可精确评估模型对特定变量干预的响应,从而验证其是否真正学习到可迁移的因果结构。这一特性推动了对干预不变性、反事实推理及分布外泛化等基础问题的实证研究,为构建具有因果意识的智能体提供了数据支撑,进而促进可解释、稳健的人工智能理论的发展。
实际应用
在实践层面,该数据集可赋能游戏AI与虚拟环境的自主代理训练,例如非玩家角色(NPC)对玩家动作的因果响应建模,或用于模拟训练中策略的干预效果评估。其Unity渲染的高保真视觉与物理规则一致性,使其成为测试强化学习算法在干预条件下适应性的理想沙盒。此外,数据集还可用于开发可解释的视频问答系统,使模型能回答“若改变某变量,后续将发生什么”这类因果问题,从而增强互动娱乐、自动驾驶仿真等领域的决策透明度与安全性。
数据集最近研究
最新研究方向
该数据集针对因果推断与视频世界模型交叉领域的前沿探索,提供了9,000段确定性交互视频,通过统一干预变量对(do(0)/do(1))和共享种子设计,支持对潜在因果结构的精确识别与反事实推理。其精细的帧采样与多模态对齐(视频、动作、状态、干预向量)为开发基于视频的因果世界模型、可控视觉生成及强化学习中的因果策略学习提供了标准化测试平台,推动了从相关感知向因果理解的范式跃迁,对具身智能与决策可解释性具有重大意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务