遇见数据集

minecraft-vla-videos

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

HEXTANT Minecraft Rollout Videos (VPT ranged combat) 是一个用于强化学习和具身人工智能研究的公开数据集,专门针对Minecraft游戏环境。该数据集包含使用VPT(MineStudio_VPT.rl_for_shoot_animals_2x)策略进行远程弓箭战斗的rollout游戏过程录制视频。数据集仅包含视频文件,训练用的parquet格式文本动作数据和标签存储于单独的私有仓库。视频内容展现了高度的环境多样性,在kite_ranged场景下包含7种生物群落(热带草原、沼泽、平原、沙漠、针叶林、森林、随机)、13种生物类型(牛、骷髅、羊、鸡、尸壳、猪、苦力怕、僵尸猪灵、溺尸、僵尸、流浪者、蜘蛛、洞穴蜘蛛)、3种天气条件(晴朗、下雨、雷暴)以及3个时间阶段(白天、夜晚、午夜)。数据集规模约为3200个视频文件,对应约330个任务变体,视频格式为MP4,采用第一人称视角,分辨率为128x128,帧率为20fps。根据可测量的击杀数据,该数据集中智能体的远程击杀成功率约为45%。视频附带简化的质量标签,采用三级分类:远程击杀(2分)、远程命中(1分)、无效射击或未射击(0分)。该数据集适用于视觉语言动作模型训练、强化学习策略评估、Minecraft智能体行为分析等研究任务。

HEXTANT Minecraft Rollout Videos (VPT ranged combat) is a public dataset for reinforcement learning and embodied AI research, specifically designed for the Minecraft game environment. It contains rollout video recordings of long-range bow combat using the VPT (MineStudio_VPT.rl_for_shoot_animals_2x) strategy. The dataset includes only video files, with training parquet-format text action data and labels stored in a separate private repository. The video content exhibits high environmental diversity, featuring 7 biomes (savanna, swamp, plains, desert, taiga, forest, random), 13 creature types (cow, skeleton, sheep, chicken, husk, pig, creeper, zombified_piglin, drowned, zombie, stray, spider, cave_spider), 3 weather conditions (clear, rain, thunderstorm), and 3 time phases (day, night, midnight) in the kite_ranged scenario. The dataset comprises approximately 3200 video files, corresponding to about 330 task variants, in MP4 format with a first-person perspective, 128x128 resolution, and 20fps frame rate. Based on measurable kill data, the agents long-range kill success rate in this dataset is approximately 45%. Videos come with simplified quality labels in a three-level classification: long-range kill (2 points), long-range hit (1 point), and ineffective shot or no shot (0 points). This dataset is suitable for research tasks such as vision-language-action model training, reinforcement learning policy evaluation, and Minecraft agent behavior analysis.

创建时间:
2026-07-18
原始信息汇总

数据集概述

数据集名称:HEXTANT Minecraft VLA Rollout Videos (VPT ranged combat)

许可证:MIT

任务类别:强化学习

标签:Minecraft、具身AI、VLA、VPT

数据集规模:约3200个视频文件,覆盖约330个任务变体。


数据内容

  • 本数据集仅包含视频文件,不包含用于训练的parquet格式文本动作标签或标签文件。
  • 视频来源于使用VPT策略(MineStudio_VPT.rl_for_shoot_animals_2x)在Minecraft中进行远程(弓箭)战斗的游戏录像。
  • 视频格式:POV视角,分辨率128×128,帧率20fps。
  • 文件组织方式:<task>/<stamp>/*.mp4

环境多样性(kite_ranged场景)

  • 生物群系(7种):savanna、swamp、plains、desert、taiga、forest、lottery
  • 生物种类(13种):cow、skeleton、sheep、chicken、husk、pig、creeper、zombified_piglin、drowned、zombie、stray、spider、cave_spider
  • 天气(3种):clear、rain、thunder
  • 时段(3种):day、night、midnight

质量标签(简要)

  • 远程击杀率(基于可测量击杀)约为45%。
  • 质量等级划分:
    • ranged_kill (2):远程击杀
    • ranged_hit (1):远程命中
    • fired_ineffective / no_fire (0):无效射击或未射击
  • 详细的分类本体和附加信息请参考相关研究仓库。

其他说明

该数据集是OpenHA/HEXTANT研究项目的一部分,公开内容仅包含视频。

搜集汇总
数据集介绍
minecraft-vla-videos 数据集图片
构建方式
该数据集名为minecraft-vla-videos,源自HEXTANT研究项目,专注于《我的世界》中VLA(视觉-语言-动作)模型的训练。数据集通过VPT(视频预训练)策略生成的rollout视频构建,具体利用MineStudio_VPT.rl_for_shoot_animals_2x模型模拟远程战斗(弓箭)场景,记录游戏代理的POV视角视频。视频以128x128分辨率、20fps帧率存储为MP4格式,文件按任务和时间戳组织,便于索引。构建过程注重环境多样性,涵盖7种生物群落、13种敌对生物、3种天气和3种时间段,形成约3200个视频片段和330个任务变体,为具身AI研究提供丰富的交互数据。
特点
本数据集的核心特点在于其高度结构化的环境多样性和细粒度的性能标注。视频数据覆盖多种生物群落(如草原、沙漠、森林)和敌对生物(如骷髅、蜘蛛、爬行者),结合天气与时间变化,模拟真实游戏中的复杂交互场景。此外,数据集包含质量标签,基于远程击杀率(约45%)将行为分为三个层级:ranged_kill(2分)、ranged_hit(1分)以及ineffective/no_fire(0分),为模型评估提供量化基准。这种多维度标注设计,使数据集不仅适用于模仿学习,还能用于强化学习中的奖励建模与行为分析。
使用方法
数据集的使用主要面向具身AI和强化学习领域,尤其适用于视觉-语言-动作模型的训练与验证。用户可直接加载MP4视频序列,结合公开的parquet格式动作标签(存储于独立私有仓库)构建监督学习任务。对于研究用途,建议将视频按任务-时间戳结构分组,利用POV视角的时序数据训练策略网络或世界模型。此外,质量标签可作为奖励信号,辅助逆强化学习或偏好学习。研究人员可通过引用研究仓库获取详细的元数据本体和侧边栏文件,以扩展数据集的语义理解。
背景与挑战
背景概述
在具身智能与强化学习领域,Minecraft因其开放世界的高自由度与复杂交互性,成为评估智能体长期决策与多任务能力的理想仿真环境。HEXTANT Minecraft VLA Rollout Videos数据集由OpenHA/HEXTANT研究团队于2023年创建,专注于基于视觉-语言-动作(VLA)范式的智能体训练,核心研究问题在于利用视频预测与模仿学习提升智能体在远程战斗任务中的表现。该数据集包含约3200段游戏视频,覆盖7种生物群系、13种生物与3种天气条件,显著推动了Minecraft中具身智能体的通用技能学习,并为后续VLA领域的研究提供了标准化基准,在学术与工业界产生了广泛影响。
当前挑战
该数据集所解决的领域挑战在于,Minecraft环境中的远程战斗任务要求智能体同时处理视觉感知、动作规划与长程奖励稀疏性,传统强化学习方法难以有效学习。具体挑战包括:1) 复杂环境下的泛化性——生物群系、生物种类与天气的多样性要求模型具备跨条件迁移能力;2) 数据构建中的标注一致性——自动标注的远程击杀与命中标签需在多变场景中保持精确,而手动校验成本极高;3) 视频帧率与分辨率限制——128x128像素与20fps的固定采样可能丢失细粒度动态信息,影响模型对快速动作的捕捉;4) 任务奖励的稀疏性——智能体需在长时间探索后仅通过击杀反馈更新策略,增加了训练难度。
常用场景
经典使用场景
在具身智能与强化学习交叉领域,minecraft-vla-videos数据集为训练视觉-语言-动作(VLA)模型提供了高质量的专家演示视频。该数据集收录了约3200段第一人称视角(128x128分辨率,20fps)的Minecraft游戏录像,涵盖7种生物群系、13种敌对生物及多种天气与时间条件,专为远程弓箭战斗场景设计。研究者可利用这些视频结合行为克隆或逆强化学习方法,学习从像素输入到离散动作的映射策略,是构建通用游戏智能体的重要数据基础。
解决学术问题
该数据集系统性地解决了具身智能研究中缺少多样化、带语义标签的细粒度动作演示数据的问题。通过覆盖330种任务变体并标注远程命中/击杀质量等级(ranged_kill/hit/ineffective),它能够支撑对稀疏奖励环境下的探索策略、多模态指令跟随及跨场景泛化能力等核心学术问题的研究。其公开的演示数据推动了视觉预训练(VPT)技术在复杂开放世界中的应用评估,为理解智能体在仿真环境中如何学习长序列目标导向行为提供了关键基准。
衍生相关工作
该数据集衍生的代表性工作包括基于VPT(Video PreTraining)的行为克隆方案,如MineStudio_VPT.rl_for_shoot_animals_2x模型,通过在大规模 rollout 视频上预训练视觉编码器,结合少量强化学习微调实现远程精确打击。后续研究者还利用其质量标签(tier系统)发展了分层奖励塑造方法,并扩展到多智能体协作狩猎任务。此外,数据集中包含的330种任务变体催生了关于任务指令语义泛化的评估框架,推动了如MineCLIP等跨模态对齐模型在Minecraft环境中的适配与改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务