遇见数据集

MCUData

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集包含来自两个长时间 Minecraft 任务——击杀末影龙(Ender Dragon)和从零开始挖钻石(mine diamond from scratch)的代理轨迹,这些轨迹在 MCU 基准测试下由多种代理架构运行,并附有完整的记分板。数据集涵盖了多个版本(dm4-era、claim-m-records、relay-era 和 claim-m-direct-baseline),每个版本包含不同架构(如 worldmodel、prolong、direct 等)的运行结果。数据以压缩包形式提供,每个运行档案包含代理工作区文件(如记忆、代码转录、评估视频等),以及统计文件(runs.csv、summary.json)。评分基于里程碑达成率,钻石任务有 10 个里程碑(6000 步),龙任务有 24 个里程碑(12000 步)。该数据集适用于研究长时间跨度任务中的代理行为、记忆机制、架构比较等,尤其适合用于 LLM 和强化学习代理的评估与基准测试。

This dataset contains agent trajectories from two long-duration Minecraft tasks: killing the Ender Dragon and mining diamonds from scratch. These trajectories were generated by various agent architectures under the MCU benchmark, accompanied by complete scoreboards. The dataset covers multiple versions (dm4-era, claim-m-records, relay-era, and claim-m-direct-baseline), each containing results from different architectures (e.g., worldmodel, prolong, direct, etc.). Data is provided in compressed archives, each containing agent workspace files (e.g., memory, code transcripts, evaluation videos) and statistics files (runs.csv, summary.json). Scoring is based on milestone achievement rates, with 10 milestones for the diamond task (6000 steps) and 24 milestones for the dragon task (12000 steps). This dataset is suitable for studying agent behavior, memory mechanisms, and architecture comparisons in long-duration tasks, especially for evaluating and benchmarking LLM and reinforcement learning agents.

创建时间:
2026-08-28
原始信息汇总

MCU 长程轨迹数据集(dragon / diamond)

数据集概览

该数据集收录了在 MCU 基准测试 下两个长程 Minecraft 任务——击杀末影龙(kill_ender_dragon)从零开始挖钻石(mine_diamond_from_scratch)——中由多种智能体架构运行的完整轨迹,以及这些运行所在的完整记分板。数据集共包含 13 次运行记录,压缩后总大小 177 MB,均以压缩包形式存放于 runs/ 目录下。

评分机制

评分为 里程碑计数而非序列100 * 里程碑达成数 / 总里程碑数。钻石任务在 6,000 步预算内设 10 个里程碑,末影龙任务在 12,000 步内设 24 个里程碑。乱序达成里程碑同样计分,数据集中多条轨迹即存在此情况。

关键记录与运行批次

数据集包含多个批次的运行记录,均基于 gpt-5.6-sol 模型:

批次 目录 亮点成绩
claim-m-direct-baseline(2026-09-04) claim-m-direct-baseline/ 钻石任务三条手臂(worldmodel、logbook、direct)均达 9/10(90.0);末影龙任务 worldmodel 41.67 > logbook 37.5 > direct 33.33;每条轨迹含 provenance.json(分支、精确提交、工作树、窗口)与评估视频
relay-era(2026-09-01) relay-era/ 蒸馏中继链实现钻石任务 10/10(100.0)(dm16_wm_high,第三代中继,dm17 复现);末影龙记录 45.83(11/24)(kd14x_wm_high,跨任务种子);含原始日志中继消融实验及逐代蒸馏记忆(lineage/
claim-m-records(2026-08-29) claim-m-records/ 结构化世界模型记忆 vs 日志记忆对比:钻石 80.00(8/10,双记忆手臂)、末影龙 45.83(11/24,世界模型——铁镐、钻石矿石与钻石全部达成);四条完整轨迹均突破此前的“铁墙”限制
dm4-era 批次 stats/runs/ 7 条最高分闭环运行:钻石 3 条并列 60.00,末影龙 4 条并列 25.00;另有 6 条更早期(08-23/08-24)运行

最新进展(2026-09-04 晚):协议重新定义后(无事件帧、日志即日志、直接手臂无滚动窗口),kdc3z_logbook_high 以 11/24(45.83)在末影龙任务上追平历史记录(kd6_wm、kd14x),耗时 52 次模型调用;钻石日志本达 90.0。重定义前批次与现协议不可比。

各批次说明

  • dm4-era 批次(较早):产生了 7 条最高分闭环世界模型运行(钻石 60.00 × 3、末影龙 25.00 × 4),并分析了共同的性能瓶颈——无运行成功开采铁矿,卡在 6/10 或 6/24 里程碑;原因包括位移不足(58–97% 的挖掘操作位移不足半格)、矿石检测器误报(4 次全为误报)、光照不足、容器自动关闭导致的静默光标丢失。
  • relay-era 批次:采用“蒸馏中继”策略——每次运行的结构化记忆作为下一次运行的初始状态,在钻石任务上从 90 → 90 → 100 实现突破;原始日志中继消融得分反而低于对照组。
  • claim-m-direct-baseline 批次:在加固技能框架上对比三条手臂,新增了完全无记忆direct 手臂(只读 codex、单轮会话、仅用最近回复滚动窗口)。同一提交的队列在重定义协议下运行:logbook 手臂在末影龙上追平历史纪录 45.83。

早期运行记录

数据集中包含 2026-08-23/24 的 6 条早期运行(dragon_pldragon_wmdiamond_pldiamond_wmnight_dragonnight_diamond),早于闭环框架,用于前后对比:

运行 手臂 任务 得分
dragon_pl prolong 击杀末影龙 20.83
dragon_wm worldmodel 击杀末影龙 20.83
diamond_pl prolong 挖钻石 0.00
diamond_wm worldmodel 挖钻石 未评分(自带报告 4/10,但评估器目录为空)
night_dragon / night_diamond prolong 两任务 未评分(评估器目录为空)

文件结构与内容

顶层结构

stats/ 记分板与统计(runs.csv、summary.json、README.md) runs/ 智能体工作区,每个运行一个 .tar.gz

各目录详情

  • stats/:所有已评分运行的总表、聚合统计、成本核算与注意事项。
  • runs/:13 个运行压缩包,解压后均含 <name>/episode_001/ 目录。

各手臂数据格式

  • worldmodel 手臂memory/ 文件系统记忆(世界模型、假设、过程、事件、地图等)、codex_turns/ 每轮请求/响应记录、worldmodel_report.json 步骤与里程碑追踪。7 条闭环运行保留精选帧(每运行 56–133 张 PNG),存储于 memory/episodes/*/frames/,由日志中的 [FRAME] 指针索引。
  • prolong 手臂transcripts/ 完整 codex 交换记录、actions.json 动作流、AGENTS.md 系统提示、logs.txt 步骤日志、last_message.txt 最终消息。

默认手臂说明

数据集中不包含默认手臂(default)的轨迹——上游 MCU-AgentBeats 智能体不写入自身工作区,其全部输出(episode_1.mp4result.txtmilestone_tracking.json)均为评估器侧产物。该手臂在两任务上均得 0.00,分数已列入 stats/runs.csv,但评估器产物不在数据包内。

数据卫生与匿名化

  • 发布前对全部轨迹执行路径匿名化:仓库路径替换为 <REPO>(早期 6 次运行 13,784 处、后增 7 次 3,677 处)、用户主目录替换为 <HOME>、操作系统用户名替换为 user、codex 主目录替换为 <CODEX_HOME>
  • 其余内容(无转写内容、时间戳、分数)未作改动,二进制文件逐字节一致。
  • 所有运行均已扫描凭据——无 API 密钥、令牌、载体字符串或电子邮件地址。

代码访问与复现

数据集中的运行对应 Hither1/MCU 仓库的三个分支:dm4-era 批次在 merge-agentbeats-main,claim-m-records 与 relay-era 在 claim-m-substrate,claim-m-direct-baseline 在 claim-m-direct-baseline。部分运行附精确提交 SHA 与复现命令,复现时需将 <REPO> 替换为本地仓库路径、<HOME> 替换为本地主目录。

搜集汇总
数据集介绍
MCUData 数据集图片
构建方式
MCUData数据集源自MCU基准下的两项长时程Minecraft任务——击杀末影龙与从零采集钻石,记录了多种智能体架构的轨迹数据。构建过程严谨,涉及多个分支的代码版本与协议定义,包括世界模型、日志本及直接感知等不同记忆机制的智能体。每条轨迹均附带完整的运行环境、代码快照、评估视频及逐轮交互记录,确保数据可复现性与可比性。
特点
该数据集的核心特色在于其长时程、多架构覆盖与细粒度的过程记录。轨迹跨度达数千步,涵盖世界模型、长期日志、直接感知等记忆策略的对比。数据内嵌智能体的记忆文件系统、逐轮Codex交互记录及人工评估的里程碑达成情况,并包含罕见的高分运行(如钻石任务满分)与失败案例的详细分解,为研究智能体在复杂环境中的决策过程提供了丰富素材。
使用方法
使用者可通过Hugging Face下载工具获取轨迹压缩包与统计文件。每条运行解压后包含统一的episode_001目录,内部按智能体类型组织:世界模型类含记忆子目录与报告,日志本类含完整转录与动作流。复现实验时,依据manifest.json中的代码版本与运行脚本可重建实验环境。评分机制基于里程碑达成计数,便于进行跨智能体或跨记忆策略的量化对比研究。
背景与挑战
背景概述
MCUData数据集诞生于2026年,由Ced-Collab团队精心构建,聚焦于Minecraft环境中长期任务智能体的评估。该数据集记录了多种智能体架构在击杀末影龙与从零挖掘钻石两项高难度任务中的完整轨迹,涵盖了从早期探索性运行到后期蒸馏中继的显著进展。其核心研究问题在于探索结构化世界模型记忆与纯日志记忆机制在长期决策中的效能差异,以及无记忆智能体的表现边界。通过详尽的数据记录与严格的协议定义,MCUData为多智能体系统、记忆机制及长期规划研究提供了宝贵的基准资源,对深入理解智能体在复杂、持久环境中的适应性具有重要意义。
当前挑战
该数据集所解决的领域挑战体现在任务本身与构建过程两个维度。在任务层面,MCUData直面Minecraft中长视野目标的难题,如从零开始获取钻石需跨越众多里程碑,考验智能体的长期规划、资源管理与空间认知能力,而击败末影龙更是对策略与执行鲁棒性的极端检验,其评估结果反映了超越简单反应的深层智能需求。在构建层面,挑战则包括确保跨运行间的协议一致性,严格管理代码版本与实验环境以规避未记录变动的干扰,处理大规模视频帧的存储与分发的成本,以及通过匿名化处理路径与用户名信息以保护隐私的同时维持数据的完整性与可复现性。这些细致把控确保了数据集的科学价值与可信任度。
常用场景
经典使用场景
MCUData数据集聚焦于Minecraft游戏中的长期时序决策任务,涵盖击败末影龙与从零开始挖掘钻石两大挑战性场景。该数据集记录了多种智能体架构在12,000步预算内的完整运行轨迹,包括标准(prolong)与世界模型(worldmodel)等不同记忆机制下的交互记录。其经典使用场景在于构建与评估面向开放世界环境的具身智能体,尤其是测试这些智能体在复杂、多阶段、长视界目标下的规划、记忆与自适应能力。研究者可基于此数据展开对智能体行为模式、错误传播机制以及环境交互策略的深入分析,从而推动长期决策领域方法论的发展。
解决学术问题
该数据集系统性地回应了具身智能研究中长期规划与记忆机制的核心挑战。通过提供统一基准与精细化的进度里程碑评分(而非单纯任务成功),它使得研究者得以量化智能体在子目标达成上的逐步表现,从而剖析其在面对马可夫性质不充分状态时的决策缺陷。数据集尤为珍贵之处在于识别并记录了智能体普遍遭遇的、具有共性的学习瓶颈,例如位移不足导致的搜索效率低下以及感知系统对困难目标的误判。这直接推动了对于记忆结构设计、环境探索策略以及分层架构的深入探讨,并为评估大语言模型驱动的智能体在动态、半可控环境中的推理效率与鲁棒性,树立了新的学术参考基线。
衍生相关工作
围绕MCUData的发布与迭代,学术界催生了一系列具有导向性的后续工作。针对数据中揭示的‘铁墙’困境,研究者专注于发展高级探索策略与专用子技能库,推动了基于记忆即提示或链式中继的思想,使智能体能够继承历史经验。数据集中对世界模型与录本记忆法的对比激发了对混合记忆表示法的探讨,而纯‘直接’(direct)臂的设置则促进了对无记忆下限性能的对照分析。此外,数据记录的演算成本分析成为研究token效率优化的有用资料,引领了在长时域任务中设计高能效智能体架构的研究浪潮,其影响延伸至更广泛的大型语言模型智能体在交互式环境中的行为研究与应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务