遇见数据集

nanohorizon-craftax-v5

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

NanoHorizon Craftax v5 是一个用于 NanoHorizon Craftax 竞赛的合成教师轨迹数据集。该数据集包含来自两个教师模型(OpenRouter 上的 deepseek/deepseek-v4-flash-0731 和 z-ai/glm-5.3-flash)的黄金策略调用,这些调用是在 Rust GameBench 的 craftax_gold 环境下收集的。数据采用 keep-thinking FBC 格式,每个样本包含完整的对话历史(系统提示、用户消息、助手响应、工具结果),并保留了推理内容和工具调用信息。数据集提供了多种配置:fbc(每个策略调用作为一个样本,适用于 FBC SFT)、sft_turns(按回合分解的观察、推理、动作)、episodes(完整回合,用于过滤后获取轨迹文件)以及用于评估的 eval_glm_flash 和 eval_glm_flash_fbc(包含 10 个保留种子上的独立评估,平均环境奖励为 +4.42,解锁了 11 个独特成就)。数据字段包括 teacher_model、reward、n_calls、seed、run_id 以及 22 个二进制成就标志。该数据集是竞赛规则中唯一允许的离线教师语料库,其他合成数据必须在训练脚本的 30 分钟时间限制内生成。官方评估种子(91001-91010)不包含在此数据集中。用户可以通过 HuggingFace Datasets 库加载,并建议使用 v0.3 版本。

NanoHorizon Craftax v5 is a synthetic teacher trajectory dataset for the NanoHorizon Craftax competition. It contains gold policy calls from two teacher models (deepseek/deepseek-v4-flash-0731 and z-ai/glm-5.3-flash on OpenRouter) collected in the craftax_gold environment of Rust GameBench. The data uses the keep-thinking FBC format, with each sample containing a complete dialogue history (system prompt, user message, assistant response, tool result) preserving reasoning content and tool call information. The dataset provides multiple configurations: fbc (each policy call as a sample, suitable for FBC SFT), sft_turns (observations, reasoning, actions decomposed by turns), episodes (complete episodes for filtering to obtain trajectory files), and evaluation configs eval_glm_flash and eval_glm_flash_fbc (independent evaluations on 10 held-out seeds with average environment reward +4.42 and 11 unique achievements unlocked). Data fields include teacher_model, reward, n_calls, seed, run_id, and 22 binary achievement flags. This dataset is the only offline teacher corpus allowed by the competition rules; other synthetic data must be generated within the 30-minute time limit of the training script. Official evaluation seeds (91001-91010) are not included in this dataset. Users can load it via the HuggingFace Datasets library, and it is recommended to use version v0.3.

创建时间:
2026-08-26
原始信息汇总

数据集概述

NanoHorizon Craftax v5 是一个用于强化学习(Reinforcement Learning)任务的数据集,主要包含教师模型的轨迹(teacher rollouts)数据,专为 NanoHorizon Craftax 竞赛设计。

基本信息

  • 许可证:Apache-2.0
  • 任务类型:强化学习
  • 标签:craftax、nanohorizon、agent、traces
  • 名称:NanoHorizon Craftax v5 teacher traces

数据内容与结构

该数据集仅包含 gzip 压缩的轨迹数据,不包含 SFT 或 FBC 格式的 JSONL 文件。数据分为三个主要目录:

  1. traces/:按照教师模型(teacher-slug)和 rollout ID 组织,为竞赛固定版本(30 次策略调用)
  2. train/:额外的训练池(train-pool)金标准数据,可用于训练
  3. eval/:竞赛种子数据,仅供检查,不得用于训练

版本说明

必须使用 revision="v0.3" 版本。此前版本已弃用:

  • v0.1 包含 gpt-oss / ox-alpha 模型数据,无样本对话,不符合 FBC 规范
  • v0.2 使用旧版测试框架,每次交互均为新的 user 观察,丢弃了先前的 <think>

教师模型

  • deepseek/deepseek-v4-flash-0731(通过 OpenRouter 访问)
  • z-ai/glm-5.3-flash(通过 OpenRouter 访问)

关键规则与约束

数据集是竞赛中唯一允许的离线教师语料库,需遵守以下规则:

  1. 其他合成数据必须在 train.py 的 30 分钟训练时限内生成,不得引入外部轨迹、SFT 行或蒸馏数据
  2. 不得未经模型提供商许可生成合成数据,禁止抓取、泄露或转售未经授权的提供商输出
  3. 除本数据集外,最多允许使用 $1 的 API 推理生成额外合成数据,且须在训练脚本运行期间使用

评估与训练限制

  • 官方评估使用种子 9100191010,禁止将其用于训练
  • eval/ 目录下的 GLM 评估数据(10×10 种子)仅供检查
  • train/ 目录下的 GLM 复制数据(种子 9300193010)可作为合法训练数据,但并非竞赛固定版本(30 次调用)

数据加载与使用

可通过 snapshot_download 下载轨迹数据,并使用 pack_as_is.py 脚本打包为 SFT 格式。打包后的对话保持思考链(keep-thinking)结构,包含 system → user → assistant → tool 等消息轮次,且在工具消息中保留 limits_remaining 字段和 reasoning_content 内容。

数据来源

数据从 NanoHorizon 仓库中的 data/craftax-v5/receipts/ 目录分阶段生成,相关脚本包括 scripts/stage_v5_data.pyscripts/pack_v5_hub.pyscripts/grow_v5_corpus.py(扩展数据池)。

搜集汇总
数据集介绍
nanohorizon-craftax-v5 数据集图片
构建方式
本数据集为NanoHorizon Craftax竞赛精心构建的教师轨迹语料库,源于对Craftax环境的深度强化学习探索。其构建过程严谨而系统,采用gzip压缩格式存储轨迹文件,依据教师模型与运行批次分门别类,细分为竞赛固定、扩展训练池及评估专用三个层次。数据源自DeepSeek与GLM系列先进模型的策略调用,经由严格筛选确保交互过程的完整性与思考链的连贯性,并以固定版本号进行管理,以维持数据的一致性与可追溯性。
特点
数据集独具匠心地保留了模型思考的完整性,从系统提示至工具调用环环相扣,推理内容跨越多次交互持续留存,呈现出清晰连贯的认知脉络。其结构设计精巧,实现训练与评估数据的严格隔离,明确标识竞赛固定轨迹与辅助训练数据,有效规避数据泄露风险。尤为关键的是,该数据集确立了竞赛中合成数据使用的唯一合法地位,并恪守模型提供方的使用许可,彰显了学术诚信与数据伦理的严谨态度。
使用方法
使用者可借助Hugging Face平台便捷下载该数据集,并通过配套脚本将轨迹数据高效打包为监督微调所需的对话格式。数据加载过程支持自定义令牌数参数与排序策略,便于灵活适配不同训练范式。尤为重要的是,该数据集内置严格的规则框架,限定训练时段内可用的额外合成数据额度,引导研究者在合规的前提下充分利用既有数据资源,为后续的强化学习与智能体研究提供了坚实而合规的数据基石。
背景与挑战
背景概述
NanoHorizon Craftax v5数据集由Synth Laboratories于近期创建,旨在为强化学习领域提供一个高质量的教师轨迹(teacher traces)语料库,以支持Craftax环境下的智能体训练。该数据集由Josh Purtell等人维护,依托于NanoHorizon项目,核心研究问题在于如何利用受限的合成数据生成规则,构建一个既符合竞赛规范又能有效提升智能体性能的训练集合。其影响力体现在为Craftax竞赛提供了唯一允许的离时钟(off-clock)教师语料,通过固定版本(v0.3)和明确的划分(train/eval)确保了数据的使用规范与可复现性,对强化学习中的模仿学习、课程学习及合成数据利用等领域具有重要参考价值。
当前挑战
该数据集面临的挑战涵盖两个层面。在领域问题层面,Craftax作为复杂环境,要求智能体具备长期规划与组合泛化能力,而合成数据的生成与利用需严格遵循竞赛规则,包括在30分钟训练脚本时限内完成数据打包,且除了本数据集外,仅允许1美元API推理预算用于额外数据生成,这极大地限制了数据扩充的灵活性。在构建过程中,需处理多轮对话的思维链(cot)保持问题,确保在工具调用中保留推理内容(reasoning_content),并区分不同版本的数据形态(如v0.1、v0.2的缺陷),同时维护数据的纯净性,避免在评估种子(91001-91010)上训练,以及确保数据来源的合法性,防止未授权使用模型输出,这些均对数据集的构建与维护提出了严苛要求。
常用场景
经典使用场景
NanoHorizon Craftax v5数据集专为强化学习智能体的训练与评估而设计,尤其适用于Craftax环境下的策略学习。该数据集提供了教师智能体的完整轨迹(rollouts),包含30次策略调用,且保留了推理链(think blocks),为研究者提供了高质量的示范数据。经典使用场景包括:基于这些轨迹进行行为克隆(Behavior Cloning)或离线强化学习,训练智能体在复杂环境中完成长期任务;通过轨迹打包(packing)生成指令微调(SFT)数据,用于提升语言模型或决策模型在交互式任务中的表现。该数据集的固定版本(v0.3)确保了数据的一致性与可复现性,是Craftax竞赛中唯一允许的离线教师语料库。研究者可借此开展智能体在稀疏奖励、长时程决策等挑战下的学习算法研究。
解决学术问题
该数据集解决了强化学习研究中高质量示范数据稀缺的难题,为离线强化学习、模仿学习及语言模型微调提供了可复用的教师轨迹。学术上,它支持研究如何使用保留的推理链(keep-thinking)数据提升智能体的可解释性与决策能力,探索跨模型(如DeepSeek、GLM)的知识迁移,以及如何通过紧凑处理(compact-after-tokens)在有限计算预算内有效学习。数据集的严格划分(训练池、评估池、竞赛标定种子)使得研究者能公平评估算法泛化能力,避免数据泄露。其开源性(Apache-2.0)和详细来源记录促进了可复现研究,推动了复杂环境(Craftax)中智能体学习算法的发展。
衍生相关工作
基于该数据集,可衍生多项经典工作:其一,利用轨迹打包方法(如`pack_as_is.py`)生成多样化的SFT数据,训练具有推理能力的决策模型,例如结合思维链的Qwen模型。其二,研究离线强化学习算法,如利用这些教师轨迹进行策略约束学习或价值函数估计,以提升样本效率。其三,探索多教师知识融合,例如合并DeepSeek与GLM的轨迹以增强模型泛化性。其四,开发数据高效利用技术,如轨迹筛选、奖励排序和混合采样策略,以在有限数据下实现最优性能。此外,该数据集还支持开发生成式数据合成框架(如NanoHorizon),促进在训练时间窗口内动态生成额外合成数据的方法研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务