遇见数据集

ALFWorld 训练与评测数据

收藏
github2026-06-13 更新2026-06-18 收录
官方服务:

资源简介:

本仓库整理了ALFWorld任务上的训练日志与API评测结果,主要包含A800训练运行记录和DeepSeek API在ALFWorld各任务上的评测轨迹与汇总结果。训练日志来自Qwen3-4B-Thinking-2507在A800上的Skill0训练实验,包括任务1和任务2~6的训练指标。DeepSeek评测数据包含基础prompt和full skills设置下的评测,每类任务有不同数量的episode。数据集提供了详细的文件格式说明,如JSONL、JSON和summary文件,用于分析训练和评测结果。

This repository collates training logs and API evaluation results for the ALFWorld task suite. It primarily includes training run records on A800 GPUs, as well as the evaluation trajectories and aggregated results of the DeepSeek API across all ALFWorld tasks. The training logs are sourced from the Skill0 training experiment of Qwen3-4B-Thinking-2507 executed on A800 GPUs, covering training metrics for Task 1 and Tasks 2 to 6. The DeepSeek evaluation data encompasses evaluations under both the basic prompt and full skills settings, with varying numbers of episodes for each task category. The dataset provides detailed file format specifications, including JSONL, JSON, and summary files, to facilitate analysis of training and evaluation results.

创建时间:
2026-05-27
原始信息汇总

该数据集包含 ALFWorld 任务上的训练日志与 DeepSeek API 评测结果,主要分为两大部分:

训练日志

训练日志来自 Qwen3-4B-Thinking-2507 在 A800 上的 Skill0 训练实验,包含以下内容:

目录 文件 记录数 说明
任务1 A800/ metrics.jsonl 211 任务 1 训练指标
任务2~6 A800/ 任务2~6 A800 metrics.jsonl 31 任务 2~6 训练指标
  • run_config.env 保存实验配置,包括模型路径、训练数据规模、rollout 配置、学习率、训练步数、显存参数和 SkillZero 配置等。
  • metrics.jsonl 每行为一条训练 step 记录,主要字段包括:step(训练步数)、metrics(指标字典)、episode/success_rate(成功率)、episode/reward/mean(平均奖励)、episode/length/mean(平均 episode 长度)、actor/*(actor 训练损失、KL、学习率、梯度等)、perf/*timing_s/*(吞吐、显存、耗时等性能指标)。

DeepSeek 评测数据

deepseek/ 目录下包含两组评测:

目录 说明 每类任务 episode 数
alfworld_api_eval/ 基础 prompt / 技能设置下的评测 100
alfworld_api_eval_full_skills/ full skills 设置下的评测 20

每个任务目录包含:

  • *.jsonl:逐 episode 轨迹,每行是一条 episode。
  • *.json:同批评测的完整 JSON 结果。
  • *.summary.json:单任务汇总指标。
  • alfworld_api_eval.state.json:评测状态文件。
  • alfworld_api_eval.overall_summary.json:该组评测的全任务汇总。

单条 episode 记录的核心字段:episodeenv_index(episode 编号和环境编号)、task_type_idtask_type(任务类型)、steps(逐步交互轨迹)、successnum_steps(是否成功和总步数)、prompt_tokens_totalcompletion_tokens_totaltotal_tokens(token 统计)、avg_step_latency_s(平均单步 API 延迟)。steps 中每一步包含观测、prompt、模型输出、解析后的环境动作、动作合法性、奖励、完成状态、下一步观测以及 token/延迟统计。

任务与结果概览

任务 task_filter 基础评测成功率 Full skills 成功率
pick_and_place pick_and_place 66% 80%
look_at_obj_in_light look_at_obj_in_light 46% 80%
clean_and_place pick_clean_then_place_in_recep 39% 45%
heat_and_place pick_heat_then_place_in_recep 46% 60%
cool_and_place pick_cool_then_place_in_recep 50% 40%
pick_two_and_place pick_two_obj_and_place 52% 35%

基础评测和 full skills 评测均使用模型 deepseek-v4-pro,基础评测每类任务 100 个 episode,full skills 评测每类任务 20 个 episode。

文件格式说明

  • .jsonl:逐行 JSON,适合流式读取或按 episode/step 过滤。
  • .json:完整评测结果,适合一次性加载分析。
  • .summary.json:单任务汇总指标。
  • .overall_summary.json:全任务汇总指标。
  • .env:训练运行配置,按 KEY=VALUE 保存。
搜集汇总
数据集介绍
ALFWorld 训练与评测数据 数据集图片
构建方式
ALFWorld训练与评测数据集的构建,源于对Qwen3-4B-Thinking-2507模型在A800平台上进行Skill0训练实验的系统性记录。训练日志部分,通过精心设计的运行配置(run_config.env)记录模型路径、训练数据规模、学习率等关键参数,并以metrics.jsonl格式逐步骤存储训练指标。评测数据部分,则利用DeepSeek API对模型在ALFWorld各任务上的表现进行多维度评估,包括基础prompt/技能设置与全技能(full skills)两种配置,每类任务生成相应数量的episode轨迹,并汇总于结构清晰的目录体系中。
特点
该数据集具有层次分明、内容详尽的特点。训练日志涵盖了从单步性能(吞吐、显存、耗时)到任务级指标(成功率、平均奖励、episode长度)的全方位数据,为模型行为分析提供了坚实基础。评测部分则细分为多个任务类型(如pick_and_place、look_at_obj_in_light等),分别记录成功率和性能统计,并通过summary.json与overall_summary.json实现单任务与全局汇总。此外,逐episode轨迹中包含了观测、动作、奖励及token消耗等细粒度信息,便于深入理解模型决策过程。
使用方法
使用该数据集时,研究者可依据目录结构直接定位所需训练或评测文件。metrics.jsonl文件适合逐行流式读取,用于分析训练过程中成功率的变迁或模型收敛趋势。deepseek目录下的jsonl与json文件则可加载至数据分析环境,对特定任务的episode轨迹进行复现验证,或通过summary.json快速获取任务级性能概览。对于需要定制化分析的用户,整体文件格式对编程处理友好,支持按过滤条件提取特定步骤或任务的子集进行深入探索。
背景与挑战
背景概述
ALFWorld数据集诞生于2023年,由多所顶尖研究机构联合构建,旨在解决具身智能体在虚拟家居环境中执行复杂交互任务的核心问题。该数据集通过将经典文本游戏框架与具身任务形式相结合,创建了涵盖拾取与放置、物体观察、清洁加热等多种类型的交互式任务,为基于大语言模型的智能体提供了标准化的训练与评测平台。ALFWorld的出现极大地推动了符号推理与物理世界知识融合的研究进展,其提出的多层次任务体系和成功评估标准已成为该领域广泛引用的基准,对具身智能体的能力评估与模型优化产生了深远影响。
当前挑战
该数据集所面临的挑战主要体现在两大方面:其一,在领域问题层面,当前智能体在复杂多步骤任务中成功率尚不理想,例如加热放置与清洁放置等涉及子目标序列的任务类型成功率仅39%-46%,反映出模型在长程推理与动作规划能力上的不足;其二,在数据构建过程中,不同任务类型间的成功率差异显著(从35%到80%),任务难度分级缺乏系统性依据,同时多类任务训练数据规模不均衡(如任务2~6仅31条记录),给模型泛化能力的评估带来了严峻考验。
常用场景
经典使用场景
在具身智能与任务规划交叉的研究领域中,ALFWorld数据集为基于文本的交互式环境提供了标准化的训练与评测基准。其经典使用场景聚焦于评估智能体在家庭场景中执行多步骤具身任务的能力,例如物体拾取与放置、物态变换操作以及多物体协同调度。研究者通过该数据集构建语言驱动的决策系统,利用结构化的环境反馈训练策略模型,使其能够解析自然语言指令并生成可执行的动作序列,从而验证交互式推理与规划算法的有效性。
实际应用
在实际应用层面,ALFWorld数据集直接服务于家庭服务机器人的认知架构开发与部署优化。基于该数据训练的语言-动作模型可被集成到真实的机械臂系统中,执行诸如根据模糊指令杂乱环境中的目标定位、温控条件下的物品归位以及双物体协同清理等操作。此外,其提供的API评测轨迹与训练指标使企业能够低成本筛选高性能模型,加速智能助理在数字孪生环境中的原型验证,为最终实现人机共融的家庭自动化方案奠定技术基础。
衍生相关工作
基于ALFWorld平台衍生了多项代表性研究工作。在数据高效学习方面,研究者提出了融合大语言模型先验知识与课程学习的SkillZero框架,显著降低任务探索的样本复杂度。在推理增强领域,由该数据集催生了将状态空间搜索与神经策略结合的AlphaWorld算法,在拾取-放置任务上取得了31%的成功率提升。多智能体协作方向上,基于ALFWorld衍生的Multi-World扩展环境被用于验证分层任务分解与通信协议学习机制。这些工作共同验证了具身语言基准对推动开放世界交互智能研究的核心作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务