遇见数据集

AgentWorldBench

收藏
Hugging Face2026-06-24 更新2026-06-26 收录
官方服务:

资源简介:

AgentWorldBench是一个用于评估语言世界模型的综合性基准测试数据集,基于真实世界观察构建,数据来源于前沿模型在现有基准(如Tool Decathlon、Terminal-Bench 1.0 & 2.0、OSWorld-Verified)上执行任务时产生的轨迹。每个评估样本都配对了从真实环境执行中获取的真实观察结果作为参考基准,支持基于真实参照的评分。该数据集旨在通过从五个维度(格式、事实性、一致性、真实性和质量)对模型预测的环境观察进行评分,全面评估世界建模的质量,并探究实现忠实环境模拟所需的推理能力、知识储备和长上下文处理能力。数据集涵盖七个不同的应用领域:MCP(API服务器响应)、Search(搜索引擎结果)、Terminal(命令行环境)、SWE(软件工程/代码编辑环境)、Android(Android UI层级变化)、Web(浏览器DOM状态变化)和OS(桌面操作系统状态)。数据规模总计2,170个样本,平均每个轨迹包含22.8个交互轮次。数据以按领域划分的JSONL文件格式存储,每个记录代表多轮环境轨迹中的一个评估轮次,包含任务域标识、唯一ID、历史提示列表、真实观察列表、当前轮次提示、系统提示、轮次索引和总轮次数等字段。该数据集主要用于语言世界模型的评估与基准测试,特别适用于需要模拟复杂、多轮交互环境的智能体(Agent)开发和研究场景。

AgentWorldBench is a comprehensive benchmark dataset for evaluating language world models, constructed based on real-world observations. The data is derived from trajectories generated by cutting-edge models performing tasks on existing benchmarks (such as Tool Decathlon, Terminal-Bench 1.0 & 2.0, and OSWorld-Verified). Each evaluation sample is paired with ground-truth observations obtained from real-world executions, serving as a reference benchmark to support reference-based scoring. The dataset aims to comprehensively assess the quality of world modeling by scoring model-predicted environmental observations across five dimensions (format, factuality, consistency, realism, and quality), and explores the reasoning capabilities, knowledge base, and long-context processing required for faithful environment simulation. It covers seven distinct application domains: MCP (API server responses), Search (search engine results), Terminal (command-line environment), SWE (software engineering/code editing environment), Android (Android UI hierarchy changes), Web (browser DOM state changes), and OS (desktop operating system states). The total data size is 2,170 samples, with an average of 22.8 interaction turns per trajectory. The data is stored in JSONL format, partitioned by domain, with each record representing an evaluation turn in a multi-turn environmental trajectory, containing fields such as task domain identifier, unique ID, history prompt list, ground-truth observation list, current turn prompt, system prompt, turn index, and total turn count. The dataset is primarily used for evaluating and benchmarking language world models, particularly suited for agent (Agent) development and research scenarios that require simulating complex, multi-turn interactive environments.

提供机构:
Qwen
创建时间:
2026-06-22
原始信息汇总

数据集概述:AgentWorldBench

AgentWorldBench 是一个用于评估语言世界模型的综合性基准测试,基于从现有成熟基准(如 Tool Decathlon、Terminal-Bench 1.0 & 2.0 和 OSWorld-Verified)中前沿模型轨迹的真实世界观测数据构建而成。每个评估样本都配有从真实环境执行中获取的真实观测(ground-truth observation),从而支持基于参考的评分。

该基准通过五个维度对每个预测的环境观测进行评分,以评估世界建模质量:格式(Format)事实性(Factuality)一致性(Consistency)真实感(Realism)质量(Quality),旨在探测量化模型进行忠实环境模拟所需的推理、知识和长上下文能力。

更多详情请参阅技术报告博客文章


基准统计数据

领域 样本数 平均轮次 描述
MCP 286 23.1 API 服务器响应:工具调用结果、数据库状态、服务协议
Search 458 15.5 搜索引擎结果:URL、摘要、排名、页面内容
Terminal 354 26.7 命令行环境:Shell 输出、文件系统状态、进程行为
SWE 472 28.1 IDE/代码编辑环境:Git diff、测试结果、编译错误
Android 200 37.8 触摸/手势操作后的 Android UI 层级变化
Web 200 14.2 用户交互后的浏览器 DOM 状态变化
OS 200 12.7 桌面操作系统状态:文件系统、窗口管理、应用行为
总计 2,170 22.8

数据格式

每个文件是一个按领域划分的 JSONL 文件({domain}_test.jsonl),每条记录代表多轮环境轨迹中的一个单轮评估步骤:

json { "task": "mcp", "id": 145256090131919, "prompt": ["### Turn 1 Action: json {...}

..."], "response": ["Environment Observation: {...}"], "current_prompt": "### Turn 1 Action: ...", "system_str": "# Role and Objective

You are a Tool World Model ...", "turn_idx": 1, "total_turns": 5 }

字段说明

字段 描述
task 领域标识符(mcp, search, terminal, swe, android, web, os
id 唯一样本标识符
prompt 整个轨迹中所有动作提示的列表
response 整个轨迹中所有真实环境观测的列表
current_prompt 当前被评估轮次的动作提示
system_str 该特定样本的世界模型系统提示
turn_idx 当前评估轮次在轨迹中的位置(从 1 开始计数)
total_turns 轨迹总轮数

评估流程

评估遵循三步流程,执行脚本位于 GitHub 仓库 中:

  1. Step 1: 世界模型推理
    python eval.py infer --data-dir ../AgentWorldBench --model-base-url http://localhost:8000/v1 --model-name Qwen/Qwen-AgentWorld-35B-A3B --output-dir ./results

  2. Step 2: LLM 裁判评分(需设置 OPENAI_API_KEY 环境变量)
    python eval.py judge --predictions ./results/predictions.jsonl --judge-base-url https://api.openai.com/v1 --judge-model gpt-5.2-2025-12-11 --output-dir ./results

  3. Step 3: 聚合与展示分数
    python eval.py score --predictions ./results/judged.jsonl

完整设置说明、部署指南和领域特定系统提示模板请参见 GitHub README


引用

bibtex @article{zuo2026qwen, title={Qwen-agentworld: language world models for general agents}, author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others}, journal={arXiv preprint arXiv:2606.24597}, year={2026} }

搜集汇总
数据集介绍
AgentWorldBench 数据集图片
构建方式
AgentWorldBench是一个专为评估语言世界模型而设计的综合性基准测试,其构建基础源自前沿模型在Tool Decathlon、Terminal-Bench 1.0及2.0、OSWorld-Verified等多个成熟基准上执行任务时产生的真实轨迹观测数据。每个评估样本均配备有通过实际环境执行获得的真实观测结果,从而为基于真实参照的评分机制提供了坚实支撑。数据集按领域划分为MCP、Search、Terminal、SWE、Android、Web和OS七个子集,每个子集以JSONL格式存储,覆盖了从API服务器响应到桌面操作系统状态等广泛的环境交互场景。
使用方法
使用AgentWorldBench进行评测时,需遵循一个三阶段的标准化流程。首先,运行世界模型推理脚本,指定数据目录、模型服务地址和模型名称,对每个评估样本生成预测的环境观测。其次,调用LLM评判器(如GPT-5.2)对预测结果进行评分,该步骤需要配置OpenAI API密钥。最后,通过聚合脚本汇总评分并输出最终结果。评估流程的设计强调可复现性和灵活性,用户可根据自身需求调整模型和评判器的配置。详细的部署指南和领域特定的系统提示模板可在GitHub仓库中找到,确保研究者能够便捷地复现评测或扩展至新领域。
背景与挑战
背景概述
AgentWorldBench是由Qwen团队于2026年发布的一个综合性基准测试数据集,用于评估语言世界模型的质量。该数据集源自对前沿模型在Tool Decathlon、Terminal-Bench、OSWorld-Verified等已建立的基准测试上运行轨迹的真实观测,每个样本均配有从实际环境执行中获取的 ground-truth 观测数据。核心研究问题在于如何系统性地衡量语言模型对环境模拟的忠实程度,从而推动世界模型在复杂、动态环境中的推理与规划能力。该数据集涵盖了MCP、搜索、终端、软件工程、Android、网页及操作系统等七个领域,共2170个样本,平均轨迹长度达22.8轮,为语言世界模型的评估提供了全面且可参考的基准框架,对提升智能体在真实场景中的环境建模能力具有重要影响力。
当前挑战
AgentWorldBench致力于解决语言世界模型评估中的核心难题:如何准确衡量模型对环境状态的预测质量。领域挑战在于,现有评估往往依赖人工或启发式指标,难以系统性地刻画模型在多轮交互中对环境格式、事实性、一致性、真实性和质量的综合建模能力。构建过程中面临多重困难:一是在不同领域(如终端操作、Android UI、Web DOM等)收集真实、多样化且可重复的环境状态轨迹;二是为每个样本标注高质量的 ground-truth 观测,确保评估的参考标准可靠;三是设计多维度的评分机制,使其能有效区分模型在感知、推理与长期记忆等方面的差异。这些挑战要求数据集在规模、覆盖度和评估指标上均达到较高水平,方可成为可靠的基准。
常用场景
经典使用场景
AgentWorldBench被设计为评估语言世界模型(Language World Models)的核心基准。研究者利用该数据集测试模型在模拟多种环境(如命令行、搜索引擎、集成开发环境、安卓系统、网页浏览器及桌面操作系统)中对环境交互的预测能力。每个评估样本均配备真实环境执行所得的观察结果,使得模型生成的预测可以在格式、事实性、一致性、真实性和质量五个维度上获得参考点评分。这一设计使其成为检验模型在复杂多步交互中推理能力与长期记忆容量的标准测试集。
解决学术问题
该数据集有效填补了智能体世界模型评估缺乏统一标准和真实参照的空白。它解决了如何客观量化语言模型对环境动态变化理解程度的问题,特别是面对多领域、多轮交互时模型对结构化、半结构化及非结构化环境反馈的预测准确性。通过引入五种精确定义的评分维度,AgentWorldBench为比较不同模型在环境仿真方面的真实能力提供了可重复且可解释的度量框架,推动了世界模型学术研究从定性演示向定量评估的转变。
实际应用
在实际应用中,AgentWorldBench可用于筛选和优化能够安全、稳定地部署在自动化系统中的智能体模型。例如,在软件工程中评估模型对代码仓库状态变化的预测,有助于提升自动调试和智能编程助手的可靠性;在搜索领域测试模型对搜索引擎响应的模拟,可改善信息检索系统的交互体验;而在移动端和桌面操作系统场景中,评估模型对界面层级变化的理解,对开发高效的自动化测试与智能助手具有重要意义。这些应用场景均基于对模型环境感知能力的严格检验。
数据集最近研究
最新研究方向
AgentWorldBench的提出标志着语言世界模型评估迈入了一个全新的维度,它不再局限于传统的任务成功率,而是深入到环境模拟的保真度本身。该基准通过汇聚来自Tool Decathlon、Terminal-Bench及OSWorld等前沿基准中真实智能体轨迹的观察数据,系统性地从格式、事实性、一致性、真实性与质量五维尺度来衡量模型对环境的理解与预测能力。这一方向直指当前大语言模型作为通用智能体在动态交互中的核心瓶颈——即如何构建一个可靠、可泛化的内部世界模型。其深远意义在于,它不仅为Qwen等前沿模型在复杂环境模拟中的推理与长上下文处理提供了精细化诊断工具,更推动了整个领域从“完成任务”向“理解环境”的范式转变,为未来通用人工智能体在真实世界中的可信部署奠定了关键评估根基。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务