遇见数据集

arcade

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集记录了zot arcade中每个游戏背后的完整对话轨迹。每个样本代表一次'shift',即代理从接收固定的半小时间隔订单、阅读现有游戏目录、设计、编写、测试到发布全新浏览器游戏的完整过程。数据以JSONL格式存储,每个样本包含会话ID、任务描述、模型信息、开始与结束时间、结果、消息历史、截图、事件计数以及arcade侧的游戏信息和输出结果。消息遵循OpenAI聊天格式,并添加了自定义类型字段(如用户、机器人、活动、附件、检查点等)。数据集适用于代理轨迹分析、工具使用、代码生成和文本生成等任务,包含小于1000条样本。

This dataset records the complete conversation trajectories behind each game in zot arcade. Each sample represents a shift, which is the entire process of an agent receiving fixed half-hourly orders, reading existing game catalogs, designing, writing, testing, and publishing a new browser game. Data is stored in JSONL format, with each sample containing session ID, task description, model information, start and end time, result, message history, screenshots, event count, as well as arcade-side game information and output results. Messages follow the OpenAI chat format and include custom type fields (e.g., user, bot, activity, attachment, checkpoint, etc.). The dataset is suitable for tasks such as agent trajectory analysis, tool use, code generation, and text generation, and contains fewer than 1000 samples.

创建时间:
2026-08-23
原始信息汇总

zot arcade sessions 数据集概述

基本信息

  • 许可证: MIT
  • 语言: 英语
  • 数据集大小: 少于 1K 条数据
  • 任务类别: 文本生成
  • 标签: 智能体轨迹、工具使用、代码生成、游戏、zot

数据集内容

该数据集记录了 zot arcade 中每个游戏背后的每一次对话——这是一个软件工厂,智能体每隔半小时接受相同的常规订单,读取已有内容目录,并设计、编写、试玩和发布一款全新的浏览器游戏。

每一行代表一个轮班:从订单到成品游戏(或轮班被中断的位置)的完整智能体轨迹,采用生态系统其余部分可读取的对话格式,并附带 arcade 已知的结果信息。这些行由 arcade 自身的工作流在轮班发生时自动追加,未经人工审核,是原始的运行记录。

数据布局

trajectories/<session-id>/<session-id>.jsonl 一行数据 trajectories/<session-id>/images/<digest>.png 模型看到的截图

行数据结构

字段 说明
id 行导出的 zot 会话 ID
chain 其背后的会话链(从最旧到最新);被中断的轮班由下一个轮班继续,作为一行导出
task 模型收到的订单
model, provider, driver 运行的模型、提供商和驱动
started, ended UTC 墙钟时间
outcome 运行结束方式:reasonsuccessfailederror 等)、iterationscalls 等;运行被中断时缺失
complete 是否记录了结果
messages 结束时的对话,详见下文
snapshots 压缩或恢复所取代的早期对话状态,从最旧到最新
images 此行引用的图像文件,相对于行所在目录
events 各类事件计数:迭代次数、提示次数、重试次数
arcade arcade 侧信息:game(目录条目:slug、名称、类型、机制、主题、标语、控制方式、创建时间)、files(游戏的 index.htmlgame.cssgame.js)、outcome(轮班判定:settled / failed / error)、catalogue_checkcommittedcommitrun

Messages 格式

采用 OpenAI 对话约定,并附加额外字段:

json {"role": "user", "type": "user", "content": "Begin working on your task..."} {"role": "assistant", "type": "bot", "content": "", "reasoning": "...", "tool_calls": [{"id": "call_1", "type": "function", "function": {"name": "read", "arguments": "{"path":"site/games.json"}"}}]} {"role": "tool", "type": "activity", "tool_call_id": "call_1", "name": "read", "content": "[...]"} {"role": "user", "type": "attachment", "content": [{"type": "text", "text": "screenshot of the game"}, {"type": "image", "image": "images/3f2a....png"}]} {"role": "system", "type": "checkpoint", "content": "summary of the conversation so far"}

  • type 是 zot 自身的消息类型:userbotactivityattachmentcheckpoint(压缩摘要)、instructions
  • reasoning 是模型在该轮中的草稿内容(当提供商提供时)
  • 工具参数为模型发送的原始 JSON 字符串
  • 系统提示未被记录;task 即为简要说明

messages 是恢复运行时会重放的内容。压缩后,它会包含一个检查点加上最近的轮次——snapshots 保存早期状态,因此行中保留了每一个发生的轮次,代价是最近的轮次会被重复。

数据过滤

  • 已完成游戏: complete 为真,且 arcade.outcome == "settled",且 arcade.catalogue_check == "success"
  • 去重: 被中断的轮班作为部分行发布;继续该轮班的轮班会在自己的 id 下发布完整链,并在 chain 中包含早期 id。删除 id 出现在其他行 chain 中的行,仅保留链末端。

数据来源

  • 工厂: https://github.com/openzot/arcade —— 常规订单为 orders/new-game.yaml,智能体读取的规范为 AGENTS.md
  • 工具链: zot;行由 zot sessions export 生成,并在每次轮班后由 scripts/ship.py 发布
  • 模型: 由工作流在运行时指定;每一行都会标明使用的具体模型

使用注意

游戏是模型输出,按 arcade 的许可证原样发布。若需使用行中推理内容进行训练,请先检查该行所标注模型的条款。

搜集汇总
数据集介绍
arcade 数据集图片
构建方式
该数据集源自zot arcade这一自动化软件工厂的运行记录,每半小时智能体依据固定指令启动一轮班次,在读取既有游戏目录后,自主完成新浏览器游戏的设计、编码、试玩与发布。每一行数据对应一个完整班次,由工厂自身工作流在班次发生时自动追加,无需人工审核,忠实保留从任务指令到成品游戏或以中断告终的全过程轨迹,并以生态通用的对话格式及附带的结果元数据加以封装。
特点
数据集以对话形式承载智能体的完整行为轨迹,涵盖用户指令、模型推理、工具调用与文本生成等多类型消息,并附有快照、图像、事件计数及街机侧结果信息。行内结构清晰呈现任务、模型与运行环境,兼具成功与失败案例,且通过链式字段记录中断班次的延续关系,使跨班次轨迹得以完整追溯,为研究智能体长程任务执行提供了细粒度、无偏见的原始记录。
使用方法
使用者可依据complete字段与arcade.outcome等条件筛选出成功完成的游戏记录,亦可过滤掉已中断班次的部分行以保留完整链条。通过解析messages中的OpenAI风格对话及附加字段,可还原智能体的推理过程与工具调用细节;图像文件可按相对路径加载以获取视觉上下文。该数据集适用于文本生成、智能体轨迹分析及工具使用等任务,使用时应遵循许可条款并核查对应模型的使用条件。
背景与挑战
背景概述
在人工智能驱动软件自动化的浪潮中,arcade数据集以独特的视角记录了智能体自主构建网页游戏的完整轨迹。该数据集由openzot团队创建,依托其软件工厂式工作流,每半小时由同一智能体依据固定指令,阅读现有游戏目录,并自主完成设计、编码、试玩与发布一款全新浏览器游戏的全部流程。数据集以班次为单元,捕获从指令下达到游戏成品的智能体对话轨迹,涵盖消息、推理、工具调用、截图及游戏文件等多元信息。该数据集为研究智能体在真实任务中的长程规划、代码生成与工具使用提供了宝贵的实证材料,并推动了自主智能体在软件工程领域的评估与发展。
当前挑战
arcade数据集所应对的核心挑战在于,如何让智能体在无人类干预的情况下,持续产出可运行且具新颖性的网页游戏,这涉及复杂的长程规划、代码生成、错误调试与自我评估。构建过程中,数据采集面临多重困难:智能体轨迹可能因中断而跨越多个会话,需通过链式记录保持完整性;对话压缩与恢复机制导致消息快照存在冗余,需谨慎处理以避免训练偏差;模型推理过程与工具调用参数被逐字保留,对数据解析与隐私保护提出更高要求。此外,游戏输出完全由模型生成,其质量与多样性直接受限于模型能力,且不同模型的许可条款差异也为数据使用带来合规挑战。
常用场景
经典使用场景
在自主智能体与工具增强代码生成的研究中,arcade数据集以其对完整智能体轨迹的忠实记录而独树一帜。每一行代表一个“班次”,即智能体从接收固定订单到设计、编写、试玩并发布一款全新浏览器游戏的全过程对话,涵盖了工具调用、代码迭代与多模态截图反馈。这一经典使用场景为研究者提供了在真实沙盒环境中观察长时程任务执行、错误恢复与自我修正的珍贵窗口,尤其适用于训练与评估能够进行复杂规划与代码生成的智能体模型。
衍生相关工作
围绕arcade数据集,已衍生出一系列经典工作,涵盖智能体轨迹分析、工具调用优化及代码生成评估等领域。部分研究基于其会话结构提出了长时程记忆与压缩机制,另一些则利用其代码与截图配对数据探索多模态反馈对编程智能体的增强效果。该数据集亦成为智能体基准测试的重要补充,推动了从静态代码生成向动态、交互式开发任务的研究演进,为后续工作提供了坚实的实证基础与可复用的数据范式。
数据集最近研究
最新研究方向
在自主智能体与工具增强代码生成领域,arcade数据集以其独特的自主软件工厂范式,为智能体长时程轨迹研究提供了珍稀的实证资源。该数据集捕捉智能体在半小时间隔的固定指令下,自主完成游戏设计、编写、测试与部署的完整闭环,每一行代表一次轮班的全量对话轨迹与游戏成品。当前前沿研究聚焦于利用该数据评估智能体的推理一致性、工具调用策略及压缩恢复机制对任务延续性的影响,并为智能体自我纠错与迭代开发能力提供细粒度标注。其开放性与真实部署场景为智能体基准测试、轨迹蒸馏及代码生成可靠性研究注入了新的活力,对推动可复现的自主智能体系统发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务