遇见数据集

machinery

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集名为“zot machinery sessions”,源自zot machinery软件工厂。在该工厂中,一个代理每隔半小时接受相同的标准订单,读取现有目录,查看货架上的最后几台机器,然后设计、编写、调试并交付一台全新的机器:一个用于不存在的机器的交互式控制面板,附带实时模拟、可触发和恢复的故障以及从面板打开的操作手册。数据集中的每一行代表一个“班次”,即从订单到完成机器(或班次被截断为止)的完整代理轨迹,采用聊天格式记录,并包含工厂已知的结果信息。与同类数据集(如arcade)不同,本数据集要求模型在执行过程中“查看”——它截取自己构建的面板截图、查看截图、根据自己编写的简要说明和货架上已有的机器评判设计,并至少根据所见内容更改一次设计(即设计-批评循环)。这些图像包含在行数据中,与模型查看它们的轮次和决定如何处理它们的轮次相邻。数据由工厂工作流自动附加,无人审查,为原始记录。数据规模少于1000个样本。数据格式为目录结构,包含JSONL文件和图像文件。字段包括id、chain、task、model、provider、driver、started、ended、outcome、complete、messages、snapshots、images、events、machinery等。消息格式遵循OpenAI聊天格式,并添加了zot自定义字段。过滤方法包括完成的机器、截断的班次、设计-批评轮次、整个货架等。数据来源为工厂代码仓库,适用任务包括文本生成、图像到文本生成、代理轨迹分析、工具使用、代码生成、视觉模拟、控制面板设计、人机交互研究等。

The dataset is named zot machinery sessions from the zot machinery software factory. In this factory, an agent every half hour takes the same standard order, reads the existing catalog, looks at the last few machines on the shelf, then designs, writes, debugs, and delivers a brand new machine: an interactive control panel for a non-existent machine, with live simulation, triggerable and recoverable faults, and an operation manual opened from the panel. Each row in the dataset represents a shift, i.e., the complete agent trajectory from order to completion of the machine (or the shift being truncated), recorded in chat format, and includes the outcome information known to the factory. Unlike similar datasets (e.g., arcade), this dataset requires the model to look during execution—it takes screenshots of the panel it builds, views the screenshots, judges the design based on its own brief description and the machines already on the shelf, and changes the design at least once based on what it sees (i.e., design-critique loop). These images are included in the row data, adjacent to the rounds where the model views them and decides how to handle them. The data is automatically appended by the factory workflow, unverified by humans, and is raw records. Data size: less than 1000 samples (n<1K). Data format: directory structure of trajectories/<session-id>/<session-id>.jsonl (one line per jsonl file) and trajectories/<session-id>/images/<digest>.png (screenshot images). Fields include id, chain, task, model, provider, driver, started, ended, outcome, complete, messages, snapshots, images, events, machinery. Messages follow the OpenAI chat format with added zot custom fields. Filtering methods include completed machines, truncated shifts, design-critique rounds, entire shelf. Data source: factory code repository. Applicable tasks: text generation, image-to-text generation, agent trajectory analysis, tool use, code generation, visual simulation, control panel design, human-computer interaction research, etc.

创建时间:
2026-08-23
原始信息汇总

数据集概述:zot machinery sessions

该数据集记录了 zot machinery 软件工厂中每一台机器的完整对话轨迹。该工厂中,一个智能体每半小时接受同一份常设订单,阅读已有目录,查看库中最近几台机器,然后设计、编写、调试并交付一台全新机器——为一个不存在的机器制作一个可工作的控制面板,背后附有实时模拟、可触发和恢复的故障,以及可从面板打开的操作用户手册。

数据特性

  • 每条数据代表一个“班次”(shift):从订单到成品机器的完整智能体轨迹,或以对话形式呈现的截断班次,同时包含工厂对结果的记录。
  • 与同类数据集(openzot/arcade)的关键区别:本数据集要求模型进行视觉审查。模型需截图其构建的面板、查看截图、依据自己写的简报和库中已有机器评判设计,并至少因为所见内容修改一次设计。图像直接包含在数据行中,与模型查看图像的对话轮次及其后续决策轮次相邻,构成带证据的设计-批评循环
  • 数据行由工厂工作流在班次发生时自动追加,未经人工审核,是原样记录的日志。

数据布局

trajectories/<session-id>/<session-id>.jsonl 每条班次一行 trajectories/<session-id>/images/<digest>.png 模型查看过的截图

行(Row)字段结构

字段 说明
id 行导出的 zot 会话 ID
chain 其背后的会话链(从旧到新)——被截断的班次由下一班次继续,最终合并为一行导出
task 模型收到的订单
modelproviderdriver 运行该任务的模型及相关组件
startedended UTC 时间戳
outcome 运行结束方式:reason(success/failed/error 等)、iterationscalls 等;若运行被截断则缺失
complete 是否记录了 outcome
messages 结束时的完整对话(见下方说明)
snapshots 被压缩或恢复操作取代的早期对话状态(从旧到新)
images 该行引用的图像文件(相对于行目录)
events 各类事件计数:迭代、提示、重试
machinery 工厂侧信息:machine(目录条目:slug、名称、类型、领域、时代、设计、交互、配色、控件、故障、标语、创建时间)、files(机器的 index.html、machine.css、machine.js、manual.html)、outcome(班次判定:settled/failed/error)、catalogue_check(静态门禁)、probe(浏览器门禁:运行、每次故障报警、重置清除、手册打开)、committedcommitrun

消息格式

采用 OpenAI 对话约定,并附加 zot 专属字段:

  • type:zot 自有消息类型——userbotactivityattachmentcheckpoint(压缩摘要)、instructions
  • reasoning:模型该轮的思考草稿(当提供商提供时)。
  • 工具调用参数:模型发送的原始 JSON 字符串。
  • view 调用后紧跟 attachment,携带模型看到的图像;其后的 bot 轮次是模型对该图像的反馈。
  • 系统提示词不记录;task 即简报。

messages 是恢复运行时可重放的内容。压缩后为检查点加近期轮次;而 snapshots 保存早期状态,确保每一轮对话都存在于行中,代价是近期内容会有重复。

数据筛选建议

  • 已完成机器complete 为真,且 machinery.outcome == "settled",且 machinery.catalogue_check == "success",且 machinery.probe == "success"
  • 去重(仅保留最终班次):被截断的班次以部分行输出;继续它的班次以自有 id 输出完整链,较早期 id 放在 chain 中。删除 id 出现在其他行 chain 中的行,以仅保留链的末端。
  • 设计-批评轮次:所有路径以 -desktop.png-phone.png-manual.png 结尾的 view 工具调用,及其后的 bot 轮次。
  • 整体机器目录:settled 行中的 machinery.machine 即完整目录——按构造,任意两行不共享 kinddomain + eradesigninteraction 或配色方案。

数据来源

  • 工厂代码库:https://github.com/openzot/machinery —— 常设订单位于 orders/new-machine.yaml,设计规范与智能体读取的契约位于 AGENTS.md,门禁为 scripts/check.shscripts/probe.js
  • 执行框架(zot):https://github.com/openzot/openzot —— 数据行由 zot sessions export 生成,每班次后由 scripts/ship.py 发布。
  • 模型:每行标明所用模型。
  • 兄弟数据集:https://huggingface.co/datasets/openzot/arcade —— 同一工厂结构,用于生成浏览器游戏。

许可与注意

数据集采用 MIT 许可。机器内容是模型输出,按工厂许可原样发布。在基于其推理进行训练前,请核查行中指定模型的条款。数据集规模为 n<1K(小于 1000 条)。

搜集汇总
数据集介绍
machinery 数据集图片
构建方式
该数据集源自名为“zot machinery”的软件工厂,该工厂内运行着一套自动化流程:每半小时,一个代理接收相同的固定订单,阅读现有机器目录,观察货架上最近的几台机器,随后设计、编写、调试并交付一台全新的机器——一个针对不存在的机器的可运行控制面板,附带实时仿真、可触发的故障及恢复机制和操作手册。数据集中的每一行代表一个“班次”,记录了从订单下达至机器完成(或班次被截断)的完整代理轨迹,采用与生态系统中其他数据集兼容的对话格式。轨迹由工厂自身的工作流自动追加,未经过人工审查,保留了原始记录。数据文件以JSONL格式存储于trajectories目录下,并包含代理查看过的屏幕截图图像文件。
特点
该数据集的核心特色在于其“视觉驱动”的迭代设计过程。订单要求代理必须“观看”——它对自己构建的面板进行截图,查看截图,依据自身撰写的简报和货架上已有机器评估设计,并至少因视觉反馈而修改一次设计。这种设计批评循环的证据(图像)被直接嵌入在数据行中,与代理查看图像及做出决策的轮次相对应。此外,每行数据还包含链信息(被截断的班次由后续班次续接,作为单行导出)、快照(早期对话状态)、事件计数和工厂侧元数据(机器目录条目、文件、结果、探针结果等)。过滤指南支持用户筛选已完成机器、仅保留链末端数据或提取设计批评轮次。
使用方法
数据以JSONL格式组织,每行对应一个会话,目录结构包含轨迹文件及关联图像。用户可通过HuggingFace数据集加载器直接读取,或使用标准JSON处理工具解析。字段说明提供了详细的模式定义,包括消息采用OpenAI对话约定,并附加了自定义类型(如checkpoint、attachment)和推理字段。使用时可依据过滤指南筛选数据:如获取成功完成的机器,需检查complete字段为真且machinery.outcome为'settled',catalogue_check和probe均为'success';若需仅保留最新链,则删除那些id出现在其他行chain字段中的行;若要研究设计批评过程,可筛选view工具调用及其后跟的bot轮次。该数据集适用于训练代理的视觉推理、迭代设计能力,以及研究工具使用、代码生成和仿真交互等场景。
背景与挑战
背景概述
机器智能领域正经历从被动响应到主动创造的范式转移,具身智能体需在模拟环境中执行复杂任务并自主迭代。zot machinery sessions数据集由OpenZot团队于近期发布,其核心研究问题聚焦于智能体在软件工厂这一半结构化场景中的长程自主性,具体表现为每半小时接受标准订单,阅读既有产品目录,审视过往机器设计,进而独立完成控制面板的设计、编写、调试与交付。该数据集通过记录完整的智能体轨迹,特别强调了视觉反馈在生成式设计中的关键作用,要求智能体截取所构建面板的屏幕截图,基于视觉信息进行自我批判并至少执行一次设计优化。这一范式深度融合了代码生成、工具调用、视觉理解与模拟验证,为评估多模态语言模型在开放式工程任务中的推理与自适应能力提供了独特视角,对自主系统研究具有里程碑意义。
当前挑战
该数据集直面多个层次的深刻挑战。在领域层面,它突破了传统代码生成或视觉问答的单一模式,要求智能体在动态环境中处理视觉证据与设计标准的交互,验证其能否从屏幕截图察觉美学缺陷、功能逻辑错误及操作规范偏离,这远超静态基准的判别能力。构建过程亦充满荆棘,数据集真实记录了每次轮班的全过程,包括因压缩或恢复而超集的历史状态,确保每条轨迹的完整性,但原始数据中混杂了不完整运行与失败记录,需通过复杂筛选标记区分成功、失败与被截断的会话。此外,视觉证据与决策轨迹的紧密耦合,使得数据解析需精确对齐查看时刻与反应动作,而不同模型与提供商的推理过程记录格式不一,进一步增加了跨模型比较与数据集复用的技术难度。
常用场景
经典使用场景
该数据集以软件工厂中智能体连续执行的完整工作轨迹为核心,记录了从接收订单到最终交付控制面板的完整过程。其经典使用场景在于评估和优化具备视觉反馈闭环的智能体系统,尤其在涉及多步骤、工具调用和自主迭代的任务中。研究者可借此数据集分析智能体如何基于界面截图进行设计评估、修改方案并逐步推进任务,从而深入探究视觉语言模型在复杂环境中的决策机制与行为模式。
解决学术问题
该数据集有效填补了当前智能体轨迹数据缺乏视觉证据与批评循环的空白,为研究智能体在真实动态环境中的适应性和稳健性提供了宝贵资源。它使学术研究能够聚焦于智能体如何通过自我观察和反馈进行迭代优化,以及如何应对长序列任务中的状态压缩与恢复问题。此外,数据中记录的各类结局(成功、失败、错误)为分析智能体失败模式、鲁棒性边界以及任务复杂度度量提供了实证基础,推动了具身智能与自主决策领域理论的发展。
衍生相关工作
该数据集独特的'设计-批评'循环结构激励了一系列衍生研究,可促进开发针对智能体自我纠错和视觉反馈利用的专用训练算法。其公开的完整对话快照与图像证据,为构建智能体行为模拟环境、抽象总结长序列轨迹或学习压缩策略的研究提供了数据土壤。未来工作可能包括基于该数据集构建智能体性能预测模型,或将其与兄弟数据集(如arcade)结合,研究不同任务领域下智能体行为的共性,从而推动通用人工智能体基准测试体系的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务