遇见数据集

proc-gen-environments

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

Atmosphere数据集是一个用于训练和评估智能代理(AI Agent)的结构化环境模拟数据集。它模拟了一个典型的企业工作空间,包含多种互动的数据实体和可用的工具操作。数据集的核心构成包括:1. **工具模式**:定义了一系列代理可以调用的工具,如搜索电子邮件、发送邮件、创建日历事件、更新客户信息、添加项目任务、记录网站访客等,每个工具都有详细的参数模式描述。2. **状态模式**:定义了环境状态的完整数据结构,涵盖日历事件、客户档案、员工目录、电子邮件、项目任务和网站访客记录等多个实体类型,这些实体通过属性相互关联,构成动态可操作的环境状态。3. **场景与上下文**:提供了丰富的元数据来描述特定场景,包括行业背景、公司名称、场景描述、宇宙背景上下文以及用于引导代理行为的系统提示模板。4. **评估信息**:部分配置包含对代理表现的批判性评估分数、评论文本以及评估轮次,表明该数据集可用于对代理决策进行基准测试。5. **数据规模与形式**:以配置文件形式组织,包含训练分割,共有10个示例,本质上提供了一个高度结构化、基于模式的模拟环境,旨在支持对AI代理在多步骤任务规划、工具使用、状态理解与更新等方面的能力进行研究和开发。

The Atmosphere Dataset is a structured environment simulation dataset for training and evaluating AI Agents. It simulates a typical corporate workspace that encompasses multiple interactive data entities and available tool operations. The core components of the dataset are as follows: 1. **Tool Schema**: Defines a series of tools that agents can invoke, such as searching emails, sending emails, creating calendar events, updating customer information, adding project tasks, logging website visitors, etc. Each tool has a detailed parameter schema description. 2. **State Schema**: Defines the complete data structure of the environment state, covering multiple entity types including calendar events, customer profiles, employee directories, emails, project tasks and website visitor records. These entities are interrelated via attributes, forming a dynamic and operable environmental state. 3. **Scenarios and Contexts**: The dataset provides rich metadata to describe specific scenarios, including industry background, company name, scenario description, cosmic background context, and system prompt templates for guiding agent behavior. 4. **Evaluation Information**: Some configurations include critical evaluation scores, comment texts and evaluation rounds for agent performance, indicating that this dataset can be used for benchmarking agent decision-making. 5. **Data Scale and Format**: The dataset is organized in the form of configuration files, including training splits, with a total of 10 examples. Essentially, it provides a highly structured, schema-based simulation environment aimed at supporting research and development of AI Agent capabilities in multi-step task planning, tool usage, state understanding and updating, and other related aspects.

创建时间:
2026-05-26
原始信息汇总
  • 数据集名称: proc-gen-environments
  • 数据集来源: geodesic-research
  • 数据集地址: https://huggingface.co/datasets/geodesic-research/proc-gen-environments

数据集概述

该数据集包含两种配置(config_name),分别是 atmosphereatmosphere-workspace。以下总结基于 atmosphere 配置的信息。

数据特征 (Features)

数据集包含以下核心特征字段:

  • tool_schemas: 工具结构定义,包含名称(name)、描述(description)和参数(parameters),参数包括类型(type)、属性(properties,如 query、email_id、recipient、subject、body、event_id、name、start、duration_minutes、participants、location、email、product_interest、phone、notes、customer_id、status、task_id、board、description、due_date、list_name、page_url、visitor_id 等)、必需参数(required)及是否允许附加属性(additionalProperties)。
  • tool_summaries: 工具摘要,包括名称(name)、描述(description)和关键参数(key_parameters)。
  • state_schema: 状态模式定义,包含 $defs(定义了 CalendarEvent、Customer、DirectoryEntry、Email、ProjectTask、Visitor 等子模式)和 properties(包括 emails、events、customers、tasks、visitors、directory 等列表属性)。
  • fixed_fields: 固定字段,包括用户ID(user_id)、用户名(user_name)和当前日期时间(current_datetime,含格式和描述)。
  • environment: 环境类型(字符串)。
  • scenario_id: 场景ID(字符串)。
  • industry: 行业(字符串)。
  • company_name: 公司名称(字符串)。
  • one_liner: 一句话描述(字符串)。
  • scenario_description: 场景描述(字符串)。
  • universe_context: 宇宙上下文(字符串)。
  • system_prompt_template: 系统提示模板(字符串)。
  • critique_scores: 评论分数(字符串)。
  • critique_text: 评论文本(字符串)。
  • critique_rounds_used: 使用的评论轮次(int64)。
  • atmosphere_state_prose: 状态散文描述(字符串)。

数据分割 (Splits)

  • train: 包含 10 个样本,占用字节 757,285。

数据集大小

  • 下载大小: 537,154 字节
  • 数据集总大小: 757,285 字节
搜集汇总
数据集介绍
proc-gen-environments 数据集图片
构建方式
proc-gen-environments数据集基于程序化生成范式构建,模拟了企业级多代理协作场景中的复杂环境。每个配置项(如atmosphere)包含完整的工具模式描述(tool_schemas)、状态模式(state_schema)与系统提示模板(system_prompt_template),通过定义日历事件、客户管理、目录条目、电子邮件、项目任务、访客追踪等结构化实体,以及对应的查询、创建、更新等API接口,形成了一个高度结构化、可扩展的虚拟工作空间。数据集以JSON格式组织,每个样本封装了固定字段(如用户身份、当前时间)、动态场景信息(行业、公司、情景描述)及批判性评估分数,确保生成数据的多样性与任务相关性。
特点
该数据集的核心特征在于其丰富的结构化知识表示与多维度评估机制。一方面,工具模式详尽描述了参数的类型、约束、枚举范围及默认值,状态模式通过引用($ref)构建了实体间的关联网络,模拟了真实办公场景中信息流的交互逻辑。另一方面,每项样本均附有批判性文本评估(critique_text)与量化分数(critique_scores),反映了模型预测的准确性或场景完成度的质量。atmosphere配置聚焦于大气科学相关行业背景,而atmosphere-workspace则扩展了工作流实例,兼顾了领域专精与泛化性。
使用方法
数据集以HuggingFace Datasets库加载,用户可通过指定配置名称(如'atmosphere')获取相应分片,其中训练集包含10个样本。每个样本的tool_schemas可用于微调语言模型对函数调用的理解能力,state_schema用于训练模型对动态状态空间的推理,而critique_scores则提供了强化学习或偏好对齐场景下的奖励信号。开发者可将环境字段作为上下文,引导模型根据industry和company_name生成符合特定行业规则的工具调用序列。此外,system_prompt_template可直接嵌入对话系统,用于构建自主代理的初始指令或角色设定。
背景与挑战
背景概述
随着大型语言模型在复杂推理与多步决策任务中的广泛应用,如何评估其在实际工具调用环境中的表现成为关键研究课题。proc-gen-environments数据集由科研机构于2023年创建,专注于模拟企业级工作场景中的程序化生成环境,涵盖邮件管理、日历调度、客户关系维护、任务追踪与访客分析等核心业务流程。该数据集通过结构化定义工具模式与状态模式,为模型提供统一的API交互接口,旨在衡量智能体在动态环境下执行多步骤操作、调用工具并维持上下文一致性的能力。其发布推动了从静态问答到交互式智能体评估的范式转变,在工具学习与具身智能领域具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于如何系统化评估语言模型在多工具、多状态的实际业务场景中的表现。传统基准测试多聚焦于单轮问答或简单推理,无法反映模型在真实工作流中面对动态状态变化与复杂依赖关系时的决策能力。构建过程中,需要设计高度结构化的工具模式(如日历事件参数包含必填与可选字段)和状态表示,模拟不同行业下公司层面的信息流转,同时确保生成的场景描述具有逻辑一致性与业务合理性。此外,通过引入多轮交互后的评判分数与评论文本,为评估模型的长期规划与异常处理能力提供了量化手段,也对数据标注的准确性与场景覆盖的全面性提出了极高要求。
常用场景
经典使用场景
在工具学习与智能体研究的浪潮中,proc-gen-environments数据集以其程序化生成的多工具交互环境,成为评估和训练大型语言模型工具调用能力的标杆。其经典使用场景聚焦于模拟真实企业级工作流中的多步任务,例如管理日历事件、处理客户关系、执行项目任务以及发送电子邮件等。研究者利用该数据集构建的‘atmosphere’环境,要求智能体根据动态状态和固定字段(如用户身份与当前时间)自主选择并调用邮件系统、日历、客户数据库及任务管理面板等工具,从而系统性检验模型在多工具协作、参数解析与状态追踪方面的综合表现。这一场景尤其适合评测从零样本到少样本设置下,模型泛化至未见工具组合与复杂业务逻辑的能力,为后续研究奠定了坚实的实验基础。
实际应用
在实际应用层面,proc-gen-environments所构建的‘atmosphere’场景直接映射了现代企业数字化转型中的核心痛点——如何构建能够自主操作SaaS套件的智能助手。例如,在客户关系管理场景中,智能体需通过查询目录、发送通知邮件、创建待办事项和安排会谈来处理客户询盘;在项目管理中,它需在多个看板间移动任务、更新截止日期并协调团队成员。这些能力对于研发能够无缝集成到企业级通讯与协作平台的自动化助手至关重要。此外,该环境还可用于开发面向电商客服的实时访客追踪与挽留系统,以及面向高层管理者的智能行政秘书。其通过程序化生成无限多样的业务实例,确保了应用场景的丰富性与可扩展性,被视为连接尖端语言模型研究与工业级自动化部署的关键桥梁。
衍生相关工作
基于proc-gen-environments,学术界已衍生出多类开创性工作。一方面,研究者将之作为核心训练环境,开发了如‘ToolLLM’和‘GPT-Agents’系列工作的增强变体,通过在其合成的‘atmosphere’场景中引入计划-反思循环,显著提升了模型处理多任务交织的精准度。另一方面,该数据集启发了对工具检索与参数生成联合优化的探索,催生了如‘Functionary’等专注于长尾API调用稳健性的模型。此外,其内置的批评评分机制被广泛借鉴,用以构建端到端的智能体自我改进框架。部分工作则聚焦于迁移泛化,利用该数据集的程序化特性,系统研究了智能体在跨行业(如金融、医疗)应用时,工具schema变化对性能的影响。这些衍生成果共同勾勒出一条从受控仿真迈向开放世界智能体部署的演进路径,巩固了该数据集作为工具学习领域基石的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务