遇见数据集

agent-simulations

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

ZeroProof Agent Simulations 是一个包含 50,194 条合成智能体轨迹的数据集,由 zeroproof-simulations 生成,覆盖 33 种智能体类型。轨迹包括成功、部分成功和失败三种状态,可用于监督微调、偏好学习、强化学习以及评估。数据集中每个样本包含智能体类型(agent_type)、模式(mode,如 explore、sft、rl 等)、用户初始提示(prompt)、完整对话序列(messages_json,JSON 序列化字符串)、工具调用和步骤追踪(steps_json,JSON 序列化字符串)、最终回复(final_text)、场景标识(scenario_id)、可选的奖励分数(reward)和原因(reason)、以及其余生成元数据(metadata_json,JSON 序列化字符串)。注意:该数据集为合成生成,非人工标注的真实数据,在使用前需根据具体应用进行审查和过滤。数据集分为 33 个子配置(如 airline、amazon、bank 等),每个配置仅包含训练集。

ZeroProof Agent Simulations is a dataset containing 50,194 synthetic agent trajectories, generated by zeroproof-simulations, covering 33 agent types. The trajectories include three statuses: success, partial success, and failure. It can be used for supervised fine-tuning, preference learning, reinforcement learning, and evaluation. Each sample in the dataset includes agent_type, mode (e.g., explore, sft, rl), user initial prompt, complete conversation sequence (messages_json, JSON serialized string), tool calls and step tracking (steps_json, JSON serialized string), final response (final_text), scenario identifier (scenario_id), optional reward score and reason, and other generation metadata (metadata_json, JSON serialized string). Note: This dataset is synthetically generated, not manually annotated real data, and should be reviewed and filtered according to the specific application before use. The dataset is divided into 33 sub-configurations (e.g., airline, amazon, bank), each containing only the training set.

创建时间:
2026-08-18
原始信息汇总

ZeroProof Agent Simulations 数据集概述

基本信息

  • 数据集名称:ZeroProof Agent Simulations
  • 许可证:Apache-2.0
  • 语言:英语
  • 任务类别:文本生成
  • 标签:合成数据、智能体、工具使用
  • 数据规模:包含 47,561 条合成智能体轨迹

数据集内容

该数据集由 zeroproof-simulations 生成,涵盖 34 种智能体类型的合成轨迹数据。数据行包含成功、部分成功和失败三类轨迹,可用于监督微调、偏好学习、强化学习及模型评估。

重要提示:本数据集为生成的测试与训练数据,并非人工整理的基准真值(Ground Truth),在使用前需根据具体应用场景进行审查和过滤。

智能体类型

数据集包含以下 34 种智能体类型:airline、amazon、bank、browser、calendar、chewy、clinic、coding、crm、datasci、devops、github、gmail、google、incident、instagram、intercom、khanmigo、lawfirm、legal、linear、lowes、notion、payment、realestate、rentals、research、restaurant、slack、sql、stripe、support、travel、workspace。

每种智能体类型对应一个独立的数据集配置(config),每个配置均包含一个 train 分割,数据文件格式为 JSONL。

数据字段结构

  • agent_type:数据集配置及智能体家族名称
  • mode:数据模式,包括 explore、sft、rl、adaptive 或 unspecified
  • prompt:用户的初始请求
  • messages_json:完整的对话记录,以 JSON 字符串形式序列化
  • steps_json:工具调用与操作轨迹,以 JSON 字符串形式序列化
  • final_text:智能体的最终回复
  • scenario_id:生成的场景标识符(存在时提供)
  • reward、reason:确定性行为评分,并非任务成功率的基准真值
  • metadata_json:其余生成及覆盖范围字段,以 JSON 字符串形式序列化

其中,JSON 类型的字段有意采用字符串格式存储。原因在于历史运行数据中包含异构的工具模式,序列化处理能在保留所有原始值的同时,为所有配置提供稳定的列结构。

附加说明

数据集中还包含 manifest.json 文件,用于记录聚合的数据集统计信息,但内部生成路径不对外公开。

搜集汇总
数据集介绍
agent-simulations 数据集图片
构建方式
该数据集名为ZeroProof Agent Simulations,由zeroproof-simulations工具生成,包含53,971条合成代理轨迹,覆盖34种代理类型,如航空、亚马逊、银行等。每条轨迹均记录完整的交互流程,包括用户提示、对话消息、工具调用步骤及最终响应。构建过程通过模拟真实场景生成多样化的轨迹,其中既包含成功案例也包含失败案例,旨在为监督微调、偏好学习、强化学习及模型评估提供丰富的训练材料。数据采用JSONL格式存储,按代理类型划分为多个配置子集,每个子集独立存放,便于按需加载。所有数据均以Apache-2.0许可发布,确保合法使用。
使用方法
使用该数据集时,用户可根据需要选择对应的配置名称(如bank、coding等)加载训练分割数据。数据适用于多种下游任务,包括监督微调、偏好优化、强化学习及模型评估。在训练或评估前,务必对数据进行审查和过滤,因为其并非人工标注的真实基础数据。具体使用时,可解析每行的messages_json和steps_json字段,还原完整的对话和工具调用流程,结合reward字段进行强化学习信号提取。由于数据格式统一,用户可便捷地将其集成到基于Transformers或类似框架的训练管道中,并根据特定应用场景进行数据筛选和增强。
背景与挑战
背景概述
ZeroProof Agent Simulations 数据集由 zeroproof-simulations 项目于近期创建,旨在为智能体(agent)研究提供大规模的合成轨迹数据。该数据集包含 53,971 条跨越 34 种智能体类型的轨迹,涵盖了从航空、银行到编程、数据分析等广泛领域。其核心研究问题在于如何利用合成数据训练和评估语言模型驱动的智能体,特别是在工具使用和复杂任务执行方面。该数据集为监督微调、偏好学习、强化学习及评估提供了丰富资源,对智能体领域的研究具有重要影响力,推动了合成数据在智能体训练中的应用。
当前挑战
该数据集所解决的领域问题包括:智能体在真实世界任务中的泛化能力不足,以及缺乏多样化的训练数据来支持工具使用和多步骤决策。构建过程中面临的挑战包括:生成真实且多样化的轨迹需要模拟大量场景,确保数据覆盖不同智能体类型和任务模式;轨迹中的工具模式异构,需要保持数据的一致性与可解析性;此外,数据标注的可靠性(如奖励和原因字段)难以保证,因为合成的数据并非经过严格验证的 ground truth,需要在训练和评估前进行仔细过滤和审查。
常用场景
经典使用场景
ZeroProof Agent Simulations 数据集是智能体行为建模与仿真的重要资源,它汇聚了53,971条由zeroproof-simulations生成的合成智能体轨迹,覆盖34种不同领域的智能体类型,如航空、金融、法律、医疗及软件开发等。该数据集的核心应用场景在于为监督微调(SFT)、偏好学习、强化学习(RL)以及智能体性能评估提供大规模、多样化的训练与测试语料。每条轨迹细致记录了智能体从接收用户指令到调用工具、逐步推理直至产出最终回复的完整交互流程,成功与失败样例并存,为研究者提供了丰富的正负样本,以深入探索智能体在不同场景下的决策机制与行为模式。
解决学术问题
该数据集致力于解决智能体研究中长期存在的训练数据稀缺与真实轨迹获取成本高昂的难题。通过提供合成但高保真的智能体运行轨迹,它使学术研究者得以在受控条件下系统性地研究智能体的规划能力、工具使用策略、多步推理逻辑以及错误恢复机制。数据集中显式标注的奖励与判定标签(通过/失败)虽非任务成功与否的绝对指标,却为开发奖励模型、进行偏好对齐和离线强化学习提供了关键的监督信号,推动了从行为克隆到基于反馈优化的智能体训练范式转型,进而促进了通用智能体在复杂任务中可靠性与适应性的理论探索。
实际应用
在实际产业界,该数据集为构建和优化各类智能助手与自动化系统提供了直接支撑。例如,在客户服务领域,基于其中航空公司、银行、电商等场景的轨迹数据微调的模型,能够更准确地理解用户诉求并执行查询、预订或支付操作;在生产力工具方面,涵盖日历管理、邮件处理、代码仓库交互的轨迹可用于训练智能工作流助手,实现会议安排、邮件自动分类或代码变更请求处理。此外,数据集中覆盖的DevOps、事件响应及SQL查询等场景,为开发运维自动化、故障诊断辅助及数据分析对话系统奠定了基础,展现出从个人助理到企业级自动化服务广泛的应用潜能。
数据集最近研究
最新研究方向
该数据集聚焦于智能体模拟轨迹的生成与利用,涵盖了34种不同的智能体类型,共53,971条合成轨迹,为多领域智能体行为建模提供了丰富的语料。当前前沿研究方向包括利用这些轨迹进行监督微调、偏好对齐及强化学习,以提升大语言模型在工具使用与复杂任务执行中的鲁棒性。尤其值得关注的是,数据集中成功与失败轨迹的并存,为智能体错误分析与安全性研究提供了独特视角,推动了可解释性和可控性等热点议题的深入探索。此外,跨领域的广泛覆盖使得该数据集在评估智能体泛化能力、适应性学习以及多任务协同方面具有重要价值,为未来通用人工智能体的研发奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务