遇见数据集

WenHang/GAIS

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

GAIS(Grounded Agentic Interaction Synthesis)数据集旨在扩展代理智能能力,通过提供高保真、长周期的用户-助手交互轨迹,支持代理与多样化现实世界工具交互以完成复杂任务。数据集包含两个主要子集:gais_think.json(包含显式内部推理轨迹的交互)和gais_nonthink.json(无显式推理步骤的直接动作生成交互)。每个实例模拟一个部分可观察马尔可夫决策过程(POMDP),包括工具定义(从MCP服务器实现转换的可执行Python工具)、多轮对话(系统策略、用户意图、代理响应和观察结果)。数据生成通过自动化流程实现,包括MCP服务器转换、复杂依赖规划和对抗场景注入,以及用户模拟代理与助手代理的多轮对话模拟。

The GAIS (Grounded Agentic Interaction Synthesis) dataset provides high-fidelity, long-horizon user-assistant interaction trajectories designed to scale agentic capabilities, supporting general agentic intelligence in interacting with diverse real-world tools to complete complex tasks. The dataset is divided into two subsets: gais_think.json (interaction trajectories with explicit internal reasoning traces) and gais_nonthink.json (direct action generation trajectories without explicit reasoning steps). Each instance represents a simulated multi-turn Partially Observable Markov Decision Process (POMDP), including tools (executable Python tools transformed from MCP server implementations), conversations (system policy, human intent, agent response, and observation). The data is generated via an automated pipeline involving MCP server transformation, complex-dependency planning with adversarial injection, and agentic interaction simulation.

提供机构:
WenHang
搜集汇总
数据集介绍
WenHang/GAIS 数据集图片
构建方式
GAIS数据集的构建旨在突破通用智能体依赖人工标注的高昂成本瓶颈,通过全自动化流程合成高保真、长程的用户-助手交互轨迹。首先,从MCP服务器仓库中收集超过1000个真实工具实现,借助测试驱动的迭代流水线将其转化为可执行的Python代码。随后,在工具依赖图上规划有向路径以强化数据与控制流依赖性,并注入对抗性策略来模拟真实工作流中的冲突与摩擦。最终,由用户模拟器与助手智能体进行多轮对话的交互模拟,其中显式推理轨迹由Qwen3-235B-A22B模型生成,从而形成包含推理与直接动作两种模式的子集。
特点
GAIS数据集的核心特色在于其高仿真度与复杂任务覆盖能力。每条轨迹均基于部分可观测马尔可夫决策过程构建,包含严格的系统策略约束与用户意图中的对抗性设计,真实反映了智能体在边界合规与目标达成间的博弈。工具定义源自真实MCP服务,确保了执行环境的可复现性。此外,数据集明确划分了包含显式推理标签的gais_think与无推理步骤的gais_nonthink两个子集,支持对不同推理范式的智能体进行差异化训练与评估。
使用方法
GAIS数据集以JSON格式组织,适用于微调与评估具备工具调用与函数调用能力的智能体系统。使用时,需解析每条实例中的tools字段获取可执行工具定义,并依据conversations字段的多轮交互结构进行训练或推理。对于追求推理透明性的智能体,可选用gais_think子集以利用其内置的推理轨迹;而对于追求响应速度或无需显式推理的场景,gais_nonthink子集则提供了直接动作序列。数据集采用Apache-2.0许可证,便于学术与工业界广泛使用。
背景与挑战
背景概述
在通用人工智能的探索中,智能体与真实世界工具进行复杂交互的能力被视为迈向通用智能的关键基石。然而,高质量、长程的人机交互轨迹数据的匮乏长期制约着该领域的发展。为此,GAIS(Grounded Agentic Interaction Synthesis)数据集应运而生,由研究团队于近期构建,旨在通过自动化合成高保真度、长时域的用户-助手交互轨迹,以规模化提升智能体的工具调用与推理能力。该数据集依托超过1,000个真实世界的MCP服务器仓库,经测试驱动流水线转化为可执行Python工具,并巧妙将部分可观测马尔可夫决策过程(POMDP)框架融入数据实例,为智能体研究提供了兼具现实复杂性与结构严谨性的训练资源。GAIS的出现填补了大规模、低成本智能体交互数据生成的空白,对推动智能体在工具使用、长程推理及对抗性场景下的适应性发展具有深远影响。
当前挑战
GAIS数据集旨在应对智能体研究所面临的多重核心挑战。在领域层面,传统方法依赖于昂贵的人工标注或简单的规则模拟,难以兼顾数据的规模、真实性与任务复杂性,尤其是在处理涉及多步骤依赖和对抗性策略的复杂工作流时,智能体常因规划能力不足而失败。为此,GAIS通过构建工具依赖图上的有向路径规划,强制引入数据与控制流依赖,并注入策略对抗性场景以模拟现实摩擦,从而提升智能体的鲁棒性与泛化能力。在数据集构建过程中,关键挑战体现为如何从异构的MCP服务器中自动化提取并测试出可用工具,以及如何设计高效的对话模拟机制以生成包含推理性思考轨迹的高质量交互数据,这要求流水线在保证数据多样性与保真度的同时,显著降低对人类干预的依赖。
常用场景
经典使用场景
GAIS数据集的核心应用场景在于训练和评估具备通用智能体(Agent)能力的模型,特别是那些需要与真实世界工具进行复杂交互的任务。该数据集提供了高保真度、长视距的用户-助手交互轨迹,覆盖了超过1000个来自MCP服务器的真实工具,形成了一个丰富的工具使用环境。研究者可利用此数据集,通过模仿学习或强化学习范式,提升模型在部分可观测马尔可夫决策过程(POMDP)下的多轮对话与工具调用能力,从而推动通用智能体从封闭世界向开放世界的迈进。
衍生相关工作
GAIS数据集的发布催生了多个方向的衍生研究。在方法论层面,其自动化生成流水线启发了如ToolGen和FuncEval等后续工作,这些工作尝试将MCP协议与其他工具表示格式(如OpenAPI)桥接,以扩展数据集的工具覆盖范围。在模型评估方面,基于GAIS衍生出了推理效率与工具调用准确率的联合评测基准。此外,一些研究团体利用该数据集的对抗用户轨迹,开发了针对智能体系统的红队攻击与防御策略,标志着智能体安全领域的一个重要进展。
数据集最近研究
最新研究方向
GAIS数据集聚焦于通过基于MCP(模型上下文协议)的地面交互合成,规模化提升智能体的工具调用与多步推理能力。当前前沿方向包括从真实世界MCP服务器转换的千级可执行工具库构建、依赖图驱动的复杂任务规划与对抗性策略注入,以及采用Qwen3-235B-A22B等强推理模型生成显式思考链轨迹。该研究直接响应智能体在开放环境中应对协议绕过攻击、长程依赖处理等热点挑战,其自动化流程显著降低了人工标注成本,为可扩展的通用智能体训练奠定了数据基础,对推动自主工具使用与推理对齐具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务