遇见数据集

GLM-5.2-Agent

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

GLM-5.2 Agent traces 是一个由 TeichAI 使用 teich 工具生成的智能体轨迹数据集,旨在记录 GLM-5.2 模型在会话中的原始交互行为,用于智能体训练与蒸馏。数据集包含 151 个 JSONL 文件,每个文件代表一个独立的智能体会话,以每行一个 JSON 对象的形式存储。数据内容涵盖了完整的会话历史,并经过规范化处理,确保语义顺序为推理优先、可选的助手文本次之、工具调用最后。数据集的一个关键特性是嵌入了训练就绪的工具模式,即使会话中未实际调用工具,也能通过数据集级别的工具模式快照(包含 bash、edit、read、write、read_file、write_file 等函数描述)提供完整的工具定义,确保训练数据的可用性。此外,数据还保留了丰富的运行时上下文信息,如技能、MCP 指令、钩子上下文、权限状态、日期变更和会话回顾等,这些信息在原始记录可用时会以掩码化的“系统”消息形式保存。数据集适用于文本生成任务,特别是基于智能体轨迹的模型训练、行为克隆和知识蒸馏。用户可以通过 teich 工具进行数据加载、转换(如转换为包含 prompt、messages、tools 和 metadata 的 OpenAI 风格格式)、混合和验证,以适配不同的训练流程。

GLM-5.2 Agent Traces is an agent trajectory dataset generated by TeichAI using the teich tool, which aims to record the original interactive behaviors of the GLM-5.2 model during conversations for agent training and knowledge distillation. The dataset consists of 151 JSONL files, each representing an independent agent conversation, stored in the format of one JSON object per line. The data covers the complete conversation history and has been standardized to ensure that the semantic order follows: reasoning first, followed by optional assistant messages, and finally tool calls. A key feature of this dataset is the embedded training-ready tool schema. Even if no tools are actually called during a conversation, it can provide complete tool definitions via a dataset-level tool schema snapshot (including function descriptions such as bash, edit, read, write, read_file, and write_file), ensuring the availability of training data. In addition, the dataset retains rich runtime context information, such as skills, MCP instructions, hook context, permission status, date changes, session reviews, etc. These pieces of information will be saved as masked "system" messages when the original records are available. This dataset is suitable for text generation tasks, especially model training, behavioral cloning, and knowledge distillation based on agent trajectories. Users can use the teich tool to load, transform (e.g., convert to OpenAI-style format containing prompt, messages, tools, and metadata), mix, and validate the data to adapt to various training workflows.

创建时间:
2026-06-20
原始信息汇总

数据集名称

  • GLM-5.2 Agent traces

基本属性

  • 发布者: TeichAI (通过 teich 工具生成)
  • 数据集标识: AletheiaResearch/GLM-5.2-Agent
  • 任务类别: 文本生成 (text-generation)
  • 标签: agent-traces, distillation, pi, z-ai/glm-5.2, teich

数据规模与格式

  • 文件数量: 196个JSONL文件
  • 数据格式: 每行一个JSON对象,代表一个完整的agent会话记录
  • 模型元数据: z-ai/glm-5.2

数据结构

每个agent会话记录包含常见顶层事件组:

  • session_meta
  • turn_context
  • event_msg
  • response_item
  • session
  • message
  • session_info
  • model_change
  • thinking_level_change
  • external_session_meta
  • external_message
  • external_stderr

数据生成与处理

  • 使用 teich 工具生成
  • 支持训练就绪的工具schema恢复,即使原始记录中只包含工具名称或调用
  • 提供了完整的数据集级tools schema快照(内嵌于README折叠区域),包含bash、edit、read、read_file、write、write_file等工具定义
  • load_traces 函数可将该schema作为fallback tools 字段应用到每个加载的样本

训练与使用

  • 数据集可直接用于Teich的数据准备和训练工具
  • 可使用 teich convert 命令转换为独立的OpenAI风格JSONL行(包含prompt、messages、tools、metadata字段)
  • 详细训练指南可参考 Teich训练文档
  • 数据加载、混合、转换和验证方法可参考 Preparing Data文档

示例数据

json {"type": "session", "version": 3, "id": "019ee172-2f9f-7341-8125-4e5d535d9e56", "timestamp": "2026-06-19T19:53:37.440Z", "cwd": "/workspace"}

搜集汇总
数据集介绍
GLM-5.2-Agent 数据集图片
构建方式
GLM-5.2-Agent 数据集由 TeichAI 团队利用 teich 工具框架精心构建而成,旨在捕获基于 z-ai/glm-5.2 模型的多轮智能体交互轨迹。数据以 JSONL 格式存储,共包含 196 个独立会话文件,每个文件忠实记录了一次完整的智能体任务执行历程。构建过程中,teich 自动对零散的助手片段进行语义重组,形成“推理优先、文字次之、工具调用结尾”的标准化序列结构;同时,源自 Claude Code 的原始日志被转换为保留运行时上下文信息的掩码系统消息,从而实现了从原始转录到训练就绪数据的高保真转换。
特点
本数据集的核心特色在于其完备的工具架构支持。每条轨迹均携带经过配置或恢复的工具模式(tool schema),确保即便在会话中部分工具未被实际调用,其定义依然可供模型学习。尤为突出的是,数据集内置了涵盖 bash、edit、read、write 等常见编程交互工具的全局模式快照,便于统一加载与微调。此外,数据格式高度兼容上游保存与下游转换,既支持原生格式的直接训练,也能通过 teich convert 命令导出为标准 OpenAI 格式,兼顾灵活性与可扩展性。
使用方法
推荐通过 Teich 的数据准备与训练工具链使用该数据集。用户可直接加载 AletheiaResearch/GLM-5.2-Agent 仓库,利用 Teich 的 load_traces 函数将全局工具模式注入每个样本,亦可执行 teich convert 生成独立的 prompt、messages、tools 及 metadata 字段构成的 JSONL 行。对于希望在传统聊天模板下进行训练的开发者,Teich 提供了完善的格式处理与掩码配置方案,详细指南收录于其官方训练文档与数据准备手册中,便于快速集成至现有流程。
背景与挑战
背景概述
GLM-5.2-Agent数据集由TeichAI团队于2025年构建,旨在为基于智谱GLM-5.2模型的多智能体系统提供高质量的代理轨迹数据。随着大型语言模型从单纯的文本生成迈向工具调用与自主决策的智能体范式,如何有效捕捉、标准化并复用代理在真实环境中的交互行为成为关键研究问题。该数据集包含196个JSONL格式的原始代理会话文件,覆盖bash命令执行、文件编辑与读写等核心工具操作,并保留了完整的工具架构信息,为后续的模型微调与行为蒸馏提供了坚实基础。作为首个面向GLM-5.2模型的公开代理轨迹数据集,它将有力推动中文环境下智能体行为对齐与工具调用能力的研究进展。
当前挑战
数据集面临的挑战主要体现在两方面。其一,领域问题层面,现有开源数据集多聚焦于静态对话或单步工具调用,缺乏对多轮、动态工具协同与上下文感知的完整代理行为建模;GLM-5.2-Agent需填补这一空白,支持从原始交互日志向训练可用的结构化数据的无损转换。其二,构建过程中,代理轨迹的采集受限于工具调用的非确定性、会话上下文的多样性以及不同平台(如Claude Code、Claude Desktop)间架构差异,如何在保留原始会话完整性的同时,标准化多源碎片信息(如MCP指令、权限状态、会话摘要)并嵌入工具架构快照,对数据清洗与格式统一提出了严峻的技术挑战。
常用场景
经典使用场景
GLM-5.2-Agent数据集的核心价值在于为智能体(Agent)的轨迹学习与行为建模提供了高质量的训练数据。在自然语言处理与人工智能系统深度融合的当下,该数据集捕获了GLM-5.2模型在与环境交互过程中产生的完整会话轨迹,涵盖bash命令执行、文件编辑与读写等典型工具调用行为。研究者可利用这些结构化的agent traces,训练大语言模型掌握任务规划、工具选择与多步推理能力,从而推动从静态文本生成向动态任务执行的范式跃迁。该数据集尤其适用于构建能够理解和执行复杂指令的自主智能体系统,是agent对齐、行为克隆与策略蒸馏研究的重要基石。
实际应用
在实际应用层面,GLM-5.2-Agent数据集可赋能自动化编程助手、智能运维系统和交互式数据分析平台等产品。以软件开发场景为例,训练数据中丰富的命令行与编辑器交互经验,使微调后的模型能够自主完成代码编写、测试执行、错误修复等全链路任务。数据集内嵌的MCP(Model Context Protocol)工具描述与权限状态快照,确保了agent在生产环境中安全且合规地调用外部资源。企业可基于该数据集构建私有化的智能体,在DevOps流水线、客户支持或文档生成等高频场景中显著降低人工介入成本,提升工作效率。
衍生相关工作
围绕GLM-5.2-Agent数据集,衍生出了一系列具有里程碑意义的研究工作。基于teich框架的数据准备工具链催生了诸如行为克隆(Behavioral Cloning)与强化学习从人类反馈(RLHF)在agent领域的变体,研究者利用其标准化格式开展了工具使用泛化能力的对比实验。此外,数据集附带的训练就绪工具schema快照,激励了关于动态工具发现与复合API调用的元学习研究。部分工作聚焦于利用该数据集的屏蔽system消息(包含技能、hook上下文等)进行会话压缩与长程记忆增强,而跨会话轨迹的混合学习则推动了多任务agent的联合训练策略探索,显著丰富了智能体知识蒸馏的理论与实践方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务