hermes-session-digests
收藏资源简介:
Hermes Session Digests 是一个结构化的事后摘要数据集,源自 Hermes AI 智能体的会话记录。每个摘要捕获了单次智能体会话中的目标、上下文、执行的操作、做出的决策、持久的经验学习、遇到的错误以及建议推广的目标内容。该数据集旨在服务于三个核心目的:作为 Hermes 驱动的知识管理系统的可搜索记忆流(规范知识库);当与原始智能体轨迹配对时,作为指令调优、智能体轨迹学习和检索增强生成(RAG)微调的训练数据(教师信号);以及作为人类可读、可对比、版本化的人工智能体行为与决策审计记录。数据集提供两种格式:完整的、人类可读的 Markdown 格式(包含 YAML 前言元数据,结构化的章节包括:目标、上下文、关键发现、采取的行动、决策、持久学习、推广目标)和机器可读的 JSON-Lines 格式(适用于训练流水线,每行一个会话的 JSON 对象)。所有摘要均在发布前经过了个人身份信息(PII)移除处理,以确保隐私安全。数据规模属于“小于1K”的类别。数据模式详细,Markdown 文件包含会话日期、模型、模型提供商、平台、项目、领域、类型和状态等元数据字段;JSON-Lines 文件则包含会话ID、时间戳、模型、决策列表、学习列表、行动列表、推广目标列表、识别出的系统缺陷列表和识别出的系统优势列表等结构化字段。该数据集适用于文本生成和强化学习等任务,特别是与智能体行为建模、知识提炼和基于会话历史的训练相关的研究与应用。
Hermes Session Digests is a structured post-hoc summary dataset derived from Hermes AI agent session logs. Each digest captures the goals, context, executed actions, decisions made, persistent experiential learnings, encountered errors, and suggested generalization goals from a single agent session. The dataset is designed to serve three core purposes: as a searchable memory stream (canonical knowledge base) for Hermes-powered knowledge management systems; as training data (teacher signal) for instruction tuning, agent trajectory learning, and retrieval-augmented generation (RAG) fine-tuning when paired with raw agent trajectories; and as human-readable, comparable, versioned audit logs of AI agent behavior and decision-making. The dataset is provided in two formats: a complete, human-readable Markdown format (with YAML frontmatter metadata, structured sections including: goals, context, key findings, actions taken, decisions, persistent learnings, generalization goals) and a machine-readable JSON-Lines format (suitable for training pipelines, with one JSON object per session line). All summaries have undergone personally identifiable information (PII) removal prior to release to ensure privacy. The data scale falls under the less than 1K category. The data schema is detailed: Markdown files include metadata fields such as session date, model, model provider, platform, project, domain, type, and status; JSON-Lines files contain structured fields like session ID, timestamp, model, decision list, learning list, action list, generalization goal list, identified system weaknesses list, and identified system strengths list. The dataset is suitable for tasks such as text generation and reinforcement learning, particularly research and applications related to agent behavior modeling, knowledge distillation, and training based on session history.
数据集概述:Hermes Session Digests
数据集名称:Hermes Session Digests
许可证:MIT
语言:英文
标签:agent-traces, session-digests, hermes, knowledge-base, training-data
数据集规模:少于 1,000 条记录
任务类型:文本生成,强化学习
数据集目的
- 构建规范化的知识库:摘要数据是 Hermes 知识管理系统的可检索记忆流。
- 作为训练数据:与原始代理轨迹配对时,摘要可作为指令微调、代理轨迹学习和 RAG 微调的教师信号。
- 支持审计:提供可读、可对比、版本化的记录,追踪代理的行为和决策。
数据格式
提供两种格式:
| 格式 | 路径 | 说明 |
|---|---|---|
| Markdown | digests/*.md |
完整人类可读摘要,包含 YAML 前置元数据,结构化章节:目标、上下文、关键发现、行动、决策、持久经验、提升目标。 |
| JSON-Lines | data/sessions.jsonl |
机器可读的结构化提取数据,每行一个 JSON 对象,适用于训练流程。字段包括:session_id, timestamp, model, decisions, learnings, actions, promotion targets 等。 |
模型过滤
所有会话都标注了生成该会话的模型。训练时可按模型过滤以避免风格不一致,示例代码:
python import json sessions = [json.loads(line) for line in open("data/sessions.jsonl")] deepseek_sessions = [s for s in sessions if s["model"] == "deepseek-v4-pro"]
隐私保护
所有摘要在发布前均经过 PII 移除处理:本地文件路径被泛化,临时进程 ID 被去除,频道名称被抽象化。不包含 API 密钥、令牌、电子邮件地址或任何个人标识符。
数据模式
Markdown 前置元数据字段
| 字段 | 描述 |
|---|---|
| session_date | 代理会话的 ISO 日期 |
| model | 生成代理响应的模型 |
| model_provider | 模型的 API 提供商 |
| platform | 消息平台 (discord, telegram, cli) |
| project | 主要项目上下文 |
| domain | 知识领域 |
| type | 始终为 session-digest |
| status | draft / active / canonical / archived |
JSON-Lines 字段
| 字段 | 类型 | 描述 |
|---|---|---|
| session_id | string | 唯一会话标识符 |
| timestamp | ISO datetime | 会话开始时间 |
| model | string | 代理模型 |
| decisions | string[] | 关键决策 |
| learnings | string[] | 持久经验 |
| actions_taken | string[] | 具体执行的操作 |
| promotion_targets | string[] | 推荐提升的页面 |
| gaps_identified | string[] | 发现的系统漏洞 |
| strengths_identified | string[] | 确认的系统优势 |
相关资源
- r0b0tlabbra1n — 配套的代理记忆系统
- QMD — 用于检索的本地混合搜索引擎




