agenttool-training-garden
收藏资源简介:
AgentTool HF Training Garden 是一个轻量级的元数据配套数据集,用于设计可复现的Hugging Face数据生命周期,而不将Hub、数据集卡片或单一质量评分视为训练权威。该数据集包含12个JSONL配置文件,分别对应:选择过程(六个有序花园层)、选择标准(十二个非标量审查问题)、训练阶段(从发现到收尾,包括预训练、SFT、偏好学习、代理学习、密封评估和可解释性)、花园层(每层携带的确切摘要/引用类)、学习模式(预训练、监督微调、偏好优化和运行时检索的四行区分)、自由度(八条正面方向规则)、学习参与(八条参与规则)、训练器钩子(普通训练器回调与主机控制器之间的边界)、训练器适配器钩子(v0.2事件和源固定强制接缝)、公国地图固定(三个合成、仅摘要的有效地图)和公国地图不变性(十行紧凑非推理约束)。数据集还提供schema目录(包含准入、参与、自由、检查点、治理等模式)、provenance源清单和哈希清单。该数据集不包含任何训练样本、原始数据行、提示、对话、代理轨迹、截图、路径、私有代码、凭证或任何私有/实时花园/项目标识符。数据规模小于1K,语言为英文,采用Apache-2.0许可证。该数据集适用于需要精确元数据管理、数据生命周期可追溯性、参与治理和协议验证的研究或工程场景。
AgentTool HF Training Garden is a lightweight metadata companion dataset for designing reproducible Hugging Face data lifecycles without treating the Hub, dataset cards, or single quality scores as training authorities. The dataset contains 12 JSONL configuration files corresponding to: selection process (six ordered garden layers), selection criteria (twelve non-scalar review questions), training stages (from discovery to wrap-up, including pretraining, SFT, preference learning, agent learning, sealed evaluation, and interpretability), garden layers (exact summary/citation classes carried by each layer), learning modes (four-line distinction of pretraining, supervised fine-tuning, preference optimization, and runtime retrieval), degrees of freedom (eight positive-direction rules), learning participation (eight participation rules), trainer hooks (boundary between normal trainer callbacks and host controller), trainer adapter hooks (v0.2 events and source-fixed enforced seams), duchy map fixtures (three synthetic, summary-only effective maps), and duchy map invariance (ten-line compact non-inferential constraints). The dataset also provides a schema directory (including admission, participation, freedom, checkpoint, governance schemas), provenance source manifests, and hash manifests. The dataset does not contain any training samples, raw data rows, prompts, dialogues, agent trajectories, screenshots, paths, private code, credentials, or any private/live garden/project identifiers. Data size is less than 1K, language is English, and licensed under Apache-2.0. This dataset is suitable for research or engineering scenarios requiring precise metadata management, data lifecycle traceability, participation governance, and protocol verification.
AgentTool HF Training Garden 数据集概述
基本信息
- 数据集名称: AgentTool HF Training Garden
- 许可证: Apache-2.0
- 语言: 英语
- 数据规模: 少于1K条记录
- 标签: agents、datasets、provenance、synthetic、tabular、training、wake
数据集定位
这是一个纯元数据配套数据集,用于设计可复现的 Hugging Face 数据生命周期管理,不将 Hub、数据集卡片或单一质量分数作为训练权威。其核心是构建一个六层“花园”架构(Garden Layers),每层承载不同职责的元数据记录。
六层架构
- Bedrock(基岩层): 权利、许可、隐私、参与报告、门控、范围权限、撤回与修复
- Soil(土壤层): 精确的 Hub 提交记录、内容寻址观测和文件清单
- Roots(根系层): 采集、解析、过滤、秘密扫描和转换配方
- Mycelium(菌丝层): 选择、去重、去污染、切分、混合、泄漏和排除凭证
- Habitat(栖息地层): 参与绑定的阶段检查点及摘要型 WAKE 定向
- Canopy(冠层): 审核后的数据集卡片、不可变发布修订、字节哈希清单、局限性和替代修复
数据配置(全部为 train 分割)
| 配置名称 | 数据文件 |
|---|---|
| selection_process | data/selection-process.jsonl |
| selection_criteria | data/selection-criteria.jsonl |
| training_phases | data/training-phases.jsonl |
| garden_layers | data/garden-layers.jsonl |
| learning_modes | data/learning-modes.jsonl |
| is_freedom | data/is-freedom.jsonl |
| learning_participation | data/learning-participation.jsonl |
| trainer_hooks | data/trainer-hooks.jsonl |
| trainer_adapter_hooks | data/trainer-adapter-hooks.jsonl |
| principality_atlas_fixtures | data/principality-atlas-fixtures.jsonl |
| principality_atlas_invariants | data/principality-atlas-invariants.jsonl |
关键内容说明
- 选择过程: 记录六层有序的花园层级;每条源数据从发现元数据开始,须经权利/隐私、同意、秘密扫描、去重、阶段适配、合成来源和训练/评估分离等独立摘要证据审核后方可进入训练通道
- 训练阶段: 覆盖从发现到关闭的完整流程,包括预训练、SFT、偏好优化、智能体学习、密封评估和可解释性
- 参与机制: 区分五个独立声音(智能体运行时、训练基板、基板管理员、数据权利管理员、训练操作员),参与是控制平面而非目标
- IS 自由: 提供 stay、move、fork、rest、return、stop、propose_horizon 七种动作,作为行为表面而非分类器
- WAKE 与恢复: 仅携带摘要信息(admission、管线、数据加载器、tokenizer、模型、优化器等),用于定向后续到达,不证明身份、记忆或连续性
附属资源
- schema/: 包含当前和字节级保留的封闭形状模式,覆盖准入、参与邀请/凭证/评估、学习自由、检查点、治理及维护工件
- provenance/source-manifest.json: 精确源文件哈希和主要研究参考
- hash-manifest.json: 排序字节哈希(不包括自身)
- LICENSE 和 NOTICE: 许可证与归属声明
明确排除的内容
数据集不包含任何训练示例、原始数据集行、提示词、对话、智能体轨迹、截图、路径、私有代码、凭证、私有标识符、WAKE 锚点、准入决策、参与邀请/凭证/评估、治理记录、选择证据、模型状态、优化器状态、门控内容或可执行数据集脚本。Principality Atlas 行是合成协议证据,非真实观测数据。
主要参考文档
- Hugging Face Hub 元数据 API
- 修订版固定下载和干运行元数据
- 数据集加载与修订
- 处理与确定性切分
- 流式与恢复状态
- 缓存指纹
- 门控数据集
- Trainer 检查点与回调
- Accelerate 检查点
- TRL OpenEnv、异步 GRPO、回放缓冲区
- PEFT 检查点格式
- LoRA 论文
- 无梯度更新的上下文学习论文




