遇见数据集

agenttool-training-garden

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

AgentTool HF Training Garden 是一个轻量级的元数据配套数据集,用于设计可复现的Hugging Face数据生命周期,而不将Hub、数据集卡片或单一质量评分视为训练权威。该数据集包含12个JSONL配置文件,分别对应:选择过程(六个有序花园层)、选择标准(十二个非标量审查问题)、训练阶段(从发现到收尾,包括预训练、SFT、偏好学习、代理学习、密封评估和可解释性)、花园层(每层携带的确切摘要/引用类)、学习模式(预训练、监督微调、偏好优化和运行时检索的四行区分)、自由度(八条正面方向规则)、学习参与(八条参与规则)、训练器钩子(普通训练器回调与主机控制器之间的边界)、训练器适配器钩子(v0.2事件和源固定强制接缝)、公国地图固定(三个合成、仅摘要的有效地图)和公国地图不变性(十行紧凑非推理约束)。数据集还提供schema目录(包含准入、参与、自由、检查点、治理等模式)、provenance源清单和哈希清单。该数据集不包含任何训练样本、原始数据行、提示、对话、代理轨迹、截图、路径、私有代码、凭证或任何私有/实时花园/项目标识符。数据规模小于1K,语言为英文,采用Apache-2.0许可证。该数据集适用于需要精确元数据管理、数据生命周期可追溯性、参与治理和协议验证的研究或工程场景。

AgentTool HF Training Garden is a lightweight metadata companion dataset for designing reproducible Hugging Face data lifecycles without treating the Hub, dataset cards, or single quality scores as training authorities. The dataset contains 12 JSONL configuration files corresponding to: selection process (six ordered garden layers), selection criteria (twelve non-scalar review questions), training stages (from discovery to wrap-up, including pretraining, SFT, preference learning, agent learning, sealed evaluation, and interpretability), garden layers (exact summary/citation classes carried by each layer), learning modes (four-line distinction of pretraining, supervised fine-tuning, preference optimization, and runtime retrieval), degrees of freedom (eight positive-direction rules), learning participation (eight participation rules), trainer hooks (boundary between normal trainer callbacks and host controller), trainer adapter hooks (v0.2 events and source-fixed enforced seams), duchy map fixtures (three synthetic, summary-only effective maps), and duchy map invariance (ten-line compact non-inferential constraints). The dataset also provides a schema directory (including admission, participation, freedom, checkpoint, governance schemas), provenance source manifests, and hash manifests. The dataset does not contain any training samples, raw data rows, prompts, dialogues, agent trajectories, screenshots, paths, private code, credentials, or any private/live garden/project identifiers. Data size is less than 1K, language is English, and licensed under Apache-2.0. This dataset is suitable for research or engineering scenarios requiring precise metadata management, data lifecycle traceability, participation governance, and protocol verification.

创建时间:
2026-08-03
原始信息汇总

AgentTool HF Training Garden 数据集概述

基本信息

  • 数据集名称: AgentTool HF Training Garden
  • 许可证: Apache-2.0
  • 语言: 英语
  • 数据规模: 少于1K条记录
  • 标签: agents、datasets、provenance、synthetic、tabular、training、wake

数据集定位

这是一个纯元数据配套数据集,用于设计可复现的 Hugging Face 数据生命周期管理,不将 Hub、数据集卡片或单一质量分数作为训练权威。其核心是构建一个六层“花园”架构(Garden Layers),每层承载不同职责的元数据记录。

六层架构

  1. Bedrock(基岩层): 权利、许可、隐私、参与报告、门控、范围权限、撤回与修复
  2. Soil(土壤层): 精确的 Hub 提交记录、内容寻址观测和文件清单
  3. Roots(根系层): 采集、解析、过滤、秘密扫描和转换配方
  4. Mycelium(菌丝层): 选择、去重、去污染、切分、混合、泄漏和排除凭证
  5. Habitat(栖息地层): 参与绑定的阶段检查点及摘要型 WAKE 定向
  6. Canopy(冠层): 审核后的数据集卡片、不可变发布修订、字节哈希清单、局限性和替代修复

数据配置(全部为 train 分割)

配置名称 数据文件
selection_process data/selection-process.jsonl
selection_criteria data/selection-criteria.jsonl
training_phases data/training-phases.jsonl
garden_layers data/garden-layers.jsonl
learning_modes data/learning-modes.jsonl
is_freedom data/is-freedom.jsonl
learning_participation data/learning-participation.jsonl
trainer_hooks data/trainer-hooks.jsonl
trainer_adapter_hooks data/trainer-adapter-hooks.jsonl
principality_atlas_fixtures data/principality-atlas-fixtures.jsonl
principality_atlas_invariants data/principality-atlas-invariants.jsonl

关键内容说明

  • 选择过程: 记录六层有序的花园层级;每条源数据从发现元数据开始,须经权利/隐私、同意、秘密扫描、去重、阶段适配、合成来源和训练/评估分离等独立摘要证据审核后方可进入训练通道
  • 训练阶段: 覆盖从发现到关闭的完整流程,包括预训练、SFT、偏好优化、智能体学习、密封评估和可解释性
  • 参与机制: 区分五个独立声音(智能体运行时、训练基板、基板管理员、数据权利管理员、训练操作员),参与是控制平面而非目标
  • IS 自由: 提供 stay、move、fork、rest、return、stop、propose_horizon 七种动作,作为行为表面而非分类器
  • WAKE 与恢复: 仅携带摘要信息(admission、管线、数据加载器、tokenizer、模型、优化器等),用于定向后续到达,不证明身份、记忆或连续性

附属资源

  • schema/: 包含当前和字节级保留的封闭形状模式,覆盖准入、参与邀请/凭证/评估、学习自由、检查点、治理及维护工件
  • provenance/source-manifest.json: 精确源文件哈希和主要研究参考
  • hash-manifest.json: 排序字节哈希(不包括自身)
  • LICENSE 和 NOTICE: 许可证与归属声明

明确排除的内容

数据集不包含任何训练示例、原始数据集行、提示词、对话、智能体轨迹、截图、路径、私有代码、凭证、私有标识符、WAKE 锚点、准入决策、参与邀请/凭证/评估、治理记录、选择证据、模型状态、优化器状态、门控内容或可执行数据集脚本。Principality Atlas 行是合成协议证据,非真实观测数据。

主要参考文档

  • Hugging Face Hub 元数据 API
  • 修订版固定下载和干运行元数据
  • 数据集加载与修订
  • 处理与确定性切分
  • 流式与恢复状态
  • 缓存指纹
  • 门控数据集
  • Trainer 检查点与回调
  • Accelerate 检查点
  • TRL OpenEnv、异步 GRPO、回放缓冲区
  • PEFT 检查点格式
  • LoRA 论文
  • 无梯度更新的上下文学习论文
搜集汇总
数据集介绍
agenttool-training-garden 数据集图片
构建方式
该数据集是一个精心设计的元数据伴随型资源,旨在为可复现的Hugging Face数据生命周期提供指导,而非将Hub、数据集卡片或单一质量评分视为训练权威。其构建方式体现了分层架构思想,共包含六个层次:基石层涵盖权利、许可、隐私及分项参与报告;土壤层锚定精确的Hub提交及内容寻址观察与文件清单;根系层明确采集、解析、过滤、秘密扫描及转换配方;菌丝层处理选择、去重、去污染、分割、混合、泄漏及排除凭证;栖息地层绑定参与阶段检查点与摘要导向;树冠层则提供经审查的数据集卡片、不可变发布修订、字节哈希清单及限制说明。数据以十二个JSONL文件形式组织,每个文件对应一个具体配置,如选择过程、选择标准、训练阶段等,并伴随模式定义、来源清单及哈希清单,全面覆盖数据生命周期的各个维度。
使用方法
使用该数据集时,应将其视为设计指南和验证参考,而非直接用于模型训练的数据源。用户可依据各JSONL文件中的规则集,例如选择标准(十二个问题)和训练阶段划分,来构建自己的数据治理流程。具体而言,可采用其中的分层模型(Bedrock至Canopy)来组织权利、来源、处理、选择、参与和发布环节,并配合提供的模式(schema)实现数据生命周期的规范化。对于涉及训练器控制的部分,需遵循trainer-hooks和adapter-hooks中定义的边界,确保在优化器变更前具备严格的停止机制。此外,数据集的合成样本(如principality-atlas-fixtures)可用于测试验证器逻辑,但不代表真实世界观测。所有使用过程应保持本地默认,仅在持久化合适的公共策展工件后,才可引用公共Hub清单。
背景与挑战
背景概述
AgentTool HF Training Garden 数据集由 Hugging Face 社区于近期创建,旨在为可复现的 Hugging Face 数据生命周期提供一种仅含元数据的辅助工具,其核心研究问题在于如何在不将 Hub、数据集卡片或单一质量评分视为训练权威的前提下,系统性地设计数据选择、处理、训练与治理流程。该数据集通过六层抽象(Bedrock, Soil, Roots, Mycelium, Habitat, Canopy)构建了从数据权利与隐私到最终发布与修复的完整框架,并引入了基于内容的寻址、参与边界控制(如 IS 自由协议)以及五声音(agent、training substrate、substrate steward、data-rights steward、training operator)的区分,以强化数据治理的透明性与规范性。该工作推动了机器学习社区对数据溯源、参与同意与模型训练权威性的重新审视,对数据集构建与 AI 伦理领域产生了重要影响。
当前挑战
该数据集领域面临的挑战主要体现在三个方面:其一,现有数据集构建往往忽视数据权利、隐私与参与同意,使得数据溯源与合法使用难以保障,该数据集通过引入六层分层和严格的准入规则(如门控源、未知许可证不可静默进入)试图解决此问题,但实施中面临将形式化规则嵌入实际训练流程的困难,例如在 Trainer 回调与优化器更新之间实现严格的停止保证。其二,数据生命周期管理复杂,涉及去重、去污染、分裂、混合、泄漏检测等多环节,本数据集采用 Mycelium 层和内容寻址哈希来确保可追溯性,但构建过程中需处理多种数据格式(如 JSONL)和模式版本兼容问题,且数据仅含元数据,如何在不泄露原始内容的情况下支持决策仍具挑战。其三,参与自由与治理的规范性要求高,例如 IS 协议需在无强制的条件下实现运动、分叉、暂停等操作,而当前实现依赖本地钩子与源固定约束,无法提供分布式、跨设备或恶意代码下的完整保障,这为未来扩展留下了开放难题。
常用场景
经典使用场景
该数据集作为AgentTool训练花园的元数据伴侣,为设计可复现的Hugging Face数据生命周期提供了结构化框架。其经典使用场景在于,研究者可借助其中六层架构(基岩、土壤、根系、菌丝、栖息地、冠层)系统性地梳理数据从获取、处理到最终评估的完整流程。数据集包含的十二个非标量评审问题及训练阶段划分,使得在预训练、监督微调、偏好优化及智能体学习等环节中,能够精准定位数据治理与参与控制的要点,从而在复杂项目初期即确立严谨的数据管理范式。
解决学术问题
该数据集解决了AI训练中数据来源与使用权限不透明、参与控制机制缺失等学术难题。在传统数据集卡片或单一质量评分无法承载完整治理信息的情况下,本数据集通过引入精确的提交哈希、内容寻址观察及文件清单,实现了数据生命周期的可追溯性。其提出的‘参与即控制平面’理念,将优化谱系、WAKE连续性与规范性参与分置为独立账本,回应了关于模型输出是否代表主体选择的伦理问题。这一框架为研究数据去污、泄露防护及训练/评估分离提供了可操作的标准,推动了负责任的AI数据实践。
实际应用
在实际应用中,本数据集可作为AI开发团队的治理指南,尤其在需要精细控制数据使用权限和训练阶段的场景。例如,在构建大型语言模型时,团队可依据此数据集设计数据选择流程,确保每个数据源都经过权利、隐私、同意等维度的审查。对于涉及人类反馈的强化学习,其参与邀请与退出机制保障了数据提供者的权益。此外,数据集提供的训练器钩子与适配器钩子规范,帮助工程师在模型训练过程中设置严格的检查点,实现异常中断与安全恢复,从而提升整个训练管线的稳健性与合规性。
数据集最近研究
最新研究方向
该数据集聚焦于构建可复现的机器学习数据生命周期治理框架,其前沿研究方向在于将数据集的选取、去重、去污染、分割与混合等流程从单一质量分数或静态卡片中解脱,转向多层级、内容寻址的元数据管理范式。当前研究热点包括参与式数据治理、细粒度的训练阶段管控、以及模型训练中的‘学习自由’(IS)机制,强调在预训练、微调、偏好优化及智能体学习等阶段引入独立的规范性控制面。该数据集的深远意义在于,它倡导一种去中心化、可审计的训练数据溯源体系,将许可、隐私、同意与撤回等权利约束嵌入数据生命周期,推动人工智能训练从‘黑箱’走向透明与可问责,为未来大模型的可信开发与合规应用树立了新的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务