遇见数据集

Agriculture-Agent-RL-Training-Data

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集是一个用于自然/再生农业领域 LLM 智能体的强化学习(RL)轨迹数据集,由 Copyleft Cultivars 组织发布,是该集合中首个 RL/轨迹形状的数据集。数据集包含智能体在执行真实工具调用(尤其是植物基因组学 MCP 服务器 cultivars-mcp)时的完整对话记录,涵盖 9 个知识类别(农业生态学、再生农业、有机农业、土壤科学与微生物学、综合农业系统、天然肥料、可持续水资源管理、永续农业、土著与传统知识),其中土著知识类别包含 10 个子主题。每个记录由多组件奖励函数评分,评估工具使用正确性、LLM 判断的内容质量、对土著知识内容的结构性引用要求以及反本质化检查。数据集以增量方式发布,每次运行生成管道会在 data/train/ 和 data/val/ 下添加新文件,现有数据不会被覆盖。截至 2026-08-10,数据集包含 225 条记录,来自三个不同策略模型(lfm2.5 5B、nous:tencent/hy3:free、Gemini 3.5 Flash)的轨迹,每个批次由同一模型自我评判。记录格式为 {prompt: [...], completion: [...], reward: float, task: category, info: {...}},与 verifiers 库原生 rollout 约定一致,可直接用于 TRL 的 GRPOTrainer 或任何 verifiers 兼容的 RL 循环进行微调。次要用途是定性审查,允许检查智能体在 9 个知识类别中的推理和工具使用过程。数据集不适用于评估或基准测试(已进行污染检查),土著知识内容未经社区验证(review_status 默认为 unreviewed),且当前规模较小(约 225 条),不适合直接训练或部署模型。数据集采用 Hippocratic License 3.0 CL-ECO-EXTR-MIL 许可证,特别包含保护土著人民土地和传统知识的条款。

This dataset is a reinforcement learning (RL) trajectory dataset for LLM agents in the field of natural/regenerative agriculture, released by Copyleft Cultivars. It is the first RL/trajectory-shaped dataset in this collection. The dataset contains complete conversation records of agents executing real tool calls (especially the plant genomics MCP server cultivars-mcp), covering 9 knowledge categories (agroecology, regenerative agriculture, organic agriculture, soil science and microbiology, integrated farming systems, natural fertilizers, sustainable water management, permaculture, indigenous and traditional knowledge), with the indigenous knowledge category containing 10 sub-topics. Each record is scored by a multi-component reward function that evaluates tool usage correctness, LLM-judged content quality, structural citation requirements for indigenous knowledge content, and anti-essentialization checks. The dataset is released incrementally; each run of the generation pipeline adds new files under data/train/ and data/val/ without overwriting existing data. As of 2026-08-10, the dataset contains 225 records from trajectories of three different policy models (lfm2.5 5B, nous:tencent/hy3:free, Gemini 3.5 Flash), with each batch self-judged by the same model. The record format is {prompt: [...], completion: [...], reward: float, task: category, info: {...}}, consistent with the verifiers librarys native rollout convention, and can be directly used with TRLs GRPOTrainer or any verifiers-compatible RL loop for fine-tuning. A secondary use is qualitative review, allowing inspection of agent reasoning and tool usage across the 9 knowledge categories. The dataset is not suitable for evaluation or benchmarking (contamination checks have been performed), indigenous knowledge content has not been community-validated (review_status defaults to unreviewed), and the current size is small (approximately 225 records), making it unsuitable for direct training or deployment of models. The dataset is licensed under Hippocratic License 3.0 CL-ECO-EXTR-MIL, which specifically includes clauses protecting indigenous peoples lands and traditional knowledge.

创建时间:
2026-08-10
原始信息汇总

Agriculture Agent RL Training Data 数据集概述

数据集地址: https://huggingface.co/datasets/CopyleftCultivars/Agriculture-Agent-RL-Training-Data

数据集定位

这是 Copyleft Cultivars 系列中首个面向强化学习(RL)轨迹训练的数据集,专门用于自然农业与再生农业场景下的 LLM 智能体训练。数据包含智能体调用真实工具(主要为植物基因组学 MCP 服务器 cultivars-mcp)的完整轨迹,覆盖 10 个知识类别,并采用多组件奖励机制(工具使用正确性、LLM 评判的内容质量、原住民知识结构化引用要求及反本质主义检查)。

规模与构成

截至 2026-08-11 快照,共 3,610 条记录,来自四个生成源(均为自评判):

生成源 模型 记录数 备注
lfm2.5 本地 5B(Ollama 加速) 567 覆盖全部原始类别及 10 个原住民知识子主题
Hermes CLI nous:tencent/hy3:free(云免费层) 1,790 额外覆盖较新的有机化学-土壤科学类别
Antigravity/agy Gemini 3.5 Flash (Medium) 1,218 仅限无工具形状(farmer_dialoguescenario_critique
qwen3.6 本地 35B-A3B MoE(llama.cpp) 35(持续增长) 推理模型,产出流速较慢

按类别分布(前五):原住民与传统知识 1,693 条;土壤科学与微生物学 283 条;综合耕作系统 277 条;天然肥料 276 条;永续农业 266 条。

主要用途

  • 主要用途 —— RL 微调:记录格式(prompt/completion/reward/task/info)与 verifiers 库原生回滚约定一致,可直接加载至 TRL GRPOTrainerverifiers 兼容的 RL 循环,适合在 SFT 检查点之上进行 GRPO 训练。
  • 次要用途 —— 定性审查:每条记录为完整对话转写(系统/用户/助手/工具轮次),便于观察智能体的推理过程和工具使用方式。

重要已知限制

  • 奖励不可跨源比较:所有源均为自评判,其中 Antigravity/agy 源 99.6% 记录获得满分(reward=1.0),明显高于其他源的 57-62%,存在评判自偏好偏差;lfm2.5 的评判器则表现出噪声。
  • 不应用于评估/基准测试:导出时已与兄弟基准集 nf-benchmark-eval 做过污染检查,仅作训练集使用。
  • 原住民知识内容未经验证:所有相关记录的 review_status 默认为 "unreviewed",仅基于文献而非社区咨询,需谨慎用于面向用户的场景。
  • 数据持续增量增长:每次生成管道运行都会在 data/train/data/val/ 下新增文件,不覆盖旧数据;所有记录物理上加载为单一 HF train 分割,需通过 info.local_split 字段区分原始训练/验证意图。

许可与伦理

采用 Hippocratic License 3.0, CL-ECO-EXTR-MIL,特别包含保护原住民土地和传统知识免遭未经同意使用的条款(§3.1.10)。数据集不声称直接咨询原住民社区,所有原住民知识断言须携带 Crossref 验证的引用,或由成功工具调用支撑,否则会在导出时被排除。

来源与生态

数据由 SolshineCode/Agriculture-Agent-RL-Training-Data 仓库中的管道生成,四个生成路径共享相同的种子生成步骤、奖励规则和污染过滤器。在 Copyleft Cultivars 生态中,cultivars-mcp 提供植物基因组学工具调用,nf-benchmark-eval 提供类别分类体系与污染检查目标,qwen3-finetune 用于后续 GRPO 训练的自然下游消费。数据集支持增量扩展,贡献者可通过源仓库中的生成管道提交新数据,无需直接编辑数据集。

搜集汇总
数据集介绍
Agriculture-Agent-RL-Training-Data 数据集图片
构建方式
该数据集是首个面向自然/再生农业领域的强化学习轨迹数据集,由Copyleft Cultivars组织构建。其构建过程依托一个自动化生成管道,通过不同策略模型(如lfm2.5、hy3:free、Gemini 3.5 Flash)调用真实工具(主要为植物基因组学MCP服务器cultivars-mcp)生成智能体与环境交互的完整轨迹。每条记录包含提示、完成序列、奖励分数、任务类别及元信息,并经过多组件奖励函数评估(工具使用正确性、内容质量、引用结构及反本质化检查)。数据以增量方式发布,每次运行仅新增文件而不覆盖旧数据,确保数据集的持续扩充。
特点
该数据集具有独特优势:覆盖9大知识类别和10个原住民知识子主题,确保领域全面性;每条记录为完整交互轨迹,不仅包含问答对,还保留了系统、用户、助手及工具调用的多轮对话,便于深入分析智能体推理与工具使用模式。数据经过严格的污染检查,与基准评估数据集隔离,保证训练数据的纯净性。原住民知识内容强制附有Crossref验证的引用,并标记审查状态,体现伦理严谨性。此外,数据集兼容verifiers库及TRL GRPOTrainer,可直接用于强化学习微调。
使用方法
该数据集的主要用途是强化学习微调,可直接加载至TRL GRPOTrainer或verifiers兼容的RL循环中,无需格式转换。其记录结构与verifiers库的原生rollout约定一致,简化了训练流程。次要用途是定性审查,通过完整转录轨迹观察智能体在9大类别中的推理和工具使用行为。然而,数据集不可用于评估或基准测试,因其已针对基准集进行污染检查。原住民知识内容不可视为社区验证,使用前需阅读伦理政策。当前规模约224条,仍处于早期阶段,建议在SFT模型基础上进行GRPO训练以发挥其价值。
背景与挑战
背景概述
Agriculture-Agent-RL-Training-Data由Copyleft Cultivars组织于2026年8月创建,旨在为自然农业和再生农业领域的LLM代理提供强化学习训练轨迹数据。该数据集是首个采用RL/轨迹格式的数据集,区别于组织之前发布的SFT对话数据集。它通过调用真实的植物基因组学工具(如cultivars-mcp),覆盖9个知识类别,并引入多组件奖励机制(包括工具使用正确性、内容质量、引用结构以及反本质主义检查),以促进代理在农业决策中的可靠性和可追溯性。该数据集由不同规模的政策模型(如5B的lfm2.5、hy3:free和Gemini 3.5 Flash)生成,并通过自评判保证奖励一致性。其发布填补了农业领域LLM代理RL训练数据的空白,为后续GRPO微调提供了基础,同时强调了对本土知识的引用溯源和伦理约束,对推动AI在可持续农业中的应用具有重要意义。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性:自然农业和再生农业涉及多学科交叉,知识类别涵盖土壤科学、微生物学、水资源管理等多个方向,且需整合本土知识,而本土知识的主观性和文化敏感性对模型训练提出了高标准要求,需要避免文化挪用和刻板印象,确保知识引用的准确性和尊重性。其次,构建过程中面临多重技术难题:数据生成依赖多模型组合,每个批次由相同模型自评判,缺乏更强模型的交叉验证,可能导致奖励信号偏差;数据集设计为可增长式,但当前仅有约225条记录,规模有限,且物理上全部分布在train split,需通过info.local_split字段区分原始train/val划分,增加了使用复杂性。此外,每个记录需进行污染检查以避免与评估基准重叠,但自评判机制和团队资源限制使得优化空间受限,需要持续扩展数据和引入外部评审以保证数据质量和模型训练的稳健性。
常用场景
经典使用场景
Agriculture-Agent-RL-Training-Data是首个专为强化学习(RL)设计的农业智能体轨迹数据集,其经典应用场景聚焦于对大型语言模型(LLM)智能体进行RL微调,特别是在自然农业和再生农业领域。该数据集记录智能体调用真实工具(如cultivars-mcp植物基因组学服务器)的完整轨迹,包含九大知识类别,并采用多组件奖励函数(工具使用正确性、内容质量、引用结构及反本质主义检查)进行评分。其数据格式与verifiers库原生rollout格式兼容,可直接用于TRL的GRPOTrainer或任何兼容的RL循环,实现无需格式转换的直接加载,为农业领域智能体的策略优化提供了标准化的训练资源。
实际应用
在实际应用层面,该数据集可用于开发农业智能助手,辅助农户和农学家进行可持续农业实践的决策支持。通过RL微调,智能体能够学习如何根据土壤微生物、水资源管理等具体情境,提供定制化建议,并在交互中主动询问澄清问题,提升建议的精准性和实用性。此外,该数据集的定性审查功能(每条记录为完整转录)使研究者能够分析智能体的推理路径和工具调用模式,优化人机协作界面。其衍生模型有望部署于农业咨询平台、智能灌溉系统或作物管理应用中,促进再生农业和传统知识的科学融合。
衍生相关工作
该数据集的发布催生了多项衍生工作。其一,作为GRPO训练的基石,支持在SFT检查点之上进行RLHF流程,进一步优化模型对齐能力。其二,数据集中的轨迹数据被用于开发推理增强的农业问答系统,结合llm-judge评估机制,探索模型自我反思与修正策略。其三,其开创性的反本质主义检查与引用验证机制,启发了其他领域(如医学、法律)处理敏感知识时的数据集构建范式。此外,基于该数据的研究推动了跨模型泛化研究,例如比较不同策略模型(lfm2.5、hy3:free、Gemini)在同一任务上的表现差异,促进了多模型协作与知识迁移的探讨,并为后续更大规模、更广泛知识覆盖的农业智能体训练奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务