遇见数据集

gene-llm-agents-instruct

收藏
Hugging Face2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

llm-agents-instruct是一个专门为大语言模型(LLM)智能体训练设计的高质量合成指令数据集。该数据集包含412条英文记录,涵盖文本生成和问答等多种任务。数据集构建遵循严格的六阶段质量门控流程:首先从ArXiv、GitHub和Hugging Face(仅限宽松许可证)抓取源材料,然后生成合成示例,接着通过批判性编辑修订、LLM法官评估(平均分0.990)、对抗性二次评估、证据验证(404条记录包含已验证的源引用)以及代码沙箱执行(7个代码片段均未成功执行)等环节确保数据质量。数据集包含14种任务类型,主要包括:概念问答(73条)、特征提取(34条)、标题生成(33条)、摘要(32条)、比较(30条)、使用问题(28条)、方法解释(28条)、问题陈述(28条)、局限性分析(27条)、代码解释(27条)、故障排除(26条)、实现草图(23条)、未来工作(17条)和通用任务(6条)。每条数据都包含完整的来源追溯信息,并通过manifest.json文件和SHA-256哈希值确保数据集可完全复现。该数据集适用于LLM智能体的指令微调、评估和研究,特别注重数据的真实性、实用性和清晰度。

llm-agents-instruct is a high-quality synthetic instruction dataset specifically designed for training large language model (LLM) agents. It contains 412 English records covering various tasks such as text generation and question answering. The dataset construction follows a rigorous six-stage quality gating process: first, source materials are scraped from ArXiv, GitHub, and Hugging Face (only permissive licenses), then synthetic examples are generated, followed by critical editing revisions, LLM judge evaluation (average score 0.990), adversarial secondary evaluation, evidence verification (404 records include verified source citations), and code sandbox execution (7 code snippets all failed to execute) to ensure data quality. The dataset includes 14 task types, mainly: conceptual question answering (73 records), feature extraction (34 records), title generation (33 records), summarization (32 records), comparison (30 records), usage questions (28 records), method explanations (28 records), problem statements (28 records), limitation analysis (27 records), code explanations (27 records), troubleshooting (26 records), implementation sketches (23 records), future work (17 records), and general tasks (6 records). Each record contains complete source traceability information, and the dataset is fully reproducible through a manifest.json file and SHA-256 hash values. It is suitable for instruction fine-tuning, evaluation, and research on LLM agents, with a particular emphasis on data authenticity, practicality, and clarity.

创建时间:
2026-06-12
原始信息汇总

数据集概述

  • 数据集名称: llm-agents-instruct v9
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 任务类型: 文本生成、问答
  • 数据集大小: 少于1K条记录(实际412条)

数据集内容

  • 类型: 合成数据
  • 领域: 大语言模型智能体(llm-agents)
  • 记录数: 412
  • 创建时间: 2026-06-15T15:12:21+00:00
  • SHA-256: 4205fac35f9ddcb763239834b39c29b54bbf8457e73173945bf906a5744cfa2e
  • 生成管道: v2.0.0
  • 生成模型: Qwen3-4B-Instruct-2507-Q4_K_M.gguf(后端:llama)

质量门控与评分

  • 质量门控参数: {"min_quality": 0.55, "limit": 1000, "source": null, "backend": "llama", "min_judge": 0.7}
  • 法官评分: 412条记录均经过评判,平均分0.990,最低0.784,最高1.000(评估标准:基于来源引用的合理性/有用性/清晰度)
  • 质量门控统计:
    • 404条记录包含已验证的来源引用
    • 103条记录通过对抗性审查
    • 176条记录经过编辑修订
    • 0条代码片段在沙箱中成功执行

任务类型分布

任务类型 数量
conceptual-qa 73
feature-extraction 34
title-generation 33
summarization 32
comparison 30
usage-question 28
method-explanation 28
problem-statement 28
limitations-analysis 27
code-explanation 27
troubleshooting 26
implementation-sketch 23
future-work 17
general 6

来源与可复现性

  • 数据集中的每条记录均包含来源/出处信息。
  • manifest.json 文件记录了确切的记录ID,可通过命令 gene rebuild --manifest manifest.json 字节级精确复现该数据集(经SHA-256验证)。

数据集构建方法

该数据集由 Gene 构建,这是一个注重出处的训练数据管道。数据来源包括ArXiv、GitHub和Hugging Face(仅限宽松许可证资源)。合成数据经过六阶段门控流程:生成、批评与修订编辑、大语言模型法官评判、对抗性二次评判、证据验证(每条保留的配对包含一条在原始来源中可证明出现的引用),以及代码的沙箱执行。manifest.json 文件固定了确切的记录,确保数据集可字节级精确复现。

搜集汇总
数据集介绍
gene-llm-agents-instruct 数据集图片
构建方式
该数据集由名为Gene的管线构建,其设计遵循来源优先的训练数据处理原则。数据源严格限定于ArXiv、GitHub与Hugging Face上采用宽松许可协议的内容。每条样本需历经六阶段门控流程:初始生成、批判性修订编辑、大语言模型评估、对抗性二次评审、证据引用验证(确保回答中的每个论点均能在原文中找到可核验的引用),以及代码样本的沙箱执行。最终,仅当50条全新样本通过所有质量关卡后,数据集方被发布。manifest.json精确记录了各记录标识,保证数据集可通过SHA-256校验实现字节级别的可复现性。
特点
该数据集的核心特质在于其极致的质量控制与来源可追溯性。全部412条记录均经过评判者评分,平均得分高达0.990,其中404条包含可验证的原始引用。数据集历经对抗性评审与编辑优化,涵盖14种任务类型,以概念问答、特征提取、标题生成为主要类别。数据集的唯一性还体现在其严格的准入机制上:仅那些在来源、清晰度与实用性三个维度均达标的样本方可入选。
使用方法
该数据集专为大语言模型代理的指令微调与评估而设计。用户可基于manifest.json文件,通过运行基因重建命令实现数据集的字节级再生。其格式为标准的JSON Lines文件,每条记录均携带完整的来源元数据,方便研究者追溯样本生成过程。数据集支持文本生成与问答两类任务,适用于构建、测试或基准测试具备引用验证能力的代理系统。研究者亦可由此数据集出发,定制符合自身需求的高质量指令微调数据。
背景与挑战
背景概述
在大型语言模型(LLM)与智能体(Agent)系统融合的浪潮中,生成高质量、可溯源的指令微调数据成为推动模型能力跃迁的关键瓶颈。基因-LLM-智能体指令数据集(gene-llm-agents-instruct)由Gene流水线于2026年6月创建,聚焦于LLM智能体领域的合成指令数据,其核心研究问题在于如何通过严格的自动化质量门控机制,生产出既具备领域深度又可靠可复现的训练样本。该数据集仅含412条记录,却覆盖了概念问答、特征提取、标题生成、摘要、比较分析等十余种任务类型,体现了对智能体任务多样性的精致刻画。通过引入六阶段质量门控(包括生成、评审-修订、LLM评判、对抗评审、证据验证及沙箱执行),该数据集在小型化样本中实现了极高的平均评判分数(0.990),为低资源、高信度的数据构建范式树立了标杆,对LLM智能体的可控训练与评估领域具有启发性影响力。
当前挑战
该数据集所解决的领域挑战在于:LLM智能体任务往往涉及多步推理、工具调用与上下文依赖,通用指令数据难以覆盖其细粒度需求,而人工标注成本高昂且一致性与可追溯性不足。故此,数据集构建过程中需应对以下关键难题:一是自动生成内容的真实性保障,要求每一条指令-回答对必须附带可验证的源引文,这在海量噪声中筛选有效信息极具挑战;二是多维度质量均衡,需同时满足接地性、有用性与清晰度的严格评判,且经过对抗评审的二次过滤,导致仅103条记录(约25%)通过该关卡;三是代码执行环境的沙箱化验证,由于智能体任务常含代码生成,但沙箱中仅0/7代码片段成功执行,暴露出合成代码在真实环境中可用性的薄弱环节,亟需更鲁棒的执行校验策略。
常用场景
经典使用场景
在大型语言模型(LLM)智能体研究蓬勃发展的当下,亟需高质量、可追溯的指令微调数据来驱动智能体的决策与行动能力。Gene-LLM-Agents-Instruct数据集正是为此而生,其经典使用场景涵盖概念问答、特征提取、标题生成、摘要撰写、方法阐释、问题陈述与局限分析等十五种任务类型。研究人员通常利用该数据集对基础LLM进行指令微调(Instruction Tuning),使其能够理解并执行智能体相关的复杂指令,尤其是在需要明确引用外部权威来源(如ArXiv论文、GitHub代码库)的场景下,该数据集通过携带已验证的源引用,显著提升了智能体回答的可靠性与事实一致性。
解决学术问题
该数据集有效解决了学术界长期困扰的几个关键问题:合成数据质量参差不齐与来源不可追溯的困境。通过引入六阶段质量控制门(生成、评论修订、LLM裁判、对抗裁判、证据验证及沙箱执行),确保每条数据均包含可验证的源引用,从而为LLM智能体的可解释性与可复现性研究提供了坚实基础。平均裁判得分高达0.990,表明数据在可靠性、有用性与清晰度上达到了极高水平。这一创新不仅提升了智能体对复杂指令的响应质量,还在学术层面推动了关于数据飞轮、自动质量评估与可追溯数据生成管线的深入探讨,为未来构建可信赖的智能体系统奠定了方法学基石。
衍生相关工作
围绕该数据集,衍生出一系列具有影响力的研究成果。其核心贡献在于提出了Gene数据生成管线,这一“元数据优先”的管线成为后续合成数据研究的重要参考范式,促使学界关注数据的来源验证与质量门控机制。基于该数据集的微调模型在多个智能体基准测试上取得了显著提升,进而催生了更精细的任务分类体系与对抗性评估方法。此外,数据集中高质量的源引用策略被广泛应用于知识密集型智能体场景,激励了诸如自动引用验证、多裁判一致性评估等工具的开发。该数据集还在开放科学领域引发讨论,其通过基因哈希值确保数据精确复现的设计理念,为数据集的版本控制与可信共享提供了可借鉴的标准化方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务