遇见数据集

gene-general-ml-instruct

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

general-ml-instruct v10是一个用于通用机器学习的门控通过指令数据集,包含230条高质量合成记录。该数据集专为文本生成和问答任务设计,采用CC-BY-4.0许可证发布。数据通过Gene管道系统生成,该系统采用来源追溯优先的方法:从ArXiv、GitHub和Hugging Face(仅限宽松许可证)抓取来源材料,合成示例需通过严格的六阶段质量门控流程,包括生成、批判与修订编辑、LLM评判、对抗性二次评判、证据验证(每条保留的数据对都包含可证明出现在其来源中的引用)以及代码片段的沙箱执行。数据集包含14种不同的任务类型,主要包括概念问答(49条)、特征提取(24条)、使用问题(24条)、实现草图(24条)、代码解释(21条)、问题陈述(16条)、摘要(14条)、比较(12条)、方法解释(11条)、故障排除(10条)、标题生成(10条)、局限性分析(7条)、未来工作(5条)和通用任务(3条)。所有记录都经过LLM评判,平均得分0.975(满分1.0),且全部携带已验证的来源引用。数据集通过manifest.json文件确保完全可复现性,能够通过指定命令字节级重建。

general-ml-instruct v10 is a quality-gated instruction dataset for general machine learning (general-ml), containing 230 high-quality synthetic records. This dataset is specifically designed for text generation and question answering tasks, and is released under the CC-BY-4.0 license. The dataset is generated via the Gene pipeline system, which adopts a source-trace-first methodology: it scrapes source materials from ArXiv, GitHub, and Hugging Face (with permissive licenses only), and synthetic examples must pass a rigorous six-stage quality gated process, including generation, critique and revision editing, LLM judging, adversarial secondary judging, evidence verification (each retained data pair includes verifiable citations appearing in its source material), and sandbox execution of code snippets. The dataset covers 14 distinct task types, mainly including conceptual QA (49 entries), feature extraction (24 entries), usage queries (24 entries), implementation sketches (24 entries), code explanation (21 entries), problem statement (16 entries), summarization (14 entries), comparison (12 entries), method explanation (11 entries), troubleshooting (10 entries), title generation (10 entries), limitation analysis (7 entries), future work (5 entries), and general tasks (3 entries). All records have been evaluated by LLMs, with an average score of 0.975 (out of 1.0), and all carry verified source citations. The dataset ensures full reproducibility via the manifest.json file, and can be reconstructed at the byte level through specified commands.

创建时间:
2026-06-12
原始信息汇总

数据集概述

  • 数据集名称:general-ml-instruct v11
  • 许可证:CC-BY-4.0
  • 语言:英语(en)
  • 任务类型:文本生成、问答
  • 数据集规模:n<1K(共280条记录)
  • 创建时间:2026-06-12T19:20:20+00:00
  • SHA-256指纹ab659aaf5d71f5db0e450bb72aa9dac8cf08da6d59b52f80216321132ab9edfa

数据来源与生成

  • 种类:合成数据(synthetic)
  • 领域:通用机器学习(general-ml)
  • 生成模型:Qwen3-4B-Instruct-2507-Q4_K_M.gguf(后端:llama)
  • 生成管线:Gene 管线(v2.0.0),一个以来源追溯为先的训练数据管线,数据来源包括 ArXiv、GitHub 和 Hugging Face(仅使用宽松许可证来源)。
  • 生成过滤条件{"min_quality": 0.55, "limit": 1000, "source": null, "backend": "llama", "min_judge": 0.7}

质量门控与评估

  • 质量门控流程:经过六阶段门控——生成、批评与修订的编辑环节、LLM 评判、对抗性二次评判、证据验证(每个保留的配对都包含一条可证明来源于其源文本的引用)、以及代码的沙盒执行。
  • 评判分数:280/280 条记录均经过评判,平均分 0.975,最低 0.784,最高 1.000(基于扎实性、有用性、清晰性的评分标准,并带有可验证的源引用)。
  • 门控通过情况
    • 280/280 条记录携带可验证的源引用
    • 167/280 条记录通过了对抗性评审
    • 107 条记录经过编辑环节改进
    • 0/6 条代码片段在沙盒中成功执行

任务类型分布

任务类型 数量
conceptual-qa (概念问答) 54
implementation-sketch (实现草图) 33
feature-extraction (特征提取) 31
code-explanation (代码解释) 30
usage-question (使用问题) 30
troubleshooting (故障排除) 17
comparison (比较) 17
problem-statement (问题陈述) 16
summarization (摘要) 14
method-explanation (方法解释) 11
title-generation (标题生成) 10
limitations-analysis (局限性分析) 7
future-work (未来工作) 5
general (通用) 5

数据来源与可复现性

  • 数据文件 data.jsonl 中的每条记录都携带其来源/出处信息。
  • manifest.json 文件记录了确切的记录 ID,通过命令 gene rebuild --manifest manifest.json 可字节完全一致地重新生成该数据集(SHA-256 验证)。
搜集汇总
数据集介绍
gene-general-ml-instruct 数据集图片
构建方式
该数据集依托于名为Gene的前瞻性训练数据流水线构建而成,强调来源可追溯性。数据源严格筛选自ArXiv、GitHub及Hugging Face等平台,仅采用具有宽松许可证的内容。生成过程历经精心设计的六阶段门控机制:首先进行合成样本的生成,随后进入批判与修订的编辑通道,接着依次经过大语言模型裁判与对抗性二次裁判的双重质量评估。每一留存样本均附带可验证的来源引用,确保信息有据可查。代码片段还需在沙盒环境中成功执行。最终,通过manifest.json文件精确锁定记录标识,实现数据集在字节级别上的完全可复现,并由SHA-256哈希值加以验证。
特点
该数据集共有280条经过严格质量门控的指令数据,专注于通用机器学习领域。所有样本均通过了基于真实性、实用性、清晰性三项标准的LLM裁判评估,平均得分高达0.975,最低0.784,展现了卓越的样本品质。数据集中包含54个概念问答、33个实现草图、31个特征提取等共计14种任务类型,覆盖广泛。尤为突出的是,每个样本都附带了可验证的来源引用,其中167条经受住了对抗性审查,107条经由编辑改进,确保了信息的真实可靠与内容的精炼。
使用方法
用户可通过加载data.jsonl文件直接获取指令与响应对,该文件每一行均携带有明确的来源与出处信息。复现数据集的操作极为简便,仅需执行`gene rebuild --manifest manifest.json`命令,即可依据manifest.json中锁定的记录ID精确还原出与原始数据字节完全一致的数据集,该过程由SHA-256哈希值提供一致性验证。数据集适用于文本生成与问答等多种自然语言处理任务,尤其适合作为通用机器学习领域模型微调或评估的高质量训练资源。
背景与挑战
背景概述
在人工智能领域,高质量指令数据的稀缺性长期制约着大语言模型在通用机器学习任务上的表现。gene-general-ml-instruct数据集由Gene管道于2026年6月创建,其核心研究问题聚焦于通过自动化、可复现的流程,生成经过严格质量把控的合成指令数据,以服务于general-ml领域的文本生成与问答任务。该数据集由280条记录构成,每条数据均通过六阶段质量门控,包括合成生成、编辑优化、双重法官评分、证据溯源及代码沙箱执行,确保提供可靠且细粒度的训练素材。其平均法官评分高达0.975,体现了在数据质量与可信度方面的领先优势。该数据集及其配套的Gene pipeline为开源社区提供了一种可验证的、溯源优先的数据构建范式,对推动合成数据的标准化与机器教学的可重复性研究具有重要影响力。
当前挑战
该数据集主要应对两大挑战。首先,在领域问题层面,通用机器学习任务(如概念问答、实现草图、代码解释)常面临训练数据中掺杂低质量、不准确或无法溯源内容的困境,传统人工标注难以规模化且易引入偏差。gene-general-ml数据集通过强制每条指令携带可验证的来源引用,并执行对抗性审查与编辑优化,为解决指令数据真实性与精确性不足的行业痛点提供了系统性方案。其次,在构建过程中,如何确保合成数据的质量一致性是一大技术挑战。Gene pipeline设计了由生成、编辑、双法官评审、证据核验及沙箱执行组成的六阶段流水线,其中仅167条通过对抗性审查、107条经编辑改进,且零代码片段在沙箱中成功执行,揭示了合成数据在逻辑正确性与执行可验证性上的脆弱性。这些挑战的克服依赖于多阶段质量门控的严格与自动化,并强调了可复现性在数据集构建中的核心地位。
常用场景
经典使用场景
在机器学习与自然语言处理的交叉领域中,该数据集被广泛用于微调预训练语言模型,使其能够精准理解和生成涵盖算法原理、特征提取、代码实现等主题的指令性内容。作为高质量、经过严格质量门控的综合机器学习指令数据集,研究者通常将其作为监督式微调的核心资源,训练模型在概念问答、实现草图、故障排查等多样化任务上展现出色的泛化能力。每条数据都附有可验证的源引用,确保了指令响应的事实准确性,为构建可靠的领域专用对话系统奠定了坚实基础。
解决学术问题
该数据集有效解决了机器学习指令数据生成中的两大核心难题:数据质量不可控与来源不可追溯。通过引入六阶段质量门控机制,包括对抗性评审、LLM评判及代码沙箱执行,数据集确保了响应的真实性与有用性,缓解了指令数据中常见的幻觉与谬误传播问题。同时,其基于ArXiv、GitHub和HuggingFace等平台构建的完整溯源链,为学术研究提供了可复现的数据基础。研究者得以在严格过滤的条件下探索指令微调策略,深入分析数据质量对模型行为的影响,推动了可信赖AI数据构建方法论的发展。
衍生相关工作
该数据集进一步催生了一系列关于数据高效微调与质量审计的经典工作。研究者基于其严格的六阶段门控流水线,提出了可复现的数据生成框架Gene,为后续合成数据集的构建树立了标杆。其对抗性评审与多重评判机制启发了数据质量自动评估方法的设计,衍生出面向指令数据集的事实一致性校验工具。围绕该数据集,学界还展开了关于小样本场景下指令微调效果的比较研究,以及不同门控过滤阈值对模型能力影响的系统分析,为构建稳健的AI训练数据生态提供了实践指导。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务