遇见数据集

gene-ml-systems-instruct

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

ml-systems-instruct v16是一个专注于机器学习系统(ml-systems)领域的合成指令数据集,包含795条高质量记录。该数据集通过严格的六阶段质量门控流程生成:初始生成、批判性编辑修订、LLM评判、对抗性二次评判、证据验证(每条保留的数据都包含可验证的来源引用)以及代码片段的沙箱执行。数据集包含13种任务类型,主要包括概念问答(133条)、特征提取(98条)、使用问题(88条)、代码解释(78条)、实现草图(74条)、比较(74条)和故障排除(70条)等。每条数据都携带完整的来源追溯信息,确保可重现性——通过manifest.json文件可以字节级重现完全相同的数据集(经SHA-256验证)。数据集适用于文本生成和问答任务,特别适合用于机器学习系统相关的指令微调、模型评估和研究。

ml-systems-instruct v16 is a synthetic instruction dataset focused on the field of machine learning systems (ml-systems), containing 795 high-quality records. The dataset is generated through a rigorous six-stage quality gate process: initial generation, critical editing and revision, LLM evaluation, adversarial secondary evaluation, evidence verification (each retained data point includes verifiable source citations), and sandbox execution of code snippets. The dataset includes 13 task types, mainly concept Q&A (133 records), feature extraction (98), usage questions (88), code explanation (78), implementation sketches (74), comparison (74), and troubleshooting (70). Each data point carries complete source traceability information to ensure reproducibility—through the manifest.json file, the exact same dataset can be reproduced at the byte level (verified by SHA-256). The dataset is suitable for text generation and Q&A tasks, particularly for instruction fine-tuning, model evaluation, and research related to machine learning systems.

创建时间:
2026-06-12
原始信息汇总

数据集概述:ml-systems-instruct v16

基本信息

  • 名称: ml-systems-instruct (v16)
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 领域: 机器学习系统 (ml-systems)
  • 类型: 合成数据 (synthetic)
  • 记录数量: 795条
  • 创建时间: 2026-06-21T15:32:39+00:00
  • SHA-256: 550398aa89033c9888cb4eec371d3994255edd236f3dedcc8505342a98aff760
  • 数据量级: n<1K (小于1000条)

任务类型

  • text-generation (文本生成)
  • question-answering (问答)

标签: gene-pipeline, provenance, synthetic, ml-systems, llm-judge-gated


数据构成与任务分布

数据集包含14种任务类型,具体分布如下:

任务类型 数量
conceptual-qa (概念问答) 133
feature-extraction (特征提取) 98
usage-question (使用问题) 88
code-explanation (代码解释) 78
implementation-sketch (实现草图) 74
comparison (比较) 74
troubleshooting (故障排除) 70
problem-statement (问题陈述) 40
method-explanation (方法解释) 33
summarization (摘要) 30
limitations-analysis (局限性分析) 30
title-generation (标题生成) 27
general (通用) 10
future-work (未来工作) 10

质量控制与评分

  • 生成模型: Qwen3-4B-Instruct-2507-Q4_K_M.gguf (llama后端)

  • 评判分数: 全部795条经过评判,平均0.989,最低0.817,最高1.000 (基于 grounded/useful/clear 标准,并验证来源引用)

  • 质量关卡:

    • 795/795条携带已验证的来源引用
    • 248/795条通过对抗性审查
    • 351条经过编辑优化
    • 2/19条代码片段在沙箱中成功执行
  • 过滤器参数: {"min_quality": 0.55, "limit": 1000, "source": null, "backend": "llama", "min_judge": 0.7}


数据来源与可复现性

  • 数据构建流程: 使用 Gene 流水线 (v2.0.0),该流水线优先保证来源可追溯 (provenance-first)。数据来源包括 ArXiv、GitHub 和 Hugging Face (仅限宽松许可协议)。
  • 生成阶段: 合成样例需通过六阶段门控:生成 → 评论与修订编辑 → LLM评判 → 对抗性二次评判 → 证据验证 (每条数据携带可验证的来源引用) → 代码沙箱执行。
  • 可复现: data.jsonl 中每条记录均携带来源/出处信息。manifest.json 记录了精确的记录ID,使用命令 gene rebuild --manifest manifest.json 可按字节精确再生数据集 (SHA-256验证)。
搜集汇总
数据集介绍
gene-ml-systems-instruct 数据集图片
构建方式
ml-systems-instruct数据集由Gene流水线构建,这是一套以可溯源为首要原则的训练数据处理流程。其数据源从ArXiv、GitHub与Hugging Face平台收集,仅采用宽松许可协议下的资料。生成过程历经六道质量闸门:初始生成后,经批判与修正的编辑环节,随后由语言模型法官进行初次评判,再经第二轮对抗性法官复核,每条保留的示例均需携带可验证的源文本引用以确保证据确凿,最后对代码类内容执行沙箱化运行测试。所有记录经由清单文件固化,通过SHA-256校验确保数据集可逐字节重现。
特点
该数据集聚焦机器学习系统领域,涵盖概念问答、特征提取、代码解释等14类任务,总计795条高质量示例。其核心特点在于严苛的质量控制体系:所有样本均通过平均评分高达0.989的法官模型审核,其中248条经受住对抗性审查,351条经编辑优化,代码执行成功率虽仅约10.5%,但每条样本均携带可验证的源引用,确保了事实基础与可信度。数据集在来源透明性与可复现性上表现突出,每条记录均可追溯至原始素材。
使用方法
数据集以data.jsonl格式存储,每条记录均包含完整的来源与溯源信息。用户可通过配套的manifest.json文件锁定具体记录标识,并运行`gene rebuild --manifest manifest.json`命令来精确复现当前版本的数据集,其SHA-256哈希值已预置以供验证。数据集适用于文本生成与问答任务的微调与评估,尤其适合需要高可信度来源支撑的机器学习系统相关场景。若需定制化的数据集构建服务,可在仓库中提交问题或联系维护者。
背景与挑战
背景概述
ml-systems-instruct数据集于2026年6月由Gene管道创建,专注于机器学习系统领域的指令数据,旨在为大型语言模型提供高质量、可验证的合成训练样本。该数据集由795条记录组成,覆盖概念问答、特征提取、代码解释等14种任务类型,每条样本均经过严格的质量门控和来源验证。其核心研究问题在于如何通过自动化流程生成既具领域深度又具可靠性的指令数据,以提升模型在ML系统相关任务上的表现。该数据集在合成数据生成领域具有重要影响,尤其为关注数据来源可追溯性和质量控制的社区提供了范例。
当前挑战
该数据集主要解决两大挑战:其一,ML系统领域内高质量指令数据的稀缺性,现有数据集往往缺乏领域特异性或存在噪声,难以支撑模型对复杂系统概念的准确理解;其二,合成数据构建中的质量控制难题,包括确保生成样本的语义准确性、来源可验证性以及代码可执行性。具体而言,数据集构建面临证据引用必须真实存在于源文档、对抗性审核过滤低质样本、以及沙箱执行验证代码正确性等工程挑战,这些步骤显著增加了数据生产的成本和复杂性。
常用场景
经典使用场景
ml-systems-instruct数据集汇聚了795条经过严格质量门控的合成指令数据,专为机器学习系统(ml-systems)领域设计。其经典使用场景聚焦于微调大语言模型,使其能够出色地完成机器学习系统相关的概念问答、特征提取、用法咨询、代码解释、实现草图、技术对比、故障排查、问题陈述、方法阐释、摘要生成、局限性分析等多元化任务。研究人员可利用该数据集训练模型深入理解MLOps、模型部署、分布式训练、推理优化等专业子领域,从而提升模型在工程技术层面上的语言理解与生成能力。
衍生相关工作
该数据集的诞生催生了若干具有启发意义的衍生工作。其基于Gene管线的可复现构建理念——通过manifest.json文件锁定的字节级精确复现机制——为后续数据集的标准化构建与版本管理树立了典范。六阶段质量门控体系,特别是结合LLM裁判与对抗性验证的复合评估策略,启发了学术界对指令数据自动生成与自动化质检流程的深入探索。证据验证环节要求每对数据携带可验证源引用的设计,推动了可溯源训练数据的研究,影响了一系列关于数据可信度与模型输出可靠性的交叉研究工作。
数据集最近研究
最新研究方向
该数据集聚焦于机器学习系统领域的高质量指令微调数据合成与质量控制,采用基于大语言模型的多级评分门控机制(LLM Judge),通过生成、评审、修订、对抗性审核及证据验证等六阶段流水线,确保每条数据的真实性和可复现性。研究前沿在于将数据溯源(Provenance)与合成数据伦理相结合,利用SHA-256哈希锁定完整数据集,实现字节级精确再生,为构建可信赖的AI训练数据基础设施提供了新范式。此外,代码沙箱执行验证的引入,标志着从文本一致性迈向功能正确性的重要跃升,对提高机器学习系统相关问答与代码理解的可靠性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务