gene-ml-systems-instruct
收藏资源简介:
ml-systems-instruct v16是一个专注于机器学习系统(ml-systems)领域的合成指令数据集,包含795条高质量记录。该数据集通过严格的六阶段质量门控流程生成:初始生成、批判性编辑修订、LLM评判、对抗性二次评判、证据验证(每条保留的数据都包含可验证的来源引用)以及代码片段的沙箱执行。数据集包含13种任务类型,主要包括概念问答(133条)、特征提取(98条)、使用问题(88条)、代码解释(78条)、实现草图(74条)、比较(74条)和故障排除(70条)等。每条数据都携带完整的来源追溯信息,确保可重现性——通过manifest.json文件可以字节级重现完全相同的数据集(经SHA-256验证)。数据集适用于文本生成和问答任务,特别适合用于机器学习系统相关的指令微调、模型评估和研究。
ml-systems-instruct v16 is a synthetic instruction dataset focused on the field of machine learning systems (ml-systems), containing 795 high-quality records. The dataset is generated through a rigorous six-stage quality gate process: initial generation, critical editing and revision, LLM evaluation, adversarial secondary evaluation, evidence verification (each retained data point includes verifiable source citations), and sandbox execution of code snippets. The dataset includes 13 task types, mainly concept Q&A (133 records), feature extraction (98), usage questions (88), code explanation (78), implementation sketches (74), comparison (74), and troubleshooting (70). Each data point carries complete source traceability information to ensure reproducibility—through the manifest.json file, the exact same dataset can be reproduced at the byte level (verified by SHA-256). The dataset is suitable for text generation and Q&A tasks, particularly for instruction fine-tuning, model evaluation, and research related to machine learning systems.
数据集概述:ml-systems-instruct v16
基本信息
- 名称: ml-systems-instruct (v16)
- 许可证: CC-BY-4.0
- 语言: 英语
- 领域: 机器学习系统 (ml-systems)
- 类型: 合成数据 (synthetic)
- 记录数量: 795条
- 创建时间: 2026-06-21T15:32:39+00:00
- SHA-256:
550398aa89033c9888cb4eec371d3994255edd236f3dedcc8505342a98aff760 - 数据量级: n<1K (小于1000条)
任务类型
- text-generation (文本生成)
- question-answering (问答)
标签: gene-pipeline, provenance, synthetic, ml-systems, llm-judge-gated
数据构成与任务分布
数据集包含14种任务类型,具体分布如下:
| 任务类型 | 数量 |
|---|---|
| conceptual-qa (概念问答) | 133 |
| feature-extraction (特征提取) | 98 |
| usage-question (使用问题) | 88 |
| code-explanation (代码解释) | 78 |
| implementation-sketch (实现草图) | 74 |
| comparison (比较) | 74 |
| troubleshooting (故障排除) | 70 |
| problem-statement (问题陈述) | 40 |
| method-explanation (方法解释) | 33 |
| summarization (摘要) | 30 |
| limitations-analysis (局限性分析) | 30 |
| title-generation (标题生成) | 27 |
| general (通用) | 10 |
| future-work (未来工作) | 10 |
质量控制与评分
-
生成模型: Qwen3-4B-Instruct-2507-Q4_K_M.gguf (llama后端)
-
评判分数: 全部795条经过评判,平均0.989,最低0.817,最高1.000 (基于 grounded/useful/clear 标准,并验证来源引用)
-
质量关卡:
- 795/795条携带已验证的来源引用
- 248/795条通过对抗性审查
- 351条经过编辑优化
- 2/19条代码片段在沙箱中成功执行
-
过滤器参数:
{"min_quality": 0.55, "limit": 1000, "source": null, "backend": "llama", "min_judge": 0.7}
数据来源与可复现性
- 数据构建流程: 使用 Gene 流水线 (v2.0.0),该流水线优先保证来源可追溯 (provenance-first)。数据来源包括 ArXiv、GitHub 和 Hugging Face (仅限宽松许可协议)。
- 生成阶段: 合成样例需通过六阶段门控:生成 → 评论与修订编辑 → LLM评判 → 对抗性二次评判 → 证据验证 (每条数据携带可验证的来源引用) → 代码沙箱执行。
- 可复现:
data.jsonl中每条记录均携带来源/出处信息。manifest.json记录了精确的记录ID,使用命令gene rebuild --manifest manifest.json可按字节精确再生数据集 (SHA-256验证)。




