gene-speech-audio-instruct
收藏官方服务:
资源简介:
speech-audio-instruct v3是一个用于语音音频领域的合成指令数据集,包含139条经过严格质量筛选的记录。该数据集通过Gene管道生成,该管道采用六阶段质量门控流程:生成、编辑修订、LLM评判、对抗性二次评判、证据验证(每条记录都包含可验证的源引用)和代码沙箱执行。数据来源于ArXiv、GitHub和Hugging Face(仅限宽松许可内容)。数据集涵盖多种任务类型,包括概念问答(21条)、方法解释(17条)、标题生成(17条)、问题陈述(14条)、摘要(14条)、局限性分析(13条)、未来工作(12条)、实现草图(7条)、使用问题(5条)、特征提取(5条)、故障排除(4条)、代码解释(4条)、比较(3条)和通用任务(3条)。数据集具有完整的来源追溯和可重现性,通过manifest.json文件可确保字节级一致的重现(SHA-256验证)。适用于文本生成和问答等任务。
创建时间:
2026-06-18
原始信息汇总
数据集概述:speech-audio-instruct v3
- 名称:speech-audio-instruct v3
- 许可证:CC-BY-4.0
- 语言:英语
- 类别:文本生成、问答
- 规模:少于1000条记录
- 标签:gene-pipeline、provenance、synthetic、speech-audio、llm-judge-gated
数据集详情
- 类型:合成数据
- 领域:语音-音频(speech-audio)
- 记录数:139条
- 创建时间:2026-06-25T15:25:34+00:00
- SHA-256 校验码:
c388150c1632b511928f0569229ed89fa9d28953fe4c9ae44811f8ed4eaf45d2 - 生成管线:v2.0.0
- 过滤器设置:
{"min_quality": 0.55, "limit": 1000, "source": null, "backend": "llama", "min_judge": 0.7} - 生成模型:Qwen3-4B-Instruct-2507-Q4_K_M.gguf(后端:llama)
- 评判分数:139/139 条被评判,平均分 0.988,最低 0.867,最高 1.000(基于 grounded/useful/clear 评分标准,并附有可验证的源引用)
- 质量门控:
- 139/139 条携带可验证的源引用
- 56/139 条通过对抗性审查
- 60 条经过编辑环节改进
- 0/1 条代码在沙箱中成功执行
任务类型分布
- conceptual-qa:21
- method-explanation:17
- title-generation:17
- problem-statement:14
- summarization:14
- limitations-analysis:13
- future-work:12
- implementation-sketch:7
- usage-question:5
- feature-extraction:5
- troubleshooting:4
- code-explanation:4
- comparison:3
- general:3
数据来源与可复现性
- 每条数据均携带其来源/出处信息。
manifest.json文件记录了确切的记录 ID,可通过gene rebuild --manifest manifest.json命令按字节完全复现该数据集(经 SHA-256 校验)。
数据集构建方式
该数据集由 Gene 构建,Gene 是一个注重出处的训练数据管线。数据来源从 ArXiv、GitHub 和 Hugging Face(仅使用宽松许可的内容)中抓取。合成的示例经过六阶段门控流程:生成、批判与修改编辑环节、LLM 评判、对抗性第二评判、证据验证(每条保留的样本均包含一段在其来源中可验证的引用内容),以及代码的沙箱执行。manifest.json 文件锁定了确切的记录,使数据集可字节完全复现(经 SHA-256 校验)。
搜集汇总
数据集介绍

构建方式
本数据集名为gene-speech-audio-instruct,是Gene流水线在语料溯源优先原则下构建的合成指令数据。其构建过程历经六阶段严格门控:首先从ArXiv、GitHub及Hugging Face等平台抓取采用宽松许可证的源材料,随后通过大语言模型Qwen3-4B-Instruct生成候选示例,并经过批评-修订式编辑润色、LLM评分器初筛、对抗性二次审核、引用证据验证(确保每对指令-回答均包含可溯源至原文的引用片段),以及代码沙箱执行测试。最终,仅有139条通过全部质检阈值(最低质量分0.55、评判分最低0.7)的样本获准发布,且通过manifest.json锁定记录标识符,支持基于SHA-256校验的字节级精确复现。
特点
该数据集专注于语音-音频领域,包含139条高质量合成指令,平均评判分数高达0.988(满分1.0),最低分亦有0.867,体现了极严格的质检标准。其任务类型覆盖概念问答、方法解释、标题生成、问题陈述、摘要、局限性分析、未来工作、实现草图、用法询问、特征提取、故障排除、代码解释、比较研究及通用问答等14个类别,结构多元。所有样本均附带源自原始材料的可验证引用,其中56条经受住了对抗性审核考验,60条经编辑优化,确保了内容的真实性与专业性,适合用于语音-音频领域的大模型指令微调与评估。
使用方法
用户可直接从HuggingFace数据集页面加载gene-speech-audio-instruct,其数据以data.jsonl格式存储,每行包含完整的指令、回答及溯源信息。如需复现数据集,可通过执行命令`gene rebuild --manifest manifest.json`,利用Gene流水线从锁定的记录标识符中再生出与原版字节完全一致的数据(经SHA-256验证)。该数据集适用于文本生成与问答任务,研究者可将其作为高质量种子数据,用于增强语音-音频领域的大模型指令遵循能力,或作为基准测试集评估模型在该领域专业问答上的表现。
背景与挑战
背景概述
语音音频指令数据集在自然语言处理与语音交互领域扮演着不可或缺的角色,它们为构建能够理解并响应复杂语音查询的智能系统提供了基础。在此背景下,gene-speech-audio-instruct数据集于2026年6月25日由Gene数据管线团队创建,旨在生成高质量的合成指令数据,以支持语音音频相关任务的微调与评估。该数据集通过严格的多阶段质量控制流程构建,共计139条记录,覆盖概念问答、方法解释、标题生成等多种任务类型。其所采用的来源可追溯性与门控质量机制,为合成数据在语音音频研究中的应用树立了新的标准,对于推动该领域的数据驱动方法具有重要的参考价值。
当前挑战
所解决的领域问题在于,现有语音音频指令数据往往存在质量问题,如来源不明、指令与上下文脱节,限制了模型在真实场景下的稳健性。该数据集通过引入证据引用验证与对抗性审查,挑战了传统数据清洗的局限性。构建过程中亦面临多重挑战,包括从ArXiv、GitHub及Hugging Face等平台获取许可合规的来源,设计并执行六阶段门控生成流程,以及确保每次生成的字节一致性以支持可复现性。此外,对代码片段的沙盒执行成功率仅为0/1,突显了在合成数据中集成可执行代码的工程难度,反映出当前技术在自动化验证方面的局限性。
常用场景
经典使用场景
在语音与音频处理领域,该数据集专为指令微调与生成式任务设计,尤其适用于构建能够理解并执行多样化语音-文本交互的智能助理系统。其核心使用场景包括概念问答、方法解释、标题生成、问题陈述、摘要撰写、局限性分析、未来工作规划以及实现草图等14类任务,覆盖从结构化知识检索到开放式内容创作的多层次需求。每条数据均经过严格的质量门控,确保指令与响应间具有可验证的源引用,从而为语音-音频对话系统的训练提供了可靠且多样化的语料基础。
解决学术问题
该数据集旨在解决语音与音频领域高质量指令数据稀缺且缺乏可复现性的学术困境。传统数据集常因来源不明、质量参差不齐而难以支撑严谨的科学研究;该数据集通过引入来源优先的流水线、多阶段质量门控(包括对抗性审查和LLM评分)以及SHA-256验证的可完全复现机制,系统性地提升了数据生成的可信度与透明度。这一框架为研究者提供了构建可审计、可复现训练数据的标准范式,尤其对语音-音频任务中的指令遵循能力评估、模型对齐以及少样本学习等研究问题具有重要推动作用。
衍生相关工作
该数据集的产生紧密关联于Gene流水线这一来源优先的数据生成框架,其衍生工作包括基于LLM评判器的质量过滤方法、对抗性审查机制以及可复现数据集的构建范式。受其启发,研究者可进一步探索如何将该流水线迁移至其他低资源模态(如触觉信号或生理信号),或将其与持续学习、主动学习等策略结合以动态扩充高质量指令数据。此外,该数据集提供的详细来源追踪和可复现性特性,也为后续研究数据污染检测、模型鲁棒性分析以及多模态对齐等课题奠定了可参照的基准。
以上内容由遇见数据集搜集并总结生成




