遇见数据集

SpeechEditBench

收藏
github2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

SpeechEditBench是一个用于指令引导语音编辑的双语基准数据集,评估系统在保持预期词汇内容的同时对源语音应用请求编辑的能力。该基准涵盖七个原子编辑任务和组合编辑任务。

SpeechEditBench is a bilingual benchmark dataset for instruction-guided speech editing, which evaluates the ability of systems to apply requested edits to source speech while preserving the intended lexical content. This benchmark covers seven atomic editing tasks and composite editing tasks.

创建时间:
2026-06-02
原始信息汇总

SpeechEditBench 数据集概述

SpeechEditBench 是一个双语基准测试集,用于评估指令引导的语音编辑系统。它测试系统能否根据给定的编辑指令对源语音进行修改,同时保持预期的词汇内容。

任务类型

该基准涵盖七种原子编辑任务和一种组合编辑任务:

  • 内容编辑 (content_editing)
  • 说话人编辑 (speaker_editing)
  • 情感编辑 (emotion_editing)
  • 风格编辑 (style_editing)
  • 韵律编辑 (prosody_editing)
  • 副语言编辑 (paralinguistic_editing)
  • 声学编辑 (acoustic_editing)
  • 组合编辑 (compositional_editing)

数据规模

当前版本(v1.1)的发布清单记录显示,完整数据发布包含 4,700 个样本,覆盖 8 个任务,共 5,400 个音频文件

数据获取

  • 该GitHub仓库仅包含基准元数据、评估代码和文档。音频资产需从Hugging Face下载。

  • 下载命令: bash python scripts/download_hf_dataset.py --repo-id DiscreteSpeech/SpeechEditBench --revision v1.1

  • 下载后,数据目录结构为: text data/<task_id>/samples.jsonl data/<task_id>/audio/**

评估流程

  1. 模型输出格式:编辑后的音频需作为 .wav.flac.mp3 文件保存。
  2. 输入信息:模型可见的输入是源音频路径、自然语言指令,以及(仅针对说话人编辑任务)说话人参考音频。
  3. 运行评估
    • 评估单个任务:python scripts/run_eval.py --task <task_id> --output-dir <path> --model-name <name>
    • 评估所有任务:python scripts/run_eval.py --task all --output-root <path> --model-name <name>
  4. 评估结果:会写入 eval_results/<model_name>/<task_id>/<eval_set>/ 目录下。

许可协议

  • SpeechEditBench 的代码、文档、元数据和基准资产采用 Apache License 2.0 许可。
  • 用户需遵守上游语音数据集的许可和条款。
搜集汇总
数据集介绍
SpeechEditBench 数据集图片
构建方式
SpeechEditBench是一个面向指令引导式语音编辑的双语基准数据集,其构建过程严谨且系统。该基准涵盖七项原子编辑任务(包括内容编辑、说话人编辑、情感编辑、风格编辑、韵律编辑、副语言编辑及声学编辑)以及组合式编辑任务,总计包含4,700个样本与5,400个音频文件。数据集来源于多个上游语音语料库,通过精心设计的任务协议确保每个样本具有明确的源音频、自然语言编辑指令及评估标签。音频资产通过Hugging Face平台发布,而元数据与评估代码则托管于GitHub仓库,便于研究者进行详细审查与复现。
特点
该数据集的显著特点在于其双语特性与多属性覆盖能力,能够全面评估语音编辑系统在不同语言及声学属性上的编辑效果。数据集不仅包含内容层面的编辑,还深入刻画了说话人、情感、风格、韵律及副语言等细粒度声学特征,同时引入组合式编辑以模拟现实场景下的复杂需求。每个样本均提供精确的锚点字段与参考音频,确保了评估的客观性与可比性。此外,数据集采用标准化的目录结构与输出格式,支持多种音频格式,极大降低了模型集成与评估的门槛。
使用方法
使用者可通过Hugging Face命令行工具下载完整音频资产,随后依据任务ID将模型生成的编辑音频以指定格式存放于输出目录中。评估过程由统一的Python脚本驱动,支持单任务或全任务评估模式,并可根据需要切换中文或英文运行日志。系统内置多项外部评估模型(如Whisper、Paraformer等),开发者需参照文档预先下载并配置这些模型。最终结果以结构化目录形式输出,便于进行细致的性能分析与对比研究,同时支持严格模式以捕捉运行中的异常与错误。
背景与挑战
背景概述
语音编辑作为语音处理领域的前沿方向,旨在通过自然语言指令精准修改语音的特定属性,如内容、说话人、情感或韵律等。然而现有评估体系多聚焦于单一属性编辑任务,缺乏全面覆盖多种编辑类型及组合操作的基准。为填补这一空白,由多位研究者于2026年提出的SpeechEditBench应运而生,其核心研究问题在于构建一个系统化、标准化的双语基准,以评估语音编辑系统在保持词汇内容不变的前提下,按照指令执行编辑的能力。该基准由Zhang Hanlin、Tan Daxin等学者主导,涵盖了内容编辑、说话人编辑、情感编辑、风格编辑、韵律编辑、副语言编辑、声学编辑及组合编辑共八类任务,收录了4700个样本和5400个音频文件,为语音编辑领域的研究提供了权威的参考标尺。
当前挑战
SpeechEditBench所面临的挑战体现在多个层面。在领域问题层面,语音编辑评估需解决多属性编辑的复杂交互难题,例如在组合编辑中同时修改说话人、情感与内容时,如何区分各属性编辑的贡献并确保评估的公平性,同时避免模型利用未隐含的标注数据。在构建过程中,挑战同样显著:需从多个上游语料库中筛选和生成符合双语要求的语音数据,确保涵盖多样化的编辑场景与语言特征;还需设计精确的评估指标,如基于Whisper的词汇内容保持度、WavLM的声学特征一致性等,并协调外部评估模型(如UTMOS、DNSMOS)的集成与兼容,从而构建一个可靠、可复现的评估框架。
常用场景
经典使用场景
SpeechEditBench作为首个面向指令引导的语音编辑双语基准,其经典使用场景集中于系统性地评估语音编辑模型在多属性操控上的综合能力。该基准覆盖七项原子编辑任务——内容、说话人、情感、风格、韵律、副语言及声学编辑,并包含组合编辑场景,从而为研究者提供一个统一且标准化的测试平台。在典型评估流程中,模型需要依据自然语言指令对源语音执行特定编辑操作,同时确保编辑后语音的词汇内容保持完整,这为衡量模型在细粒度语音属性解耦与重组上的表现提供了可靠量规。
衍生相关工作
围绕SpeechEditBench已衍生出一系列具有启发性的后续工作。一方面,研究者基于该基准开发了多款端到端语音编辑系统,这些系统通过引入预训练语音表征或扩散模型来提升编辑精度与自然度,并在基准的七个任务上进行了系统性消融实验。另一方面,该基准的评估框架被移植到其他语音生成任务中,如语音转换与文本到语音合成,用于验证模型在多属性控制上的泛化能力。此外,基准发布的数据处理与度量脚本也催生了若干开源工具库,降低了新研究者进入该领域的门槛,并促进了社区驱动的标准化评测生态形成。
数据集最近研究
最新研究方向
SpeechEditBench作为首个双语多属性指令引导语音编辑基准,标志着语音编辑领域从单属性任务向组合式编辑的重大转型。当前前沿研究聚焦于原子编辑任务(如内容、韵律、副语言特征修改)与组合编辑的跨模态协同,尤其关注如何在大语言模型与语音生成模型融合的框架下实现精准指令解析与声学属性解耦。该基准的发布恰逢生成式AI监管加强的全球浪潮,其评估体系为衡量语音编辑系统的语义保真度与听觉自然度提供了关键标尺,有望推动语音人机交互在无障碍通信、影视后期及个性化语音助手等场景的伦理可控发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务