SpeechEditBench
收藏资源简介:
SpeechEditBench是一个用于指令引导语音编辑的双语基准数据集,评估系统在保持预期词汇内容的同时对源语音应用请求编辑的能力。该基准涵盖七个原子编辑任务和组合编辑任务。
SpeechEditBench is a bilingual benchmark dataset for instruction-guided speech editing, which evaluates the ability of systems to apply requested edits to source speech while preserving the intended lexical content. This benchmark covers seven atomic editing tasks and composite editing tasks.
SpeechEditBench 数据集概述
SpeechEditBench 是一个双语基准测试集,用于评估指令引导的语音编辑系统。它测试系统能否根据给定的编辑指令对源语音进行修改,同时保持预期的词汇内容。
任务类型
该基准涵盖七种原子编辑任务和一种组合编辑任务:
- 内容编辑 (content_editing)
- 说话人编辑 (speaker_editing)
- 情感编辑 (emotion_editing)
- 风格编辑 (style_editing)
- 韵律编辑 (prosody_editing)
- 副语言编辑 (paralinguistic_editing)
- 声学编辑 (acoustic_editing)
- 组合编辑 (compositional_editing)
数据规模
当前版本(v1.1)的发布清单记录显示,完整数据发布包含 4,700 个样本,覆盖 8 个任务,共 5,400 个音频文件。
数据获取
-
该GitHub仓库仅包含基准元数据、评估代码和文档。音频资产需从Hugging Face下载。
-
下载命令: bash python scripts/download_hf_dataset.py --repo-id DiscreteSpeech/SpeechEditBench --revision v1.1
-
下载后,数据目录结构为: text data/<task_id>/samples.jsonl data/<task_id>/audio/**
评估流程
- 模型输出格式:编辑后的音频需作为
.wav、.flac或.mp3文件保存。 - 输入信息:模型可见的输入是源音频路径、自然语言指令,以及(仅针对说话人编辑任务)说话人参考音频。
- 运行评估:
- 评估单个任务:
python scripts/run_eval.py --task <task_id> --output-dir <path> --model-name <name> - 评估所有任务:
python scripts/run_eval.py --task all --output-root <path> --model-name <name>
- 评估单个任务:
- 评估结果:会写入
eval_results/<model_name>/<task_id>/<eval_set>/目录下。
许可协议
- SpeechEditBench 的代码、文档、元数据和基准资产采用 Apache License 2.0 许可。
- 用户需遵守上游语音数据集的许可和条款。





