遇见数据集

yigagilbert/synthetic-parallel-external

收藏
Hugging Face2026-05-21 更新2026-05-31 收录
官方服务:

资源简介:

这是一个合成的平行语音数据集,专为卢干达语和英语之间的语音到语音翻译设计。它通过Hibiki-Zero微调流程生成,使用翻译模型(Sunbird/translate-nllb-3.3b-salt)和文本转语音模型(Sunbird/orpheus-3b-tts-multilingual)来创建语音对。数据集包含来自多个来源的转录本(如afrispeech-200、combined-audio-eng和cv24-lug-eng),并经过后处理步骤,包括静音修剪、时长过滤和语音活动检测。数据模式包括卢干达语和英语的音频剪辑、转录文本、说话人ID、时长信息以及来源数据集标识。该数据集支持多种说话人,并用于语音控制应用。

language: - 英语(en) - 卢干达语(lug) license: CC BY 4.0(知识共享署名4.0协议) task_categories: - 自动语音识别 - 机器翻译 pretty_name: 合成并行EN-LG(外部版) --- # 合成并行英卢双向语料库——外部版 本数据集为用于卢干达语(Luganda)-英语(English)语音转语音翻译的可控语音合成并行语料库,由Hibiki-Zero微调流水线生成。 ## 生成流程 | 组件 | 所用模型 | |-----------|-------| | 翻译模型 | `Sunbird/translate-nllb-3.3b-salt` | | 文本转语音(Text-to-Speech, TTS) | `Sunbird/orpheus-3b-tts-multilingual` | **英语发音人**:`salt_eng_0001, salt_eng_0002, salt_eng_0003` **卢干达语(Luganda)发音人**:`salt_lug_0001, waxal_lug_0001, waxal_lug_0002, waxal_lug_0003, waxal_lug_0004, waxal_lug_0005, waxal_lug_0007` **发音人采样策略**:每个文本对采样N个发音人,N ∈ {1 (70%), 2 (20%), 3 (10%)}。 ## 源数据集(仅保留转录文本,源音频已丢弃) - `evie-8/afrispeech-200`(子集:`default`,语言:英语(en)) - `yigagilbert/combined-audio-eng`(子集:`default`,语言:英语(en)) - `yigagilbert/cv24-lug-eng`(子集:`default`,语言:英语(en)) ## 后处理流程 - 对所有音频片段执行基于Silero与能量的语音活动检测(Voice Activity Detection, VAD)的静音剪切 - 时长过滤:卢干达语(Luganda)1.5–30.0 s,英语(English)1.0–30.0 s - 时长比例过滤:0.3–4.0 - 语音活跃度过滤:≥ 0.35 - 采样率:24000 Hz(单声道,float32 → PCM-16 WAV) ## 数据字段规范 | 字段名 | 数据类型 | 字段说明 | |--------|------|-------------| | `audio_lug` | 音频(Audio) | 卢干达语(Luganda)合成音频片段 | | `audio_eng` | 音频(Audio) | 英语(English)合成音频片段 | | `text_lug` | 字符串 | 卢干达语(Luganda)转录文本 | | `text_eng` | 字符串 | 英语(English)转录文本 | | `speaker_lug` | 字符串 | 卢干达语(Luganda)合成所用的Orpheus发音人ID | | `speaker_eng` | 字符串 | 英语(English)合成所用的Orpheus发音人ID | | `src_dur_s` | 浮点数 | VAD剪切后卢干达语(Luganda)音频片段时长(单位:秒) | | `tgt_dur_s` | 浮点数 | VAD剪切后英语(English)音频片段时长(单位:秒) | | `dur_ratio` | 浮点数 | 目标/源音频时长比例 | | `src_speech_ratio` | 浮点数 | VAD检测到的卢干达语(Luganda)语音占比 | | `tgt_speech_ratio` | 浮点数 | VAD检测到的英语(English)语音占比 | | `source_dataset` | 字符串 | 原始Hugging Face数据集仓库名称 | | `source_subset` | 字符串 | 原始数据集子集/配置名称 | ## 失败日志 经3次重试仍未通过语音合成(Text-to-Speech, TTS)或后处理流程的样本行,将被记录至:[https://huggingface.co/datasets/yigagilbert/synthetic-parallel-external/resolve/main/failure_manifest.jsonl](https://huggingface.co/datasets/yigagilbert/synthetic-parallel-external/resolve/main/failure_manifest.jsonl)

提供机构:
yigagilbert
二维码
社区交流群
二维码
科研交流群
商业服务