Synthetic-User-Turn-TTS
收藏资源简介:
该数据集是一个合成的马来西亚电信客服中心对话数据集,名称为“Synthetic Malaysian Telco Call-Centre Speech”。数据集中包含英语、马来语和中文三种语言,标签包括客服中心、电信、合成、文本转语音、语音转换等。数据集主要用于语音合成、语音转换以及客服中心相关任务的研究与开发。数据集包含多个子集:default(4260条文本对话)、dialogues_v2(7780条扩展文本对话)、synthetic(14.68小时合成语音)、synthetic_podcast(播客语音合成)、dialogues_normalized(12040条归一化文本)、dialogue_calls(3520个多轮通话片段)、hard_entities及其变体(处理困难实体的对话子集)。每个子集有详细字段定义,音频为24kHz单声道WAV,质量指标包括WER、CER等。生成过程使用语音转换模型,通过ASR回环验证,接受门限为WER≤0.05且CER≤0.03。注意事项:不接受真实客户数据,参考语音保留原始许可证。
This dataset is a synthetic Malaysian telecom call-centre dialogue dataset named Synthetic Malaysian Telco Call-Centre Speech. It contains three languages: English, Malay, and Chinese. The tags include call-centre, telecom, synthetic, text-to-speech, voice conversion, etc. The dataset is primarily used for research and development in speech synthesis, voice conversion, and call-centre related tasks. It includes multiple subsets: default (4260 text dialogues), dialogues_v2 (7780 extended text dialogues), synthetic (14.68 hours of synthetic speech), synthetic_podcast (podcast speech synthesis), dialogues_normalized (12040 normalized dialogues), dialogue_calls (3520 multi-turn call segments), hard_entities and its variants (subsets focusing on difficult entities). Each subset has detailed field definitions; audio is 24kHz mono WAV; quality metrics include WER, CER, etc. The generation process uses voice conversion models and is validated by ASR loopback with acceptance thresholds of WER≤0.05 and CER≤0.03. Notes: The dataset does not contain real customer data, and reference speech retains its original license.
数据集概述
数据集名称:Synthetic Malaysian Telco Call-Centre Dialogues
数据集地址:https://huggingface.co/datasets/Scicom-intl/Synthetic-User-Turn-TTS
语言:英语(en)、马来语(ms)、中文(zh)
标签:呼叫中心、电信、合成数据、文本转语音、语音转换
数据集简介
该数据集包含马来西亚电信运营商(如 Unifi)呼叫中心场景的合成客户语音及文本对话。文本内容为完全合成的对话,不包含真实客户数据。音频子集通过语音转换模型将客户轮次(user turns)转化为语音,并仅保留经过 ASR 回环验证准确的片段。
数据子集
| 子集名称 | 行数 | 内容 |
|---|---|---|
default |
4,260 | 源对话(纯文本),首批 213 个主题 |
dialogues_v2 |
7,780 | 源对话(纯文本),扩展批次,389 个主题 |
synthetic |
5,102 | 生成语音,使用 Multilingual-TTS-DNSMOS 音色 |
synthetic_podcast |
8,458(train) | 生成语音,使用 Clean-Podcast 音色 |
dialogues_normalized |
12,040 | default + dialogues_v2 合并,增加口语化文本列 |
dialogue_calls |
5,141 | 多轮通话音频片段(双方角色、双音色、含静音) |
hard_entities 系列 |
670~3,463 | 针对数字/实体类文本的硬性测试子集 |
各子集详情
1. default(源对话文本)
- 每条记录包含:主题(topic)、类别(category,共15类如计费、技术支持、安装、账户管理等)、语言(英语/马来语/中文)、轮次数(1-3轮)、消息列表(交替的 assistant/user 角色)。
- 语言分布:英语 35%、马来语 60%、中文 5%,与实际呼叫中心语言分布一致。
- 所有姓名、账号、电话、身份证号、日期和金额均为虚构。
2. dialogues_v2(扩展源对话文本)
- 与 default 相同的生成方式,规模扩大至 389 个主题(新增 176 个),每个主题 20 条对话。
- 从中提取的去重客户轮次文本共有 14,472 条唯一话语。
3. synthetic(DNSMOS 音色语音)
- 5,102 条音频,总计约 14.68 小时。
- 音色来自 Multilingual-TTS-DNSMOS 数据集,筛选 DNSMOS OVRL ≥ 4.0 的样本。
- 每条音频具有独特音色(5,102 个唯一音色,来自 77 个源语料库)。
- 平均 WER 为 0.0108,平均 CER 为 0.0060,63.4% 的片段两项指标均为 0。
- 音频采用语音转换模型生成,中文目标的接受率高于英文。
4. synthetic_podcast(播客音色语音)
- 文本来自本数据集的 default 子集,音色来自 Clean-Podcast 数据集。
- 音色可重复(每个音色约出现十次),如需每片段唯一音色请使用
synthetic。
5. dialogues_normalized(含口语化文本)
- default 和 dialogues_v2 合并,新增
normalized_messages列,将书面文本转换为实际口语表达(如数字逐位读出、金额马来语表达等)。 - 共 12,040 行,其中 8,247 条对话被重写,其余保持不变。
6. dialogue_calls(多轮通话音频)
- 将完整的 assistant + user 对话渲染为单个音频片段,包含两个不同音色(来自不同源语料库)。
- 音频未经过处理(无重采样、响度归一化或频带限制)。
- 每条音频时长 ≤ 30 秒。
7. hard_entities(硬实体子集)
- 专门针对数字、账号、身份证号等难以合成的文本生成的子集。
- 包含
hard_entities、hard_entities_v2、hard_entities_calls、hard_entities_texts、hard_entities_normalized、hard_entities_v2_normalized等多个配置。
数据特征字段
音频子集(synthetic、synthetic_podcast)主要字段:
audio:24 kHz 单声道 WAV 音频text:目标文本(ASR 标签)transcription:ASR 对生成音频的转录结果wer、cer:转录结果与目标文本的误差率duration:音频时长(秒)takes:生成过程中的尝试次数temperature:采样温度speaker、speaker_config:参考音色及其来源speaker_ovrl:参考音色的 DNSMOS 评分reference_text、reference_duration:参考音频的文本和时长sample_rate:采样率(24000 Hz)
对话文本子集(default、dialogues_v2)主要字段:
id:唯一标识topic、category:主题与类别language:语言num_turns:轮次数messages:消息列表(包含 role 和 content)
数据质量与筛选标准
- 音频片段的接受标准:WER ≤ 0.05 且 CER ≤ 0.03。
- 评分时忽略大小写、标点和犹豫词(如 erm/um/uh),中文按字符而非词评分。
- 约 1/4 的生成片段不合格,因此采用 best-of-N 策略。
- 约 26% 的候选文本无法生成合格音频,因此音频子集并非源文本的完整呈现。
注意事项
- 接受不等于完美:质量门槛只限制 ASR 分歧,不保证感知质量,训练前需抽检。
- 裁剪问题:部分音频可能达到满幅(32767),如需要可应用余量处理。
- WER 下限问题:包含非常规专有名词或长数字串的文本难以达到 WER 0,此类文本在音频子集中代表性不足。
- 数字实体文本:建议使用
cer作为质量指标。
许可与来源
- 对话文本为合成数据,不包含真实客户信息。
- 参考音色来自上游语料库(Multilingual-TTS-DNSMOS、Clean-Podcast),保留原始许可。




