遇见数据集

Synthetic-User-Turn-TTS

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是一个合成的马来西亚电信客服中心对话数据集,名称为“Synthetic Malaysian Telco Call-Centre Speech”。数据集中包含英语、马来语和中文三种语言,标签包括客服中心、电信、合成、文本转语音、语音转换等。数据集主要用于语音合成、语音转换以及客服中心相关任务的研究与开发。数据集包含多个子集:default(4260条文本对话)、dialogues_v2(7780条扩展文本对话)、synthetic(14.68小时合成语音)、synthetic_podcast(播客语音合成)、dialogues_normalized(12040条归一化文本)、dialogue_calls(3520个多轮通话片段)、hard_entities及其变体(处理困难实体的对话子集)。每个子集有详细字段定义,音频为24kHz单声道WAV,质量指标包括WER、CER等。生成过程使用语音转换模型,通过ASR回环验证,接受门限为WER≤0.05且CER≤0.03。注意事项:不接受真实客户数据,参考语音保留原始许可证。

This dataset is a synthetic Malaysian telecom call-centre dialogue dataset named Synthetic Malaysian Telco Call-Centre Speech. It contains three languages: English, Malay, and Chinese. The tags include call-centre, telecom, synthetic, text-to-speech, voice conversion, etc. The dataset is primarily used for research and development in speech synthesis, voice conversion, and call-centre related tasks. It includes multiple subsets: default (4260 text dialogues), dialogues_v2 (7780 extended text dialogues), synthetic (14.68 hours of synthetic speech), synthetic_podcast (podcast speech synthesis), dialogues_normalized (12040 normalized dialogues), dialogue_calls (3520 multi-turn call segments), hard_entities and its variants (subsets focusing on difficult entities). Each subset has detailed field definitions; audio is 24kHz mono WAV; quality metrics include WER, CER, etc. The generation process uses voice conversion models and is validated by ASR loopback with acceptance thresholds of WER≤0.05 and CER≤0.03. Notes: The dataset does not contain real customer data, and reference speech retains its original license.

创建时间:
2026-08-05
原始信息汇总

数据集概述

数据集名称:Synthetic Malaysian Telco Call-Centre Dialogues
数据集地址:https://huggingface.co/datasets/Scicom-intl/Synthetic-User-Turn-TTS
语言:英语(en)、马来语(ms)、中文(zh)
标签:呼叫中心、电信、合成数据、文本转语音、语音转换


数据集简介

该数据集包含马来西亚电信运营商(如 Unifi)呼叫中心场景的合成客户语音及文本对话。文本内容为完全合成的对话,不包含真实客户数据。音频子集通过语音转换模型将客户轮次(user turns)转化为语音,并仅保留经过 ASR 回环验证准确的片段。


数据子集

子集名称 行数 内容
default 4,260 源对话(纯文本),首批 213 个主题
dialogues_v2 7,780 源对话(纯文本),扩展批次,389 个主题
synthetic 5,102 生成语音,使用 Multilingual-TTS-DNSMOS 音色
synthetic_podcast 8,458(train) 生成语音,使用 Clean-Podcast 音色
dialogues_normalized 12,040 default + dialogues_v2 合并,增加口语化文本列
dialogue_calls 5,141 多轮通话音频片段(双方角色、双音色、含静音)
hard_entities 系列 670~3,463 针对数字/实体类文本的硬性测试子集

各子集详情

1. default(源对话文本)

  • 每条记录包含:主题(topic)、类别(category,共15类如计费、技术支持、安装、账户管理等)、语言(英语/马来语/中文)、轮次数(1-3轮)、消息列表(交替的 assistant/user 角色)。
  • 语言分布:英语 35%、马来语 60%、中文 5%,与实际呼叫中心语言分布一致。
  • 所有姓名、账号、电话、身份证号、日期和金额均为虚构。

2. dialogues_v2(扩展源对话文本)

  • 与 default 相同的生成方式,规模扩大至 389 个主题(新增 176 个),每个主题 20 条对话。
  • 从中提取的去重客户轮次文本共有 14,472 条唯一话语。

3. synthetic(DNSMOS 音色语音)

  • 5,102 条音频,总计约 14.68 小时。
  • 音色来自 Multilingual-TTS-DNSMOS 数据集,筛选 DNSMOS OVRL ≥ 4.0 的样本。
  • 每条音频具有独特音色(5,102 个唯一音色,来自 77 个源语料库)。
  • 平均 WER 为 0.0108,平均 CER 为 0.0060,63.4% 的片段两项指标均为 0。
  • 音频采用语音转换模型生成,中文目标的接受率高于英文。

4. synthetic_podcast(播客音色语音)

  • 文本来自本数据集的 default 子集,音色来自 Clean-Podcast 数据集。
  • 音色可重复(每个音色约出现十次),如需每片段唯一音色请使用 synthetic

5. dialogues_normalized(含口语化文本)

  • default 和 dialogues_v2 合并,新增 normalized_messages 列,将书面文本转换为实际口语表达(如数字逐位读出、金额马来语表达等)。
  • 共 12,040 行,其中 8,247 条对话被重写,其余保持不变。

6. dialogue_calls(多轮通话音频)

  • 将完整的 assistant + user 对话渲染为单个音频片段,包含两个不同音色(来自不同源语料库)。
  • 音频未经过处理(无重采样、响度归一化或频带限制)。
  • 每条音频时长 ≤ 30 秒。

7. hard_entities(硬实体子集)

  • 专门针对数字、账号、身份证号等难以合成的文本生成的子集。
  • 包含 hard_entitieshard_entities_v2hard_entities_callshard_entities_textshard_entities_normalizedhard_entities_v2_normalized 等多个配置。

数据特征字段

音频子集(synthetic、synthetic_podcast)主要字段:

  • audio:24 kHz 单声道 WAV 音频
  • text:目标文本(ASR 标签)
  • transcription:ASR 对生成音频的转录结果
  • wercer:转录结果与目标文本的误差率
  • duration:音频时长(秒)
  • takes:生成过程中的尝试次数
  • temperature:采样温度
  • speakerspeaker_config:参考音色及其来源
  • speaker_ovrl:参考音色的 DNSMOS 评分
  • reference_textreference_duration:参考音频的文本和时长
  • sample_rate:采样率(24000 Hz)

对话文本子集(default、dialogues_v2)主要字段:

  • id:唯一标识
  • topiccategory:主题与类别
  • language:语言
  • num_turns:轮次数
  • messages:消息列表(包含 role 和 content)

数据质量与筛选标准

  • 音频片段的接受标准:WER ≤ 0.05 且 CER ≤ 0.03
  • 评分时忽略大小写、标点和犹豫词(如 erm/um/uh),中文按字符而非词评分。
  • 约 1/4 的生成片段不合格,因此采用 best-of-N 策略。
  • 约 26% 的候选文本无法生成合格音频,因此音频子集并非源文本的完整呈现。

注意事项

  • 接受不等于完美:质量门槛只限制 ASR 分歧,不保证感知质量,训练前需抽检。
  • 裁剪问题:部分音频可能达到满幅(32767),如需要可应用余量处理。
  • WER 下限问题:包含非常规专有名词或长数字串的文本难以达到 WER 0,此类文本在音频子集中代表性不足。
  • 数字实体文本:建议使用 cer 作为质量指标。

许可与来源

  • 对话文本为合成数据,不包含真实客户信息。
  • 参考音色来自上游语料库(Multilingual-TTS-DNSMOS、Clean-Podcast),保留原始许可。
搜集汇总
数据集介绍
Synthetic-User-Turn-TTS 数据集图片
构建方式
该数据集精心构建了一套面向马来西亚电信客服中心场景的合成对话资源。其构建流程起始于基于真实客服录音风格,针对213至389个主题、15个类别(涵盖账单、技术支持、安装、账户管理及投诉等)自动生成不含真实客户信息的对话文本,并按照约35%英语、60%马来语及5%中文的分布进行语言配比,以贴合实际来电的语言使用规律。随后,数据集采用先进的语音转换模型,将对话中的客户轮次文本合成为语音,并借助Whisper自动语音识别技术进行回环校验,仅在词错误率(WER)不超过0.05且字符错误率(CER)不超过0.03的严苛门槛下,方将音频样例纳入最终集合。通过多次采样与筛选,确保了音频与文本的高度一致性,并同时提供了多轮通话的完整音频片段及规范化后的口语文本形式。
特点
该数据集展现出三大显著特性。其一,音频子集采用每段剪辑拥有独立说话人的策略,汇聚了来自77个不同语音库的5102个独特音色,覆盖土耳其语、豪萨语、泰语、汉语等多种语言,展现了跨语言语音转换的鲁棒性,且经评分显示平均WER低至0.0108,CER为0.0060,超过六成的片段在两项指标上均达到零误差,清晰度优异。其二,文本子集提供了书面形式与规范化口语形式的双轨对照,将数字、金额等元素转化为易读的念法,解决了国际电话、账号等实体在语音合成与验证中的难题。其三,多轮通话子集完整呈现了客服与客户的双角色对话,并附带语音间隙、说话人距离等声学特征,以及可选的电话频带模拟,为研究对话语音交互提供了丰富维度。
使用方法
数据集的使用极为便捷,通过HuggingFace的datasets库即可加载。用户可按需选择配置,如加载纯文本对话使用'dialogues_v2',加载合成语音则使用'synthetic'或'synthetic_podcast',而完整的多轮语音对话则使用'dialogue_calls'。每个配置均提供了清晰的字段定义,便于提取文本、音频、说话人信息及质量评估指标。数据主要划分为训练集和测试集,其中'synthetic'配置还额外包含了采用LiveKit渲染的测试子集,以适应不同应用场景。该数据集特别适用于训练语音识别、语音合成、说话人验证及对话系统等领域的研究,其严苛的质量门槛保障了训练数据的可靠性,而相应的规范化文本则方便了端到端系统的直接使用。
背景与挑战
背景概述
Synthetic-User-Turn-TTS数据集由Scicom International于2024年创建,旨在解决马来西亚电信客服中心语音数据稀缺的问题。该数据集通过生成式方法合成了马来语、英语和中文的客服对话,模拟真实客服场景中的客户语音(用户轮次),并结合语音转换技术生成高质量音频。其核心研究问题在于构建一个覆盖多语言、多主题且无隐私风险的可扩展语音语料库,以支持客服中心的自动语音识别(ASR)、语音合成(TTS)及说话人验证等任务。该数据集提供了从纯文本到多轮对话音频的多种子集配置,其独特之处在于采用用户轮次合成语音,并利用ASR往返验证确保音频质量。此数据集填补了马来语客服语音资源的空白,为低资源语言在多语言混合场景下的语音处理研究提供了宝贵资源,推动了相关领域的发展。
当前挑战
该数据集面临的挑战主要有三方面:第一,领域内真实客服对话涉及复杂的语言混合现象(如马来语和英语频繁代码切换)、专业术语及数字实体(如账号、身份证号),而原始文本中此类内容难以直接合成语音,且传统ASR往返验证对长数字串识别准确率低,导致部分关键文本被排除。第二,构建过程中,语音生成采用语音转换技术,但跨语言语音转换(如将非马来西亚语说话人声音用于中文目标)在质量一致性上存在挑战,约四分之一生成尝试不合格,需多次采样才能达到WER≤0.05的门槛。第三,数据分布需平衡多样性与可验证性,约26%的候选文本因无法通过质量检查而未被收录,造成音频子集与源文本的不完全对应,影响语料完整性与下游任务适用性。
常用场景
经典使用场景
Synthetic-User-Turn-TTS数据集的核心应用场景在于为自动语音识别(ASR)和文本到语音(TTS)系统提供大规模、多语言的训练与评测数据。其精心设计的语音子集(如synthetic与synthetic_podcast)收录了经过严格质量控制(WER≤0.05,CER≤0.03)的合成语音片段,适用于训练语音识别模型,尤其是在马来西亚电信客服中心这一特定领域。此外,该数据集的文本版本(如dialogues_v2)为对话系统、自然语言理解(NLU)模型提供了丰富的多语言、多主题对话样本,支持代码切换场景的语言建模与理解任务。
解决学术问题
该数据集有效解决了客服中心领域高质量多语言语音与文本数据稀缺的问题,特别是在马来西亚英语、马来语和中文三语混合使用的环境中。它提供了无真实客户数据的合成对话文本,保障了隐私合规,同时通过语音转换技术生成具有高识别精度的音频,克服了传统TTS生成语音在ASR回环验证中准确率低下的难题。学术研究上,它推动了低资源语言识别、跨语言语音转换鲁棒性、多语言代码切换ASR等领域的探索,并为大规模语音生成的质量评估提供了新基准。
衍生相关工作
该数据集衍生出若干经典工作,包括基于DNSMOS筛选的高质量多语言TTS声库(Multilingual-TTS-DNSMOS)和利用语音转换模型生成可验证语音数据的流程。其提出的ASR回环验证(round-trip)质量门控机制及文本归一化方法(如将数字转换为口语形式)启发了后续研究。此外,多轮对话音频子集(dialogue_calls)的构建方式推动了角色隔离、语音距离度量等研究,为会话式语音合成、说话人验证和对话系统评测提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务