遇见数据集

ODSS

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

ODSS(开放合成语音数据集)是一个为合成语音检测任务设计的基准就绪型多语言音频数据集。其核心任务是二元分类,旨在区分真实人声录音(标记为“bonafide”)与通过文本转语音技术合成的语音(标记为“spoof”)。合成语音部分由两种先进的TTS系统生成:端到端的VITS架构和两阶段的FastPitch + HiFi-GAN流水线,涵盖了英语、德语和西班牙语三种语言,共156个声音,并平衡了性别分布。数据来源于四个公开语料库:英语的VCTK和Hi-Fi TTS、德语的HUI-audio-corpus-german以及西班牙语的OpenSLR Spanish。每个自然语音样本都与其对应文本的TTS重合成版本配对。数据集总计包含26,954个音频样本,其中真实样本7,961个,合成样本18,993个(VITS合成11,032个,FastPitch+HiFi-GAN合成7,961个)。语言分布为:英语14,405个,德语5,778个,西班牙语6,771个。每个数据样本包含音频文件路径、16 kHz单声道WAV格式的音频数据、分类标签以及一个记录详细元数据的JSON字符串。数据集采用Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0)许可证发布,适用于音频深度伪造检测、反欺骗等研究领域,并可作为相关基准测试的标准数据集。

创建时间:
2026-06-09
原始信息汇总

数据集总览

ODSS(开放合成语音数据集) 是一个多语言、多说话人的合成语音检测数据集,专注于区分真实人类录音(bonafide)与文本转语音(TTS)生成的声音(spoof)。数据集包含英语、德语和西班牙语,共26,954条音频样本,每条音频为16 kHz单声道WAV格式。

任务与分类

  • 任务类型:音频二分类(语音反欺骗/深度伪造检测)
  • 标签
    • bonafide(0):自然人类录音
    • spoof(1):TTS合成语音

数据来源与构成

ODSS基于四个公开语音语料库构建:

语料库 语言 角色
VCTK 英语 英语VITS合成语音(vits/vctk
Hi-Fi TTS 英语 自然语音 + VITS + FastPitch合成
HUI-audio-corpus-german 德语 自然语音 + VITS + FastPitch合成
OpenSLR Spanish 西班牙语 自然语音 + VITS + FastPitch合成

合成语音由两种TTS系统生成:

  • VITS(端到端架构)
  • FastPitch + Hi-Fi-GAN(两步流水线)

数据规模与统计

统计项 数值
总样本数 26,954
真实语音(bonafide) 7,961
合成语音(spoof) 18,993
— VITS合成 11,032
— FastPitch + HiFi-GAN合成 7,961
语言分布 英语(14,405)、德语(5,778)、西班牙语(6,771)
源语料库 VCTK、Hi-Fi TTS、HUI-de、OpenSLR-ES

数据模式

列名 类型 描述
path string 源相对路径(如 vits/vctk/p293/p293_168.wav),唯一标识
audio Audio(16000) 16 kHz单声道WAV音频
label ClassLabel "bonafide"(0)或 "spoof"(1)
notes string JSON格式:包含 utterance_idgeneratorsource_corpusspeakerlanguageattack

许可证

  • CC BY-SA 4.0(知识共享-署名-相同方式共享4.0国际)

引用信息

bibtex @inproceedings{odss2023, title = {{An Open Dataset of Synthetic Speech}}, booktitle = {Proc. IEEE Workshop}, year = {2023}, doi = {10.5281/zenodo.8370669}, note = {ODSS, https://ieeexplore.ieee.org/document/10374863/}, }

快速开始

python from datasets import load_dataset

ds = load_dataset("SpeechAntiSpoofingBenchmarks/ODSS", split="test") print(ds[0])

搜集汇总
数据集介绍
ODSS 数据集图片
构建方式
ODSS数据集基于VCTK、Hi-Fi TTS、HUI-audio-corpus-german及OpenSLR Spanish四个公开语料库构建,覆盖英语、德语和西班牙语。每条自然语音均通过两种文本转语音(TTS)系统——端到端的VITS架构与双阶段FastPitch + HiFi-GAN管线——生成对应的合成版本,并确保文本内容一致。数据集共计26,954条音频样本,其中自然语音7,961条,合成语音18,993条,合成语音中VITS贡献11,032条,FastPitch + HiFi-GAN贡献7,961条,且合成语音涵盖156个说话人,男女比例均衡。音频以16kHz单声道WAV格式无损存储,标签分为“bonafide”(自然)与“spoof”(合成)两类。
特点
ODSS具有多语言、多说话人、多TTS系统的显著特点。其音频来源包含英语(14,405条)、德语(5,778条)和西班牙语(6,771条),覆盖多样化的语言场景。每条样本均提供详尽的元数据,以JSON格式记录话语ID、生成器类型、源语料库、说话人、语言及攻击类型,便于深入分析。此外,数据集的合成语音由VITS与FastPitch + HiFi-GAN两种代表性架构生成,为合成语音检测研究提供了丰富的训练与评估素材。该数据集已打包为HuggingFace格式,支持标准benchmark评测,适用于反欺骗与音频深度伪造检测任务。
使用方法
用户可通过HuggingFace的datasets库便捷加载ODSS数据集,使用`load_dataset("SpeechAntiSpoofingBenchmarks/ODSS", split="test")`命令即可获取测试集。每条样本包含音频路径、16kHz单声道音频张量、二分类标签(bonafide为0,spoof为1)以及包含详细元数据的notes字符串。用户可根据需求提取音频特征、解析notes中的JSON信息,或直接利用标签进行二分类模型训练与评估。具体评测流程与提交格式可参考项目内submissions/README.md文件。
背景与挑战
背景概述
ODSS(Open Dataset of Synthetic Speech)是一个于2023年由Fraunhofer IDMT研究所及vera.ai项目团队创建的多语言合成语音检测数据集。该数据集旨在应对语音深度伪造技术带来的安全威胁,核心研究问题聚焦于区分真实人类语音与文本转语音(TTS)系统生成的虚假音频。数据集覆盖英语、德语和西班牙语三种语言,包含26,954条音频样本,其中7,961条为真实语音,18,993条为通过VITS和FastPitch+HiFi-GAN两种TTS架构生成的合成语音。作为音频深度伪造检测领域的基准资源,ODSS推动了跨语言、多说话人场景下的反欺骗研究,并为相关模型的可重复性评估提供了标准化测试平台。
当前挑战
该数据集所解决的核心领域挑战在于语音深度伪造检测的泛化能力不足,即现有模型在面对未见过的TTS系统、未知语言或不同说话人时性能显著下降。构建过程中面临多重挑战:首先,需从VCTK、Hi-Fi TTS等四个不同语料库中整合多语言、多说话人的真实语音,并确保音频格式统一为16 kHz单声道WAV;其次,合成语音的生成需精确配对相同文本内容的TTS复述,同时避免录音条件差异引入的混淆因素;最后,数据集的许可与分发需协调原始语料库的版权声明,最终采用CC BY-SA 4.0协议以保障开放共享与合规使用。
常用场景
经典使用场景
ODSS(开放式合成语音数据集)是语音深度伪造检测领域的标杆性资源,其核心使用场景为语音真伪二分类任务。该数据集精心策划了多语种(英语、德语、西班牙语)、多讲者的自然语音与文本转语音(TTS)合成语音的配对样本,其中合成语音由端到端VITS架构与两阶段FastPitch+HiFi-GAN流水线生成,覆盖156种声线并确保性别平衡。研究者可直接利用其标准化的16kHz单声道WAV格式,基于Audio类标签区分'bonafide'与'spoof'类别,从而系统性地评估和比较抗欺骗模型的泛化能力。
实际应用
在实际应用中,ODSS为语音安全防护系统提供了不可或缺的训练与基准测试基础。它可直接服务于金融机构中的语音身份验证防欺诈、智能语音助手的恶意注入检测、以及司法取证中音频真伪鉴别等关键领域。借助其多语种特性,企业可构建面向全球化服务的统一深度伪造防御框架;同时,该数据集的标准化协议(如CC BY-SA 4.0许可)降低了合规门槛,便于工业界直接集成到实时语音流分析管线中,从而有效挫败利用先进TTS技术进行的社交工程攻击。
衍生相关工作
基于ODSS已衍生出多项经典研究工作。例如,在IEEE 2023年论文《An Open Dataset of Synthetic Speech》中,提出了基线抗欺骗系统并公开了评估协议;后续研究借此探索了基于自监督学习(如Wav2Vec 2.0)的域泛化方法,对比了时域与频域特征在跨语言攻击下的效能差异。此外,该数据集被纳入Vera.ai项目与Fraunhofer IDMT的基准套件,催生了系列关于轻量级反欺骗模型、以及融合相位信息与原始波形特征的创新架构,显著丰富了语音安全领域的实证研究体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务