遇见数据集

speech-genuineness

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

Speech Genuineness是一个用于评估语音真实自然度的音频分类数据集。它包含约9,695个语音片段,这些片段采样自多个文本转语音(TTS)生成的语音数据集以及Emolia语料库。每个片段均为最长约20秒的24 kHz单声道MP3音频文件。数据集的核心标注是由Gemini-3.1-Pro模型根据一个名为“GENU”(真实自然度)的评估准则生成的,该准则旨在衡量语音听起来像真实、自发、生活化的瞬间(高分)还是像排练过的/合成的朗读(低分)。每个片段都获得了一个0到6之间的整数评分,以及模型给出该评分的简短推理文本。数据集的来源被匿名化处理,片段被划分为10个桶(bucket),每个桶大致对应一个未公开的原始数据源,包含约1,000个片段。该数据集适用于语音自然度评估、TTS系统质量评估、语音生成模型检测等任务的研究。数据以CC-BY-4.0许可证发布。

提供机构:
LAION eV
创建时间:
2026-07-12
原始信息汇总

数据集名称

Speech Genuineness

数据集描述

该数据集包含约9,695个语音片段,这些片段采样自多个TTS生成的语音数据集以及Emolia语料库。每个片段均由 Gemini-3.1-Pro 模型根据“真实自然度”(Genuine Naturalness)从0到6进行评分,评分依据是语音听起来像真实、自发、生活化瞬间的程度,而非排练或合成朗读。

标签与任务

  • 任务类别: 音频分类(audio-classification)
  • 语言: 英语(en)
  • 标签: 语音(speech)、真实性(genuineness)、声音(voice)、自然度(naturalness)、TTS、Gemini
  • 许可证: CC-BY-4.0

数据规模

  • 总样本量: 1,000 < n < 10,000(约9,695个片段)

数据格式

每个片段为24 kHz单声道MP3音频,最长约20秒。数据包含以下字段:

字段 类型 描述
id 字符串 不透明片段ID(例如 clip_00001
audio 音频 24 kHz单声道MP3,时长 <= 20秒
genuineness 整数 (0-6) Gemini-3.1-Pro 的真实自然度评分
genuineness_reasoning 字符串 评分的简短推理过程
bucket 整数 (0-9) 匿名化的源组ID(每个组约1,000个片段)

评分标准 (GENU 真实自然度量表)

  • 0: 完全排练/规划/疏离,如朗读脚本或演播室旁白,无实时思考。
  • 1: 准备充分/受控,有少量对话尝试,自我意识强,有“表演”痕迹。
  • 2: 偶有自然时刻,但明显经过构建,仍在执行表演(如精心的有声读物/配音)。
  • 3: 合理真实/对话感强,有实时思考,存在轻微缺陷,普通人的自然说话方式。
  • 4: 真正沉浸,情感融入言语,有自然的犹豫/笑声/呼吸,听者忘记这是表演。
  • 5: 极其真实,捕捉到了真实瞬间,情绪重叠,有微小的分心和不完整的想法。
  • 6: 与真实的、未经计划的现实生活时刻无法区分,完全沉浸,自发思考和情感。

评分分布

真实自然度 数量
0 1523
1 2593
2 2939
3 574
4 570
5 964
6 532

桶结构

数据被分为10个匿名化桶(bucket 0-9),每个桶约1,000个片段,对应一个未公开的源数据集。数据来源包括多个TTS生成的语音数据集和Emolia语料库。

数量
bucket 0 1000
bucket 1 1000
bucket 2 1000
bucket 3 1000
bucket 4 1000
bucket 5 1000
bucket 6 1000
bucket 7 1000
bucket 8 695
bucket 9 1000

标注说明

所有评分由 Gemini-3.1-Pro 直接听取每个MP3生成。评分结果属于模型判断,可能包含错误或偏差。

许可证

数据集采用 CC-BY-4.0 许可证发布。

搜集汇总
数据集介绍
speech-genuineness 数据集图片
构建方式
该数据集名为Speech Genuineness,旨在评估语音样本的真实自然度。其构建基于从多种TTS生成语音数据集与Emolia语料库中采集的约9,695条语音片段,每条片段均为24 kHz单声道MP3格式,时长不超过20秒。所有样本经由Gemini-3.1-Pro模型直接聆听后,依据一套从0至6的“真实自然度”评分标准进行标注,评分聚焦于语音是否呈现即兴自发的生活瞬间而非排练或合成朗读。模型被要求输出简短推理过程与整数评分,以确保标注可解释。数据集将样本划分为10个匿名组(bucket),每组约1,000条,对应不同原始来源,但来源身份被刻意隐藏,以保障匿名性。
特点
该数据集的核心特点在于其独特的“真实自然度”评分体系,从完全排练(0分)到与真实即兴时刻无异(6分),细致刻画了语音的拟真程度。评分依据模型对语音中情感融入、微小停顿、笑声、呼吸等有机特征的感知,而非传统语音质量指标。数据集包含约1,523条0分样本与532条6分样本,分布呈现中间集中趋势,反映了不同来源语音的自然度差异。此外,样本被匿名分组为10个bucket,每个bucket对应一个未公开的原始数据集,便于研究者在不知悉来源的情况下进行跨组分析,避免先验偏见。
使用方法
该数据集适用于音频分类任务,特别是语音真实度评估相关的研究。使用者可通过加载每条样本的音频文件与对应的0至6分标注,训练或评估模型对语音自然度的感知能力。数据集提供了genuineness_reasoning字段,包含模型的简短推理过程,可辅助分析评分依据或用于可解释性研究。鉴于评分由自动模型生成,可能存在偏差,建议在使用时结合人类评估进行验证。数据集以CC-BY-4.0许可发布,允许自由使用与修改,但需注明来源。开发者可将样本按bucket分组进行跨数据集对比,或直接利用全部样本进行端到端训练。
背景与挑战
背景概述
在语音合成(TTS)与深度伪造技术迅猛发展的当下,如何从听觉感知层面区分自然、自发的真实语音与经过演练或合成的伪造语音,已成为语音安全与可信人工智能领域的核心课题。Speech Genuineness 数据集由相关研究团队于近期创建,包含约9,695条来自多种TTS系统及Emolia语料库的语音片段,每条语音均由Gemini-3.1-Pro模型依据独创的Genuine Naturalness(GENU)评分量表进行0至6级的真实自然度标注。该数据集聚焦于量化语音的“生活真实感”,而非传统二分类伪造检测,为探索机器生成语音的感知边界提供了新颖的评估基准,对语音鉴伪、语音人机交互及情感计算等领域具有重要推动作用。
当前挑战
该数据集所解决的领域问题在于,现有语音鉴伪任务多依赖声学特征或模型概率进行真假判定,难以捕捉听者对语音“自发性”与“真实感”的微妙主观判断,缺乏对高度拟真TTS语音的人因感知层评估框架。构建过程中面临的挑战包括:评分维度的定义,将主观的“真实自然度”量化为可操作的0至6级标准极具难度,需兼顾学术严谨性与感知可解释性;标注一致性,模型自动标注虽规模高效,但可能引入源自大语言模型的评判偏误,评分结果是否等价于人类感知阈值仍存疑;数据来源匿名化,为规避版权与隐私争议,刻意隐去原始数据集标识,却在源头追溯与偏见分析上牺牲了可解释性,增加了后续研究的复现难度。
常用场景
经典使用场景
该数据集为语音生成领域的自然度与真实性评估提供了标准化基准。研究人员常利用其标注的0至6级“GENU”评分体系,系统性地衡量由各类文本转语音系统合成的语音与真实人类话语之间的感知差距。数据集囊括了近万条来自多个匿名来源的语音片段,覆盖从高度机械的朗读到几乎不可分辨的自然对话的全频谱,使其成为训练和验证语音自然度自动评估模型的理想训练语料与测试集合。
解决学术问题
该数据集致力于解决合成语音真实性量化评价这一核心学术难题。传统评估多依赖主观听感测试,难以大规模复制且标准不一。Speech Genuineness通过构建一个精细的多级感知度量框架,将“真实自然性”这一模糊概念转化为可客观比较的数值。它填补了系统化衡量TTS系统从机械朗读到情境化自发语调差异的研究空白,推动了语音合成质量评估从粗粒度向细粒度、从主观向半自动化方向的演进。
衍生相关工作
该数据集衍生出一系列围绕语音感知深度分析与评估模型改进的经典工作。具体来说,研究者基于其匿名化的十个桶结构,探索了不同TTS范式(如基于Transformer的端到端模型与传统拼接合成系统)在自然度上的分布差异。同时,Gemini-3.1-Pro作为评分模型本身引发的偏差分析,催生了关于大语言模型听觉感知可靠性的交叉研究,以及如何借助少量人类反馈校准模型评分的相关方法论探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务