遇见数据集

emolia-voicenet-gemini-annotations

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

Emolia VoiceNet Gemini Annotations 是一个大规模的语音感知维度注释数据集,旨在为 VoiceNet 项目提供训练数据。该数据集基于 VoiceNet-Ext 分类体系,包含 57 个细粒度的、有序的语音表现维度,如唤醒度、效价、亮度、共鸣位置、说话风格、真实性、录音质量等。数据内容包含 468,180 个维度级别的注释,覆盖 236,613 个来自 Emolia 语料库的语音片段。每个注释对应一个(语音片段,维度)组合,并由 Gemini 3.5 Flash 模型(非思考模式,温度0)根据该维度的完整 0-6 级评分标准(内容适当性维度为 0-2 级)给出一个整数分数。注释为模型生成,非人工标注。语音片段以英语和德语为主,同时包含少量中文、法语、韩语和日语。数据集通过多轮流程构建以优化分数分布的平衡性:首先使用 VoiceCLAP 零样本分桶为每个维度选择跨分数级别的候选片段;然后由 Gemini 进行评分;后续轮次针对代表性不足的(维度 x 分数桶)单元进行针对性补充。最终数据集的平均平衡度(归一化香农熵)为 0.552。数据集提供了详细的每维度统计数据,包括样本数量、平均分数和平衡度,并列举了平衡度最佳和最差的维度示例。数据集文件包括:注释表(包含片段ID、维度代码、维度名称、Gemini分数、轮次)、原始模型输出文本、音频来源清单(用于从外部仓库获取对应的 .flac 音频文件)以及完整的分类体系定义文件。数据集本身不包含音频文件(约 2 TB),但提供了完整的获取指引。该数据集适用于语音分类、语音情感与韵律分析、以及训练预测复杂语音属性的机器学习模型等任务。需要注意的是,注释反映了生成式模型的感知判断和偏差,且某些精细的共鸣维度在现有标签下分数分布极为集中。数据集采用 CC-BY-4.0 许可证发布。

Emolia VoiceNet Gemini Annotations is a large-scale dataset of voice perception dimension annotations, designed to provide training data for the VoiceNet project. The dataset is based on the VoiceNet-Ext taxonomy and includes 57 fine-grained, ordered voice performance dimensions, such as arousal, valence, brightness, resonance location, speaking style, authenticity, recording quality, etc. The data consists of 468,180 dimension-level annotations covering 236,613 voice clips from the Emolia corpus. Each annotation corresponds to a (clip, dimension) pair and is assigned an integer score by the Gemini 3.5 Flash model (non-thinking mode, temperature 0) according to the full 0-6 rating scale for that dimension (with a 0-2 scale for content appropriateness dimensions). The annotations are model-generated, not human-annotated. The voice clips are primarily in English and German, with a small number in Chinese, French, Korean, and Japanese. The dataset was constructed through a multi-round process to optimize the balance of score distributions: first, VoiceCLAP zero-shot bucketing was used to select candidate clips across score levels for each dimension; then Gemini performed scoring; subsequent rounds targeted under-represented (dimension x score bucket) units for supplemental annotation. The final dataset has an average balance (normalized Shannon entropy) of 0.552. The dataset provides detailed per-dimension statistics, including sample count, average score, and balance, and lists examples of dimensions with the best and worst balance. The dataset files include: an annotation table (with clip ID, dimension code, dimension name, Gemini score, round), raw model output text, an audio source manifest (for retrieving corresponding .flac audio files from external repositories), and a complete taxonomy definition file. The dataset itself does not include audio files (approximately 2 TB), but provides complete retrieval instructions. The dataset is suitable for tasks such as voice classification, voice emotion and prosody analysis, and training machine learning models to predict complex voice attributes. It should be noted that the annotations reflect the perceptual judgments and biases of the generative model, and some fine-grained resonance dimensions have highly concentrated score distributions under the existing labels. The dataset is released under the CC-BY-4.0 license.

提供机构:
LAION eV
创建时间:
2026-07-15
原始信息汇总

数据集概要

Emolia VoiceNet Gemini Annotations 是一个由 LAION 创建的数据集,包含 468,180 条维度级标注,覆盖 236,613 个 Emolia 语音片段。每个语音片段在 57 个感知语音/说话维度(如唤醒度、效价、明亮度、共鸣位置、说话风格、真实性、录音质量等)上由 Gemini 3.5 Flash 模型(非思维链模式,温度参数为 0)进行 0-6 分的评分(内容适切性维度为 0-2 分)。数据集中包含标注、音频来源、各维度统计信息以及完整的评分分类体系,标注音频也以 WebDataset 格式包含在仓库中。

许可证: CC-BY-4.0

主要特性

  • 标注数量: 468,180 条维度级标注
  • 语音片段数量: 236,613 个独特音频片段
  • 标注维度: 57 个
  • 评分范围: 0-6 分(内容适切性维度为 0-2 分)
  • 标注模型: Gemini 3.5 Flash(温度 0,无思维链)
  • 音频语言: 主要为英语和德语,另有少量中文、法语、韩语和日语
  • 数据规模: 100K < n < 1M
  • 任务类别: 音频分类

数据构成与文件

标注数据 (data/annotations.parquet)

包含 468,180 行标注数据,主要列如下:

列名 类型 描述
__emolia_id__ string Emolia 语音片段 ID (如 EN_B00020_S08991_W000042)
dim string 维度代码 (如 AROU)
dim_name string 维度可读名称
gemini_score Int64 (可空) Gemini 评分,0-6 (内容适切性为 0-2);解析失败时为 null
round int64 标注轮次 (1, 2 或 3)

原始模型输出 (data/annotations_raw.parquet)

包含 468,180 行原始模型文本,主要列为 __emolia_id__dimraw(模型输出原始文本)。

音频来源清单 (data/manifest.parquet)

包含 468,058 行音频来源信息(每对 (片段, 维度) 一行),主要列如下:

列名 类型 描述
__emolia_id__ string Emolia 语音片段 ID
dim string 维度代码
round int64 产生该片段的轮次
audio_repo string 音频文件所在 Hugging Face 数据集仓库
source_tar string 仓库中的 tar 文件成员
key string tar 条目基础名称

维度统计 (stats/per_dimension_stats.parquet / .csv)

包含每个维度的名称、等级数、计数、各评分等级的计数、平均 Gemini 评分以及平衡度(归一化香农熵)。

完整评分分类体系 (taxonomy/voicenet_dimensions.md)

包含全部 57 个维度的英文评分细则与 0-6 等级描述。

数据生成过程

数据集的分批生成为三轮迭代:

  • 第 1 轮(196,500 条标注): 从 Emolia 语料库中选取候选片段,利用 VoiceCLAP 零样本相似度将片段按维度等级分桶(0-6),使候选片段分布在评分范围内,再由 Gemini 3.5 Flash 重新评分。
  • 第 2 轮(195,995 条标注): 针对第 1 轮中表现最差的 196 个 (维度 x 等级) 组合,补充约 1,000 个新的高一致性候选片段,将平均平衡度从 0.533 提升至 0.551。
  • 第 3 轮(75,685 条标注): 针对 24 个最难维度的 76 个 (维度 x 等级) 组合,使用双 CLAP 一致性候选片段进行针对性补充,将平均平衡度提升至 0.552。两个维度被有意排除:R_MIXD(CLAP 无法解决)和 ROUG(候选池已用尽)。
  • 生成成本: 总计约 264.77 美元(使用 Gemini 3.5 Flash 批量 API,享受 50% 批量折扣)。
  • 解析可靠性:234 / 468,180 条响应(0.050%)无法解析为整数,这些行的 gemini_score 为 null。

维度分类体系

数据集定义了 57 个感知语音/说话维度,分为以下 10 个类别:

  • 节奏与时间(8 个): TEMP 语速、CHNK 断句、SMTH 平滑度、CLRT 发音清晰度、RANG 音高范围、EMPH 强调、DFLU 不流畅度、STRU 结构
  • 社会与人际(3 个): STNC 立场、FOCS 专注度、VULN 脆弱性
  • 说话者身份(3 个): GEND 感知性别、AGEV 声音年龄、REGS 音域
  • 情感与情绪(3 个): VALN 效价、AROU 唤醒度、VOLT 波动性
  • 物理发声(4 个): RESP 呼吸、TENS 紧张度、COGL 认知负荷、ATCK 起音
  • 频谱与音色(7 个): BRGT 明亮度、ROUG 粗糙度、HARM 和谐度、FULL 饱满度、WARM 温暖度、METL 金属质感、ESTH 美感
  • 时间动态(4 个): VFLX 速度变化、DARC 动态弧、ARSH 唤醒度变化、VALS 效价变化
  • 语言与录音(3 个): RCQL 录音质量、BKGN 背景噪声、EXPL 内容适切性(3 点量表)
  • 共鸣位置(7 个): R_CHST 胸腔、R_THRT 喉部、R_ORAL 口腔、R_MASK 面罩、R_NASL 鼻腔、R_HEAD 头部、R_MIXD 混合
  • 说话风格(15 个): S_CASU 随意、S_CONV 对话式、S_FORM 正式、S_DRAM 戏剧性、S_NARR 叙述者、S_NEWS 新闻播报、S_TECH 教学式、S_AUTH 权威、S_PLAY 俏皮、S_CART 卡通化、S_ASMR ASMR、S_WHIS 耳语式、S_MONO 独白、S_STRY 讲故事、S_RANT 咆哮式

维度统计示例

  • 平衡度最高的维度(分布最均匀):
    • S_MONO 独白风格:平衡度 0.891,7 个等级,6,500 条标注
    • AROU 唤醒度:平衡度 0.877,7 个等级,5,500 条标注
    • VALN 效价:平衡度 0.856,7 个等级,5,500 条标注
  • 平衡度最低的维度(分布最不均匀):
    • R_MIXD 混合共鸣:平衡度 0.030,7 个等级,9,499 条标注
    • R_MASK 面罩共鸣:平衡度 0.144,7 个等级,14,500 条标注
    • R_NASL 鼻腔共鸣:平衡度 0.152,7 个等级,13,500 条标注

已知局限性

  • 模型生成标签: 评分来自 Gemini 3.5 Flash,而非人类标注者。
  • 候选选择不均: VoiceCLAP 零样本分桶对宏观维度可靠,但对精细共鸣维度(如 R_MIXDR_MASK)效果不佳,这些维度约 90-99% 的片段被评在同一等级,不适合作为平衡的 7 级轴。
  • 重复项: 122 个 (片段, 维度) 对(0.026%)出现在多个轮次中,音频清单按最先轮次去重,但标注文件保留所有轮次。
  • 解析失败: 0.05% 的模型响应无法解析为整数。

相关资源

  • GitHub 项目与文档: https://github.com/LAION-AI/voicenet
  • 在线演示: https://projects.laion.ai/voicenet/
  • 完整分类体系文件: taxonomy/voicenet_dimensions.md
  • 训练好的预测模型: https://huggingface.co/laion/voicenet-dimension-predictors-commercial
  • 来源音频仓库: 第 1 轮:https://huggingface.co/datasets/laion/emolia-thinking-balanced-buckets;第 2 和 3 轮:https://huggingface.co/datasets/VoiceNet/emolia-thinking

引用

bibtex @misc{emolia_voicenet_gemini, title = {Emolia VoiceNet Gemini Annotations}, author = {LAION}, year = {2026}, note = {Gemini 3.5 Flash annotations of Emolia speech over the VoiceNet-Ext 57-dimension taxonomy}, url = {https://huggingface.co/datasets/laion/emolia-voicenet-gemini-annotations} }

搜集汇总
数据集介绍
emolia-voicenet-gemini-annotations 数据集图片
构建方式
该数据集基于VoiceNet-Ext分类体系,选取了Emolia语料库中的语音片段作为标注对象。针对每一个维度,先利用VoiceCLAP零样本分类技术对候选片段进行预分桶,确保其在0-6的评分区间内均匀分布。随后,调用Gemini 3.5 Flash模型(非思考模式,温度参数设为0)对候选片段进行单次整数评分。整个标注过程历经三轮迭代:首轮完成196,500条标注,第二轮针对性补充了195,995条,第三轮则聚焦于数据最为匮乏的维度,通过双重CLAP一致性筛选新增75,685条标注,最终汇聚成468,180条维度级标注数据。
特点
该数据集规模宏大,涵盖236,613条语音片段与57个感知维度的精细化标注,每条片段均获得一个0-6的整数评分。标注采用多语言策略,以英语和德语为主,兼有中文、法语、韩语和日语。其核心特色在于完全由模型生成的标注,而非人工标注,这使其在效率与一致性上独具优势。此外,数据集附带了完整的音频文件(以WebDataset格式打包)、详尽的标注统计信息以及完整的评分分类体系,为后续研究与模型训练提供了坚实的数据基础。
使用方法
数据集以Parquet格式提供标注文件与音频索引,同时将音频文件打包为WebDataset分片,便于流式读取。用户可通过HuggingFace API枚举并下载分片文件,利用WebDataset库轻松加载音频与对应的元数据。此外,数据集也保留了基于清单文件的逐条音频获取方式,用户可根据标注维度与片段ID从源音频仓库中按需提取。数据集的分类体系与维度定义在附带的Markdown文件中详尽说明,为下游任务如语音情感识别、韵律分析等提供了清晰的标准与使用指南。
背景与挑战
背景概述
在语音情感与副语言学领域,对语音的多维度细粒度感知标注是训练高质量预测模型的关键瓶颈。Emolia VoiceNet Gemini Annotations数据集由LAION机构于2026年创建,基于Schumann等人提出的VoiceNet-Ext 57维语音感知分类体系(2025),旨在解决大规模、细粒度语音韵律标注的稀缺性问题。该数据集包含468,180条维度级标注,覆盖236,613条多语种(英、德、中、法、韩、日)Emolia语音片段,每条标注由Gemini 3.5 Flash模型在0-6尺度上对单一感知维度进行评分,维度涵盖唤醒度、效价、明亮度、共鸣位置、说话风格、真实性、录音质量等57个精细维度。数据集的发布为VoiceNet项目提供了基础训练标签,推动了语音韵律预测模型的发展,在情感计算、人机交互、语音合成质量评估等领域具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于:传统语音情感标注通常局限于少数离散情感类别(如愤怒、悲伤),无法捕捉语音中连续、多维度的细腻韵律变化——例如共鸣位置、语速流变、呼吸感等精细化感知维度长期缺乏大规模标注数据。在构建过程中面临多重挑战:首先,候选片段选择需借助VoiceCLAP零样本分桶技术,确保每个维度在0-6各等级均有分布,但该方法对精细共鸣维度(如混合共鸣、鼻腔共鸣)失效,导致这些维度标签集中在单一等级;其次,依赖Gemini模型生成标签而非人工标注,模型固有偏差可能扭曲真实感知分布;第三,三轮迭代标注策略虽将各维度平衡度从0.533提升至0.552,但最困难维度(如混合共鸣平衡度仅0.030)仍无法有效区分,部分维度沦为1-2级准轴;此外,跨轮次标注的少量重复(0.026%)及解析失败(0.050%)需特殊处理,确保数据一致性。
常用场景
经典使用场景
在语音情感与副语言分析领域,该数据集最经典的使用场景是作为大规模多维度语音感知属性的标注基准。它基于VoiceNet-Ext taxonomy定义的57个精细感知维度,涵盖韵律、音色、共振、副语言风格乃至语速等语音表达的方方面面,利用Gemini 3.5 Flash对23万余条Emolia语料库中的多语种片段进行0-6等级的评分。研究者可以借此对任意语音片段进行全方位的特征剖析,评估语音在唤醒度、明亮度、共鸣腔位、流畅性等不同层面的表现,从而构建或微调能够感知和理解语音非内容信息的深度学习模型。
衍生相关工作
立足于该数据集的丰富标注,一系列衍生工作已相继开展。最为直接的是VoiceNet项目自身所发布的维度预测器(laion/voicenet-dimension-predictors-commercial),它直接利用这些Gemini标注进行训练,实现了从语音波形到57个感知维度的端到端推理。在学术界,VoiceNet-Ext taxonomy的原始论文为此奠定了基础,而数据集中对模型协作流程的创新探索——如VoiceCLAP零样本分桶与Gemini多重评分相结合——则为弱监督与先验引导的标注方法开辟了新的研究路径。未来,该数据集有望衍生出针对多语言、可解释性及跨模态对齐等方向的系列基准与模型。
数据集最近研究
最新研究方向
该数据集聚焦于利用大型语言模型(Gemini 3.5 Flash)对多语言语音情感与韵律进行细粒度标注,覆盖57个感知维度,如唤醒度、效价、明亮度、共鸣位置等,构建了超过46万条维度级标注。这一创新方法通过零样本分桶策略和三轮迭代平衡采样,显著提升了标注分布的均匀性,平均平衡度达到0.552。数据集不仅支持语音情感识别的前沿研究,还为VoiceNet项目提供了关键训练标签,推动了多维度语音表达建模的发展。其多语言覆盖(英、德、中、法、韩、日)和基于WebDataset的分片存储设计,便于大规模分布式训练与推理,对语音合成、情感计算和人机交互领域具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务