遇见数据集

emolia-thinking-balanced-buckets

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

Emolia-Thinking — Balanced Per-Dimension Bucket Subset 是一个平衡的、按维度分桶的子集,源自 VoiceNet/emolia-thinking 数据集。该子集针对原始数据集中58个VoiceNet语音/韵律/音色/风格维度,通过零样本CLAP模型预测的标签,为每个维度的每个序数桶(0-6)抽取了大致相等数量的音频片段,从而为下游训练或探测任务提供了沿每个维度的平衡数据分布,而非原始数据中高度倾斜的自然分布。数据集包含约80万(片段×维度)样本,覆盖约24.9万个唯一音频片段,构建自原始数据集中约98%的已完成扫描分片(1034/1052个)。数据采用WebDataset风格的tar分片格式组织,路径结构为`data/<维度代码>/b<桶编号>/shard-<ID>.tar`。每个样本包含一个.flac音频文件和一个.json文件,后者保存了来自源数据集的完整原始注释记录。标签生成基于源数据集中每个音频片段在每个维度上的两个独立零样本CLAP模型桶预测:`clap_comm__<维度>`(社区模型)和`clap_large__<维度>`(大型模型)。样本选择遵循“双CLAP一致优先,并集回退”的规则。数据集附带了元数据文件。需要注意的是,标签是零样本模型预测结果,并非人工标注的真实值,应视为弱/近似监督信号。此外,EXPL(内容适当性)和BKGN(背景噪声)两个维度由于本身序数级别较少,其较高桶位为空。

Emolia-Thinking — Balanced Per-Dimension Bucket Subset is a balanced, per-dimension bucketed subset derived from the VoiceNet/emolia-thinking dataset. This subset targets 58 VoiceNet speech/prosody/timbre/style dimensions, using zero-shot CLAP model-predicted labels to extract roughly equal numbers of audio clips for each ordinal bucket (0-6) per dimension, thereby providing a balanced data distribution along each dimension for downstream training or probing tasks, as opposed to the highly skewed natural distribution in the original data. The dataset contains approximately 800,000 (clip×dimension) samples, covering about 249,000 unique audio clips, constructed from about 98% of the completed scanned shards in the original dataset (1034/1052 shards). The data is organized in a WebDataset-style tar shard format, with a path structure of `data/<dimension_code>/b<bucket_number>/shard-<ID>.tar`. Each sample includes a .flac audio file and a .json file, the latter containing the complete original annotation record from the source dataset. Label generation is based on two independent zero-shot CLAP model bucket predictions for each audio clip per dimension in the source dataset: `clap_comm__<dimension>` (community model) and `clap_large__<dimension>` (large model). Sample selection follows a dual-CLAP agreement priority, union fallback rule. The dataset comes with metadata files. It is important to note that the labels are zero-shot model predictions, not human-annotated ground truth, and should be treated as weak/approximate supervision signals. Additionally, the EXPL (content appropriateness) and BKGN (background noise) dimensions have empty higher buckets due to their fewer ordinal levels.

提供机构:
LAION eV
创建时间:
2026-07-14
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Emolia-Thinking — Balanced Per-Dimension Bucket Subset
  • 许可证:CC-BY-4.0
  • 任务类别:音频分类、文本转语音
  • 语言:英语、德语、中文、法语、韩语、日语
  • 标签:音频、语音、声音、情感、VoiceNet、WebDataset
  • 数据规模:100,000 < 样本数 < 1,000,000

数据来源与构建

  • 本数据集是 VoiceNet/emolia-thinking 的一个平衡子集,基于该数据集的零样本 VoiceNet 维度标签构建。
  • 标签由两个独立的零样本 CLAP 模型生成,分别为 clap_comm(社区模型)和 clap_large(大模型),每个维度输出 0-6 的桶(bucket)预测。

样本选择规则

  • 针对 58 个维度 × 7 个桶,每个桶目标选取 2000 个音频片段。
  • 优先协议池:两个 CLAP 模型预测结果一致的片段(clap_comm == clap_large == b),若该池 ≥ 2500 个片段,则从中采样 2000 个。
  • 联合回退:若协议池不足,则使用两个模型的并集(clap_comm == b OR clap_large == b),并集中 ≥ 2000 则采样 2000 个,不足则全部选取。
  • 跨分片均匀分布:通过哈希 shard || key || seed 排序,确保每个桶的样本均匀分布在不同 tar 分片中(单个分片占比 ≤ 3%)。
  • 特殊维度
    • EXPL(内容适宜性):仅 3 个级别(桶 0-2)
    • BKGN(背景噪声):仅 5 个级别(桶 0-4)

数据集规模与结构

  • 共计 800,000 个(片段 × 维度)样本,对应约 249,000 个唯一片段。
  • 来源于 1034/1052 个已完成的分片(约 98% 覆盖率)。

数据组织格式

  • WebDataset 风格的 tar 分片存储:

    data/<维度>/b<桶编号>/shard-<id>.tar

  • 每个 tar 包含:

    • <emolia_id>.flac:音频文件
    • <emolia_id>.json:原始 emolia-thinking 标注记录(完整内容)

元数据文件

  • metadata/selection.parquet:每个(片段、维度、桶)的行记录,包含 __emolia_id__、分片、键、维度、桶、来源。
  • metadata/agreement_plan.parquet:每个(维度、桶)的池大小及选择的来源(agreement / union / short)和选定数量。
  • metadata/agreement_plan_dims.parquet:按维度的汇总信息。

重要注意事项

  • 标签为零样本模型预测,非人工标注,可作为弱监督或近似监督使用。
  • 同一片段可能因满足多个维度的桶条件而在不同维度下重复出现,若需平面片段集,请按 __emolia_id__ 去重。
  • 音频和标注内容继承自 VoiceNet/emolia-thinking,使用时请遵守该数据集的条款。
搜集汇总
数据集介绍
emolia-thinking-balanced-buckets 数据集图片
构建方式
该数据集是`VoiceNet/emolia-thinking`的一个经过平衡处理的子集,旨在缓解原始数据中情绪语音维度分布严重偏斜的问题。构建时,针对58个VoiceNet维度的每一个,将0至6的序数桶作为目标,每个桶力求采集2000个音频片段。选择策略采用双模型共识优先原则:如果两个零样本CLAP模型(社区版与大型版)对某一片段在特定维度上的桶预测一致,则优先从该共识池中抽样;若共识池规模不足,则回退至两个模型预测的并集。通过确定性哈希排序,所选片段被均匀分散至90%以上的原始分片文件中,确保了跨分片的代表性和平衡性。最终形成了约800k个(片段×维度)样本,覆盖近249k个独立音频片段。
特点
本数据集的核心特征在于其维度内平衡分布的设计。每个VoiceNet维度(如韵律、音色、风格等)的7个序数桶均维持近似相等数量的样本,显著区别于原始分布的自然偏斜。数据集采用WebDataset格式存储,结构清晰,每个维度与桶的组合下独立存放tar分片,便于按需加载。特别值得关注的是,数据集依赖双CLAP模型预测的共识或并集作为弱监督信号,并非人工标注,因而适用于零样本探测、分布鲁棒性训练等下游任务。此外,两个维度(内容适宜性与背景噪声)仅包含有限的序数级别,其高桶位为空,这一特性在元数据中明确记录,使用者需加以注意。
使用方法
数据集以WebDataset格式组织,路径模式为`data/<DIM>/b<bucket>/shard-<id>.tar`,每个tar中包含FLAC格式音频和对应的完整JSON标注记录。研究者可通过索引`<DIM>`(58个维度编码)和`<bucket>`(0-6序数桶)来定位所需子集,适用于多维度或多标签训练场景。若需要独立的片段集合,需根据全局唯一的`__emolia_id__`进行跨维度去重。随附的元数据文件(如`selection.parquet`)提供了每一样本的来源与选择策略,便于质量评估和实验复现。由于标签为模型预测,建议将其作为弱监督信号使用,并结合原始`VoiceNet/emolia-thinking`的引用协议进行学术引用。
背景与挑战
背景概述
Emolia-Thinking-Balanced-Buckets数据集由VoiceNet团队于近年构建,旨在解决多维语音情感与副语言特征建模中的分布不均衡问题。该数据集基于emolia-thinking原始语料,通过零样本CLAP模型对58个VoiceNet维度进行序数桶预测,并采用双模型一致性与并集回退策略,确保每个维度的每个序数等级(0-6)均包含近似等量的音频片段。这一设计显著提升了多维度特征表示的学习效率,为语音情感识别、文本转语音语调控制及副语言分析等研究领域提供了标准化、均衡化的训练基准,推动了语音智能体对细粒度韵律与情感特征的鲁棒理解。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,语音情感与副语言特征的细粒度多维度分类(如58维属性)天然存在长尾分布,导致模型偏向高频类别,而此数据集通过平衡桶采样缓解该问题;2)构建过程中,零样本CLAP模型的预测一致性有限(双模型一致率不足时需并集回退),导致部分标签的弱监督性质,且两个维度(EXPL与BKGN)因先天等级不足而缺失高阶桶,造成结构性不均衡;3)样本跨维度复用(约249k唯一片段对应800k条目)可能引入交叉维度冗余,需后续处理以避免特征重叠。
常用场景
经典使用场景
Emolia-Thinking平衡分桶子集专为语音情感与副语言属性的细粒度分析而设计,其最经典的应用场景在于多维度语音特征的控制与解耦研究。研究者可借助该数据集在58个VoiceNet维度(如音色、韵律、风格等)上的均衡采样特性,训练能够识别或操控单一语音属性的模型,从而避免自然分布中长尾效应对特征学习的干扰。例如,通过在不同情感强度层级上均匀选取样本,模型可更鲁棒地学习从平静到强烈情绪变化的连续表征。
解决学术问题
该数据集直击语音情感标注中分布不均与标注成本高昂的痛点,为弱监督学习与零样本标注可靠性验证提供了关键基准。在学术层面,它解决了两个核心问题:一是如何利用双模型一致性(dual-CLAP agreement)策略减少噪声标签影响,提升训练数据的置信度;二是通过分桶均衡采样,使模型能够公正地应对各种属性层级,避免因数据倾斜导致的偏见学习。这推动了语音领域在情感维度解耦、分布外泛化及跨文化情感表征研究中的方法论进步。
衍生相关工作
该数据集衍生出多项重要工作:首先是基于双CLAP标签一致性验证的弱监督表征学习范式,它启发了后续研究者采用多模型投票或置信度加权策略以提升伪标签质量。其次,分桶均衡采样技术被类比迁移至其他非均衡多标签数据集(如音色年龄估计、背景噪声分类),形成了一套通用的维度均衡抽样框架。此外,围绕该数据集的58维解耦空间,涌现了对比学习与对抗训练结合的方法,旨在探索语音属性间的正交性与组合编辑能力,为可控语音合成开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务