遇见数据集

amu-cai/CAMEO

收藏
Hugging Face2025-05-20 更新2025-07-05 收录
官方服务:

资源简介:

CAMEO是一个多语言情感语音数据集的集合。它包括13个不同的数据集,包含41,265个音频样本,并涵盖了8种语言:孟加拉语、英语、法语、德语、意大利语、波兰语、俄语和西班牙语。该数据集适用于音频分类、自动语音识别和语音合成等任务。

CAMEO is a curated collection of multilingual emotional speech datasets. It includes 13 distinct datasets with transcriptions, encompassing a total of 41,265 audio samples. The collection features audio in eight languages: Bengali, English, French, German, Italian, Polish, Russian, and Spanish.

提供机构:
amu-cai
搜集汇总
数据集介绍
构建方式
在情感计算与语音交互领域,高质量的多语种情感语音数据集是推动模型泛化能力的关键基石。CAMEO数据集通过系统化的整合策略,从全球范围内遴选出13个公开可用的情感语音语料库,涵盖孟加拉语、英语、法语、德语、意大利语、波兰语、俄语和西班牙语共八种语言。其构建遵循三重严格标准:语料库须以允许非商业用途及衍生创作的许可证发布;每条语音样本必须附带正交转录文本;情感标注须遵循学界公认的基本情绪分类体系。最终汇聚成包含41,265条音频样本的标准化集合,每条样本均统一提供16kHz采样率的波形数据,并保留原始语料库中的说话人身份、性别、年龄及情感标签等多元元信息。
特点
该数据集的核心特质在于其卓越的跨语言覆盖度与精细化的元数据体系。相较于单一语言的情感语料,CAMEO首次将八种分属不同语系的语言纳入统一框架,为研究情感表达的语言特异性与跨文化共性提供了珍贵资源。每个样本均配备完整的结构化字段,包括唯一的文件标识符、情感标签、正交转录文本、说话人人口统计学信息(性别与年龄)及来源语料库归属,这种多维标注体系使其天然适配语音情感识别、自动语音识别及文本转语音等多项任务。特别值得关注的是,数据集刻意避免划分训练集与测试集,以规避不同语料库间潜在的样本污染风险,从而保障研究评估的严谨性。
使用方法
研究者可通过Hugging Face的datasets库便捷地加载该数据集,仅需一行代码即可根据需求指定特定子集进行实验。在语音情感识别任务中,可调用情感标签字段与音频特征构建分类模型;对于自动语音识别场景,转录文本与音频对的天然对齐关系为端到端模型提供了理想训练材料。数据集的评估脚本提供了完整的验证流程,支持按语种或全局粒度计算宏平均F1分数、加权F1分数及准确率等指标,并通过Levenshtein距离算法实现预测标签的模糊匹配纠错。此外,各子数据集独立的许可证信息(涵盖CC BY-SA、Apache 2.0、MIT等六种协议)已嵌入元数据字段,便于使用者合规地进行学术研究与模型开发。
背景与挑战
背景概述
CAMEO(多语言情感语音语料库合集)由Iwona Christop和Maciej Czajka于2025年创建,旨在解决语音情感识别(SER)领域数据资源稀疏且语言覆盖不均的困境。该数据集整合了13个公开可用的情感语音子集,包含41,265条音频样本,涵盖孟加拉语、英语、法语、德语、意大利语、波兰语、俄语及西班牙语八种语言,并统一提供文本转写、说话人元数据及情感标签。通过系统化归并CREMA-D、RAVDESS、SUBESCO等分散语料库,CAMEO为跨语言情感计算研究提供了标准化基准,其发布极大推动了多模态情感分析与语音合成领域的技术迭代与模型泛化能力评估。
当前挑战
CAMEO面临的核心挑战在于多源语料库的异构性整合与评估公平性。首先,各子集在情感类别定义(如JL-Corpus包含“焦虑”“道歉”等非基本情绪)、录音环境、说话人人口统计学分布及标注粒度上存在显著差异,导致跨数据集联合训练时需解决标签对齐与噪声鲁棒性问题。其次,因所有语料均源自已公开资源,为避免数据泄露风险,CAMEO未预设标准训练-测试分割,迫使研究者需自行设计去污染策略,如基于Levenshtein距离的模糊匹配过滤。此外,低资源语言(如孟加拉语SUBESCO)的样本量虽达7000条,但情感均衡性与音频质量仍受原始采集协议限制,为构建高泛化性模型带来额外挑战。
常用场景
经典使用场景
CAMEO数据集的核心应用场景在于语音情感识别(Speech Emotion Recognition, SER),其汇聚了13个公开语料库、涵盖8种语言的逾4万条音频样本,每条样本均带有细粒度的情感标签(如愤怒、喜悦、悲伤等)及对应的正交转录文本。研究者可基于此统一框架进行跨语言、跨语料库的情感分类模型训练与评估,亦可利用其提供的说话人身份、性别、年龄等元数据,探究情感表达中的个体差异与人口统计学特征。该数据集的标准化格式与预定义评估协议,为对比不同模型在情感识别任务上的泛化能力提供了坚实基准。
衍生相关工作
CAMEO的发布催生了一系列后续研究,其中最具代表性的是基于其统一框架进行的跨语言情感识别基准测试,研究者利用该数据集对比了卷积神经网络(CNN)、时序模型(如LSTM)及预训练语音模型(如Wav2Vec 2.0、HuBERT)在8种语言情感分类任务上的性能。此外,部分工作聚焦于情感标签的细粒度建模,通过CAMEO提供的丰富元数据探索年龄、性别对情感表达的影响,并衍生出说话人归一化与对抗性去偏方法。还有学者将CAMEO作为预训练数据,在下游低资源语言的情感识别任务中通过微调实现知识迁移,显著缓解了数据稀疏问题,推动了多语言情感计算的前沿进展。
数据集最近研究
最新研究方向
CAMEO数据集作为多语种情感语音的综合性基准,正推动语音情感识别(SER)领域向跨语言泛化与多任务联合建模的前沿迈进。当前研究热点聚焦于利用其涵盖八种语言、13个子集的丰富性,探索情感标签在不同文化语境下的语义对齐问题,以及融合转录文本与声学特征的情感-语音联合表示学习。该数据集的出现有效缓解了情感语音资源在语种分布上的不均衡困境,为构建鲁棒的、文化敏感的语音交互系统提供了关键支撑,尤其在多语言人机对话和跨文化情感计算应用中展现出深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务