遇见数据集

oruk-bench-leaderboard

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

oruk-bench leaderboard 是一个用于语音情感识别(SER)的基准测试排行榜数据集,记录了64个语音情感识别系统在一个多语言留出评估集上的性能结果。该数据集仅包含结果表,不包含音频数据。评估集由64,384个保留片段组成,涵盖约20种语言,包括表演、诱发和自发的语音。情感类别为7类:愤怒、快乐、悲伤、恐惧、厌恶、惊讶和中性,采用单标签分类。音频为16kHz单声道,截断至前16秒。主要评估指标是宏平均F1(macro-F1),同时报告准确率。数据集字段包括:system(系统名称)、family(系统类别,如ours/open/API/audio LLM/text only)、accuracy(准确率,0-100)、macro_f1(宏平均F1,0-1)、scored_on(评分集,full_set或subsample_5k)、is_oruk(是否为oruk模型)、note(快照说明)。系统组成:29个开源模型,18个音频LLM,11个API,5个纯文本基线,1个oruk模型。其中30个系统在完整64,384片段上评分,34个在5,000片段子样本上评分。该数据集适用于比较架构和训练方法、追踪跨语料多语言情感识别进展、审计能力声明以及研究失败模式。需注意:oruk Spectra 1模型是分布内训练,其他系统为零样本跨语料评估,因此性能差距不可直接比较;full_set和subsample_5k的评分结果不可互换。该数据集不得用于开发、营销或验证在职场或教育环境中推断自然人情绪的系统。

The oruk-bench leaderboard is a benchmark dataset for Speech Emotion Recognition (SER), recording the performance results of 64 SER systems on a multilingual held-out evaluation set. The dataset contains only result tables, not audio data. The evaluation set consists of 64,384 held-out segments spanning approximately 20 languages, including acted, elicited, and spontaneous speech. Seven emotion categories are used: anger, happiness, sadness, fear, disgust, surprise, and neutral, with single-label classification. Audio is 16kHz mono, truncated to the first 16 seconds. The primary evaluation metric is macro-averaged F1 (macro-F1), with accuracy also reported. Dataset fields include: system (system name), family (system category, e.g., ours/open/API/audio LLM/text only), accuracy (0-100), macro_f1 (0-1), scored_on (evaluation set: full_set or subsample_5k), is_oruk (whether the model is an oruk model), and note (snapshot description). System composition: 29 open-source models, 18 audio LLMs, 11 APIs, 5 text-only baselines, and 1 oruk model. Among them, 30 systems are scored on the full 64,384 segments, and 34 on a 5,000-segment subsample. The dataset is suitable for comparing architectures and training methods, tracking progress in cross-corpora multilingual SER, auditing capability claims, and studying failure modes. Note: The oruk Spectra 1 model is trained in-distribution, while other systems are evaluated zero-shot cross-corpora, so performance gaps are not directly comparable; results on full_set and subsample_5k are not interchangeable. This dataset must not be used for developing, marketing, or validating systems that infer natural human emotions in workplace or educational settings.

创建时间:
2026-08-11
原始信息汇总

oruk-bench 排行榜数据集

数据集概览

oruk-bench leaderboard 是一个语音情感识别(Speech Emotion Recognition, SER)系统的评测结果汇总数据集。该数据集包含 64 个语音情感识别系统 在单一留出多语言评测协议上的表现结果,涵盖开源检查点、商业封闭 API、音频大语言模型(LLM)及纯文本基线系统。

注意:本数据集仅包含结果表格,不包含音频数据本身。评测音频来自多个许可不同的情感语音语料库,不可再分发。

评测设置

  • 评测规模:64,384 条留出音频片段,覆盖约 20 种语言,包含表演型、诱发型和自发性语音
  • 分类任务:7 类情感(愤怒、快乐、悲伤、恐惧、厌恶、惊讶、中性),单标签分类
  • 音频规格:16 kHz 单声道,截取前 16 秒
  • 主要指标:宏平均 F1(macro-F1),同时报告准确率(accuracy)
  • 系统构成:29 个开源模型、18 个音频 LLM、11 个 API、5 个纯文本基线、1 个 oruk 自研模型;其中 30 个系统在完整集上评测,34 个在子样本上评测

数据字段说明

字段 含义
system 被评测的模型或产品名称
family 系统类别:oursopenAPIaudio LLMtext only
accuracy 准确率百分比(0–100)
macro_f1 宏平均 F1 分数(0–1),主要评测指标
scored_on 评测范围:full_set(全部 64,384 条)或 subsample_5k(5,000 条子样本)
is_oruk 是否为 oruk 自研模型
note 快照局限性说明,需结合时间背景理解

关键结果与注意事项

评测结果

  • 宏 F1 分布极广:最高 0.816,最低 0.079,大量知名系统得分低于 0.40
  • 领先系统:oruk Spectra 1 以 77.8% 准确率和 0.816 宏 F1 领先
  • 最强开源基线:emotion2vec+ 系列,准确率 68.7%,宏 F1 0.683
  • 压缩模型表现:HuBERT-large SUPERB 为 40.9%/0.249,DistilHuBERT SUPERB 为 29.5%/0.186,表明蒸馏模型在此任务中表现不佳

重要局限

  1. 分布内训练偏差:oruk Spectra 1 在评测分布内训练,而其他所有系统均为跨语料库零样本评测,两者差距不可直接对比
  2. 评测集不可互换full_setsubsample_5k 的结果并行记录,不可混用;开放性系统在子样本上重新评分差异小于 2 个百分点

使用限制

  • 适用用途:比较不同架构和训练方案,追踪跨语料库多语言情感识别进展,核验能力声明,研究失败模式
  • 标签性质:标注为人类对声音表现的感知层面注释,高分仅代表与人类评分者感知一致,不代表能判定真实情绪
  • 禁止用途:根据欧盟《人工智能法案》第 5(1)(f) 条(2025年2月2日起生效),该基准不得用于在工作场所或教育环境中开发、营销或验证推断自然人情绪的系统

引用与资源

  • 引用格式(BibTeX):见数据集原始文档
  • 相关链接
    • 交互式排行榜:https://oruk.ai/benchmarks
    • 方法论说明:https://oruk.ai/benchmarks/methodology
    • 代码与基准卡:https://github.com/Oruk-AI/oruk-bench
    • 体验最高分模型:https://oruk.ai/try
搜集汇总
数据集介绍
oruk-bench-leaderboard 数据集图片
构建方式
oruk-bench-leaderboard数据集汇聚了64个语音情感识别系统在统一评估协议下的评测结果,涵盖开放检查点、封闭API、音频大语言模型及纯文本基线。评估集由约20种语言的64,384条保留音频片段构成,包含七类基本情感标签,统一以16kHz单声道、截取前16秒处理,非原生分类体系通过别名映射对齐。由于音频受许可限制不可再分发,本数据集仅发布分数表,评分由单一实现完成,以宏F1为主要指标,辅以准确率,并区分全量集与5,000条分层子集的评分范围。
特点
数据集以表格形式记录每项系统的身份、家族类别、评分范围及是否为本实验室模型,并用注释标明日期快照的局限性。所有系统均面对跨语料库的零样本挑战,分数分布极广,从0.816到0.079,揭示跨语料库多语言语音情感识别的实际难度。特别标注了在分布内训练的oruk Spectra 1的领先表现,警示不可与零样本系统直接比较。并明确区分全量集与子集分数的非互换性,以及蒸馏模型性能下降的案例。
使用方法
适用于在统一协议下比较各系统架构与训练策略,追踪跨语料库多语言情感识别进展,评估能力声明及研究失败模式。标注基于感知评估,高分仅代表与人类评分的吻合,不反映真实情感判断。严禁将本基准用于工作场所或教育环境中推断自然人情绪的系统开发与营销,因违反EU AI Act第5(1)(f)条。所有数据以CSV文件提供,用户可下载通过标准数据处理工具分析,或访问关联GitHub仓库与交互式排行榜获取详细信息与代码。
背景与挑战
背景概述
oruk-bench-leaderboard数据集由Oruk AI于2026年创建,旨在系统性地评估跨语言语音情感识别系统的泛化能力。该数据集汇集了64个系统的评估结果,涵盖开放权重模型、商业API、音频大语言模型及纯文本基线,统一在包含约20种语言、64,384条保留语音样本的协议下进行评测。其核心研究问题在于揭示当前语音情感识别系统在跨语料、跨语言条件下的真实性能,挑战了基于单一语料库报告的乐观结果。作为基准测试结果表,该数据集不仅提供了标准化评估流程,还通过公开的别名映射和指标定义,为后续研究提供了可复现的对比框架,对语音情感计算领域具有重要参考价值,并推动了该领域对模型泛化能力和评估方法论的深入思考。
当前挑战
该数据集所应对的领域挑战主要在于跨语料、跨语言的语音情感识别性能显著下降,这一现象在宏F1分数从0.816到0.079的巨大跨度中体现得淋漓尽致,凸显了模型在分布外数据上的脆弱性。构建过程中的挑战则更为复杂:一方面,来自不同许可协议的情感语音语料库无法直接重新分发,迫使团队设计出基于基准卡片的等效集重构方案;另一方面,由于资源限制,商业API与大型音频模型仅能在5,000条样本子集上评估,这造成了全量集与子集间评分的不完全可比,团队需通过细致标注每行数据的评分范围来维护严谨性。此外,模型原生标签体系各异,团队不得不引入公开的别名映射表以统一分类标准,这一系列方法论上的权衡与妥协,深刻体现了构建一个公平、可复现的跨语种情感识别基准的艰巨性。
常用场景
经典使用场景
oruk-bench-leaderboard数据集作为语音情感识别领域的权威基准排行榜,其核心应用场景在于为研究人员与开发者提供一个统一、公平的模型性能比较平台。该数据集汇集了64个不同来源的语音情感识别系统在同一held-out多语言评估协议下的评测结果,涵盖了开放权重模型、商业API、音频大语言模型以及纯文本基线等多种技术路线。研究者可依据宏F1分数这一主要指标,系统性地对比不同架构与训练策略在跨语料、多语言条件下的泛化能力,进而识别当前技术的优势与短板,为后续模型改进与选型提供坚实的数据支撑。
衍生相关工作
该数据集及相关评测框架催生了多项衍生性研究工作。其公开的基准卡、方法论文档与重建等价评测集的指南,为后续研究提供了可复现的评测范式。榜单中关于压缩模型(如DistilHuBERT)性能显著下降的发现,启发了针对语音情感识别任务的高效模型蒸馏与压缩技术研究,促使学界探索保留韵律等副语言信息的轻量化架构。同时,数据集的文本基线对比分析,推动了多模态融合研究,尤其是语音与文本信息在情感识别中的互补性探究。此外,其揭示的跨语料性能衰退现象,已成为领域内分析分布偏移、发展无监督域适应方法的重要立足点。
数据集最近研究
最新研究方向
当前语音情感识别领域的研究前沿聚焦于跨语料、多语言的泛化能力评估,oruk-bench leaderboard数据集为此提供了迄今为止最为严谨的基准测试平台。该数据集汇聚了64个系统,涵盖开放权重模型、商业API、音频大型语言模型及纯文本基线,在涵盖约20种语言的64,384条保留样本上执行统一评估,全面揭示了多数头部系统在跨语料情境下的性能崩塌现象。研究显示,宏F1分数从顶部的0.816急剧下降至底部的0.079,凸显了单一语料集内报告的高性能在直面分布外数据时难以维系。尤为值得关注的是,模型压缩技术(如HuBERT到DistilHuBERT的蒸馏)在此任务中代价显著,性能跌幅超过10个百分点,表明语音情感识别所依赖的韵律信息对蒸馏过程极度敏感。此外,该基准的推出恰逢欧盟《人工智能法案》对特定场景情感推断的禁令生效,其详尽的结果表为审视这一立法提供了科学依据——广泛的能力差异确证了当前技术尚不足以支撑高风险的伦理应用,从而为构建负责任的研究范式设置了新的标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务