AutoArk-AI/ark-asr-3b-open-asr-leaderboard-results
收藏官方服务:
资源简介:
该数据集包含ARK-ASR-3B自动语音识别模型在公开英语短格式开放ASR排行榜分割上的原始JSONL清单文件。这些文件记录了模型在多个标准测试集(如ami、earnings22、gigaspeech、librispeech、spgispeech和voxpopuli)上的评估结果,包括词错误率(WER)和实时因子(RTFx)等性能指标。数据集用于展示模型在ASR任务中的表现,并支持排行榜的评分和比较。文件以JSONL格式存储,便于后续分析和处理。
Raw JSONL manifests for `AutoArk-AI/ARK-ASR-3B` on the public English short-form `hf-audio/open-asr-leaderboard` splits. These files contain evaluation results of the ARK-ASR-3B model on standard test sets for automatic speech recognition, including metrics like Word Error Rate (WER) and Real-Time Factor (RTFx), and are used for leaderboard scoring and comparison.
提供机构:
AutoArk-AI搜集汇总
数据集介绍

构建方式
该数据集以ARK-ASR-3B模型在开放语音识别排行榜(Open ASR Leaderboard)的英文短语音测试集上的推理结果为核心,通过本地8×RTX 4090设备生成原始JSONL清单。每个清单文件对应一个标准测试子集,如ami/test、librispeech/test.clean等,共覆盖7个公开语音数据集。评分环节采用排行榜官方脚本,确保结果与社区基准一致,并特别标注earnings22使用官方数据而非旧版缓存。
特点
数据集最显著的特点在于其全面性与标准化:囊括AMI、Earnings22、GigaSpeech、LibriSpeech(含clean与other)、SPGISpeech和VoxPopuli等多领域测试集,综合词错误率(WER)低至5.13%,实时因子(RTFx)高达197.14,展现了ARK-ASR-3B在噪声、会议、朗读及多语言场景下的卓越鲁棒性与实时性能。各子集结果以清晰表格呈现,便于横向对比。
使用方法
用户可直接加载各JSONL文件进行模型复现或二次分析,例如通过Python读取librispeech_test.clean的结果并与基线对比。若需复现评分,可调用官方得分工具`score_results`函数,指定结果目录及模型标识符,如`score_results('ark_asr/results.AutoArk-AI-ARK-ASR-3B_20260622_official', 'AutoArk-AI/ARK-ASR-3B')`。数据遵循Apache-2.0许可,适用于学术研究及商业场景的基准测试。
背景与挑战
背景概述
自动语音识别(ASR)技术在近年来取得了长足进步,尤其是大模型的出现推动了对多样化评测基准的需求。ARK-ASR-3B Open ASR Leaderboard Results数据集由ARK研究团队创建,旨在评估其3B参数规模模型在广泛英文短语音场景下的性能。该数据集依托Open ASR Leaderboard平台,整合了AMI、Earnings22、GigaSpeech、LibriSpeech、SPGISpeech及VoxPopuli等多个公开测试集,覆盖会议、财报、通用语音、朗读、开源及多语种语音等应用场景。通过统一评分工具对模型输出进行标准化评测,该数据集为ASR社区提供了可复现的基准结果,其影响力体现在为研究不同领域泛化能力及计算效率提供了科学度量。
当前挑战
该数据集面临的挑战首先源自ASR领域的核心问题——模型在跨域场景下的鲁棒性,如从清晰朗读(LibriSpeech 1.09% WER)到复杂会议(AMI 8.91% WER)的显著性能差异,体现了噪声、口音及语言风格多样性带来的识别难度。构建过程中,挑战包括确保测试集版本的一致性,例如Earnings22需使用官方最新数据而非旧缓存,以及协调不同来源数据的采样对齐与评分协议标准化。此外,计算结果(平均WER 5.13%)揭示了真实场景中实时因子(RTFx)与精度的权衡,平衡延迟与准确率成为部署的关键制约因素。
常用场景
经典使用场景
在自动语音识别(ASR)领域,该数据集的核心用途在于对大规模预训练模型进行系统化的性能基准测试。作为Open ASR Leaderboard的标准化评测数据,它汇集了来自AMI、Earnings22、GigaSpeech、LibriSpeech、SPGISpeech及VoxPopuli等多个权威测试集的转写结果。研究者可借助这些细粒度的词错误率(WER)和实时因子(RTFx)指标,横向对比不同解码策略、声学模型与语言模型组合的效能,从而筛选出在真实噪声、口音及领域偏移条件下表现最优的语音识别架构。
解决学术问题
该数据集解决了语音识别领域长期面临的可重复性与跨场景泛化评估难题。通过提供统一的评分脚本和固定分割的测试样本,它消弭了因数据预处理差异、分词规则不一而导致的性能报告偏差。学术研究者得以在公平框架下探讨模型鲁棒性、领域适配性与推理效率之间的权衡,特别是针对低资源场景(如VoxPopuli中的多语言表现)和极高噪声环境(如Earnings22中的会议录音)的识别瓶颈。其公开的原始Manifest文件还支持对错误模式进行细粒度诊断,推动了对尾音节混淆、专有名词幻觉等核心问题的定量分析。
衍生相关工作
基于该基准数据集,衍生出了一系列推动语音技术边界的工作。一方面,低RTFx值与低WER共存的可能性催生了轻量级模型蒸馏与动态计算路径优化的研究,例如利用自适应注意力掩码在GigaSpeech长语音上实现3倍加速而不增加错误率。另一方面,LibriSpeech与其他数据集之间显著的性能落差(如test-clean与test-other的WER差距仅为1.32%)引发了关于对抗训练与数据增强统一框架的探索,代表性工作包括基于频谱掩码的对比学习策略和多尺度声学特征对齐方法。这些后续研究均以ARK-ASR-3B的公开评测结果为基线,形成了闭环迭代的学术生态。
以上内容由遇见数据集搜集并总结生成



