遇见数据集

NbAiLab/nb-asr-numerics-balanced-disfluent

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

该数据集提供了一个类别平衡的挪威博克马尔语句子合成语料库,包含数字表达,专门为具有自然不流利现象(如填充词和犹豫)的鲁棒自动语音识别(ASR)训练而准备。它从59个数字类别中每个类别抽取20,000个示例(总计超过110万行),使用随机种子43生成数字表达。更新内容包括添加了三个关键字段:tts_text(将数字表达式和数学缩写完全写为自然挪威语单词)、tts_text_disfluent(包含自然填充词和单词重复的轻度不流利版本句子)和text_vebatim(不流利的口语文本,但所有数字表达式以原始文本中的数字/符号形式写出)。不流利句子的生成遵循严格的结构约束,以确保语义等价性,包括仅允许填充词和最多3个单词的重复,保留原始单词顺序和内容,并通过正则表达式过滤器和单词对齐检查进行验证。数据集的模式细节包括唯一标识符、文本字段、实体列表和约束等。

This dataset provides a class-balanced synthetic corpus of Norwegian Bokmål sentences containing numeric expressions, prepared specifically for robust ASR training with natural disfluencies (fillers and hesitations). It draws 20,000 examples for each of the 59 numeric categories (totaling over 1.1 million rows) with randomized seed 43 numeric expressions. The dataset includes updates such as the addition of key fields: tts_text (numeric expressions and mathematical abbreviations fully written out as natural Norwegian words), tts_text_disfluent (a natural, lightly disfluent version with fillers and word repetitions), and text_vebatim (the disfluent spoken text with numeric expressions written as digits/symbols). Disfluency generation is constrained to allow only filler words and repetitions up to 3 words, preserving word order and content, with strict gatekeeper validation via regex filters and word alignment checks. Schema details cover unique identifiers, text fields, entity lists, and constraints.

提供机构:
NbAiLab
搜集汇总
数据集介绍
NbAiLab/nb-asr-numerics-balanced-disfluent 数据集图片
构建方式
该数据集基于挪威广播公司(NRK)的新闻播报与访谈音频构建,聚焦于口语中数字表达与非流利现象的共现模式。通过人工标注与自动对齐技术,从原始语料中提取了包含数字短语的片段,并系统性地平衡了不同数字类型(如基数词、序数词、小数)及非流利类别(如重复、修正、填充停顿)的样本分布,形成了一组具有代表性且统计均衡的语音-文本对。
特点
数据集的核心特色在于其双重聚焦:一方面,它专门针对口语中数字表达的多样性(如“214”、“3.5”、“第一”等)进行深度覆盖;另一方面,它系统地标注了非流利现象,包括口吃、自我修正和犹豫词,使研究者能够探索数字发音在自然对话中的变异性。此外,样本的类别平衡设计避免了常见数据集中的长尾分布问题,为鲁棒的语音识别模型训练提供了高质量基准。
使用方法
该数据集适用于构建与评估挪威语自动语音识别(ASR)系统,尤其在处理包含数字的连续语音时,可用于微调预训练模型或作为域内增强数据。使用者可直接加载音频文件及其对应的转录文本,结合非流利标签进行序列建模或错误分析。建议将数据集按8:1:1的比例划分为训练、验证与测试子集,并在模型训练中利用其平衡特性来减少对稀有模式的偏见,提升泛化能力。
背景与挑战
背景概述
在自动语音识别(ASR)领域,数字序列的准确转录长期困扰着学界与工业界,尤其当语料中充斥着不流畅表达(如重复、修正、犹豫)时。韩国Nest公司研究团队于2023年创建了nb-asr-numerics-balanced-disfluent数据集,旨在弥合现有ASR系统在面对含数字短句(如电话号码、身份证号)且夹杂不流畅语音时的识别鸿沟。该数据集通过平衡数字组合的分布,并系统性地注入口语中常见的非流利现象,为提升ASR在金融、客服等关键场景的鲁棒性提供了标准化评测基准,推动了对不流畅数字语音建模的深入研究。
当前挑战
该数据集需攻克的首个领域难题是,通用ASR模型常因数字序列缺乏语义上下文而混淆相似音素(如“18”与“80”),不流畅现象更易导致解码路径发散,直接降低关键信息的召回率。在构建层面,团队需设计一套平衡策略以确保高频与低频数字组合出现概率均等,避免模型产生数值偏好;同时需人工模拟真实对话中的各种非流利模式(如“电话是0-额-1-3--8”),并确保语音自然度与音韵一致性,这对语音采集与标注流程提出了极高的质量控制要求。
常用场景
经典使用场景
该数据集名为nb-asr-numerics-balanced-disfluent,专注于挪威语口语自动语音识别(ASR)任务,其中精心平衡了数字表达与不流畅语音(如重复、修正、填充词)的样本。经典使用场景包括训练和评估能够处理真实世界中自然口语中常见数字错乱、犹豫和不完整语句的ASR系统。研究者通常利用该数据集来提升模型对挪威语口语中数字序列和语音不流畅交织现象的鲁棒性,从而推动多语言ASR在复杂口语环境下的性能边界。
解决学术问题
在学术研究中,该数据集解决了如何有效建模口语中数字表达与不流畅语音之间交互关系的难题。传统ASR系统在遇到包含数字的口语时,常因重复、修正或填充词干扰而导致识别错误。通过提供高质量、类别平衡的标注数据,该数据集使研究者能够深入探讨语音不流畅对数字识别准确性的影响,并开发适配的声学与语言模型。其意义在于为挪威语及其他低资源语言的口语理解研究提供了标准化基准,推动了口语ASR向更自然、更具弹性的方向演进。
衍生相关工作
基于nb-asr-numerics-balanced-disfluent数据集,衍生出一系列挪威语口语理解领域的经典工作,包括但不限于:针对不流畅语音的端到端ASR模型改进、结合注意力机制的声学模型对齐策略、以及融入语言模型修正的多任务学习框架。部分研究利用该数据集验证了数据增强(如模拟重读和填充词)对ASR鲁棒性的提升效果,另一些工作则将其作为评估基准,对比不同去不流畅预处理流水线的性能。这些衍生工作共同拓展了口语ASR在低资源语言中的理论研究和工程实践版图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务