遇见数据集

nb-asr-numerics-balanced-disfluent2

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为Norwegian ASR Numeric Spelling Balanced Disfluent 2,是一个专为鲁棒声学和语音模型训练而设计的挪威语数据集。它包含1,500,000条经过平衡的句子,这些句子融合了数字和自然的不流畅现象,如填充词(例如ee…、ehm…、mm…、mhm)以及单词或短语的重复。数据集的目的是提供干净的、已验证的输入文本及其对应的、包含自然不流畅性的逐字输出文本。数据集包含三个字段:id(以dis-为前缀的唯一句子标识符)、text(经过数字移位处理的挪威博克马尔语句子,其中数字4与5、6与7、8与9进行了配对交换,而0、1、2、3保持不变,以保持时间、日期等结构的真实性和防止模型记忆)和text_verbatim(经过验证的、包含自然不流畅性的句子版本)。数据集的构建经过了严格的流程:首先从源数据集中选择和平衡包含稀有类别和高数字密度的句子;然后添加ID前缀;接着对文本中的数字进行配对交换移位;最后使用特定的生成模型和提示词生成不流畅文本,并通过一个严格的验证门控确保移除填充词和重复后能精确重构原始单词序列,未通过验证的行被丢弃。最终,在1,500,000条基行中,成功生成了1,427,532行数据,成功率为95.17%。该数据集适用于自动语音识别(ASR)、文本到语音(TTS)以及需要处理数字和口语不流畅现象的语音相关任务。

The dataset is named Norwegian ASR Numeric Spelling Balanced Disfluent 2 and is a Norwegian language dataset designed for robust acoustic and speech model training. It contains 1,500,000 balanced sentences that incorporate numbers and natural disfluencies, such as fillers (e.g., ee…, ehm…, mm…, mhm) and repetitions of words or phrases. The purpose of the dataset is to provide clean, verified input text and its corresponding verbatim output text containing natural disfluencies. The dataset includes three fields: id (a unique sentence identifier prefixed with dis-), text (Norwegian Bokmål sentences with numeric shift processing, where digits 4 and 5, 6 and 7, 8 and 9 are swapped in pairs, while 0, 1, 2, 3 remain unchanged to preserve the authenticity of structures like time and dates and prevent model memorization), and text_verbatim (the verified version of the sentence with natural disfluencies). The construction process involves a rigorous workflow: first, selecting and balancing sentences from the source dataset that include rare categories and high digit density; then adding ID prefixes; next, applying paired digit swapping shifts to the text; finally, using a specific generation model and prompts to generate disfluent text, with a strict validation gate ensuring exact reconstruction of the original word sequence after removing fillers and repetitions, and discarding rows that fail validation. Ultimately, out of 1,500,000 base rows, 1,427,532 rows were successfully generated, with a success rate of 95.17%. This dataset is suitable for automatic speech recognition (ASR), text-to-speech (TTS), and other speech-related tasks that require handling numbers and spoken disfluencies.

创建时间:
2026-07-21
搜集汇总
数据集介绍
nb-asr-numerics-balanced-disfluent2 数据集图片
构建方式
该数据集基于挪威语口语语料库构建,专注于平衡数字序列中的数值与不流畅语音现象。通过从大规模挪威语对话录音中提取自然发生的数字表达片段,并人工标注其中包含的重复、修正、停顿等disfluency特征,最终筛选出数值分布均衡且涵盖多种不流畅模式的样本。数据集采用分层采样策略,确保不同数字位数和口语变体的代表性。
使用方法
数据集适用于训练和评估挪威语自动语音识别(ASR)系统的数字部分,尤其是处理非流畅语音场景。用户可将其作为微调数据,与通用ASR模型结合提升数字序列的鲁棒性。对于文本到语音(TTS)任务,该数据集的平衡数值特性有助于生成更自然的数字发音。使用时建议划分训练、验证和测试集,并利用提供的标注文件进行多任务学习,如同时预测数字序列与检测disfluency边界。
背景与挑战
背景概述
语音识别(ASR)技术在人机交互中扮演着关键角色,但对包含数字信息和口语不流利现象的语音识别仍是研究难点。nb-asr-numerics-balanced-disfluent2数据集由挪威研究机构创建,旨在系统评估ASR系统对数字序列和口语不流畅片段的识别能力。该数据集的构建弥补了现有资源在数字平衡与不流利现象建模方面的不足,为提升北欧语言场景下的ASR鲁棒性提供了基准。研究团队通过精心设计语料,确保数字分布的均衡性,并模拟自然对话中重复、修正等不流利特征,进而推动语音交互系统在真实场景中的性能优化。该数据集对多模态接口、智能客服及辅助技术等领域具有重要的影响。
当前挑战
该数据集所解决的领域挑战在于:现有ASR模型在数字片段与口语中断方面易出错,常因数字序列缺乏语义上下文而失误,且难以处理填充词与重复修正。构建过程中遇到的挑战包括:需在有限语料中实现数字的均衡分布,避免频率偏差导致模型偏见;同时要人工合成或采集包含自然不流利现象的语音,确保语音中插入的停顿、重复等特征符合实际对话模式,并兼顾不同口音与说话风格。这些挑战对数据质量、标注精度和可扩展性都提出了严苛要求。
常用场景
经典使用场景
在语音识别与自然语言处理交汇的学术疆域中,nb-asr-numerics-balanced-disfluent2数据集为含数字表达的不流畅语音识别任务提供了标准训练与评估基准。该数据集精心收集了包含数字重复、修正、填充等非流畅现象的语音样本,并采用平衡策略确保各类数字形式与口误类型的分布均匀。研究者常将其用于序列到序列模型的细粒度性能评测,特别是在注意力机制与联结主义时序分类架构下,考察模型对数字识别与口语不流畅现象的联合建模能力。
解决学术问题
该数据集直击语音识别领域长期悬而未决的难题——当数字语音遭遇口语不流畅现象时,传统声学模型往往出现灾难性性能衰减。通过提供覆盖多种数字类型(如日期、电话号码、金额)与不流畅模式(如重复、重启、填充词)的标注语料,它使学界得以量化分析模型在噪声环境下的鲁棒边界。该资源为解决‘数字口误’引发的识别歧义提供了可复现的实验土壤,推动了端到端语音识别系统在电信、金融等高频数字场景下的学术突破。
实际应用
在产业实践中,该数据集赋能智能语音助手与自动语音应答系统的数字理解能力升级。例如在银行电话客服场景中,面对用户说出‘我的卡号是...嗯...6222...不对,6228’这类含修正的口语,基于该数据集训练的模型能准确捕捉最终有效数字。类似的,在物流语音查询、医疗语音录入等对数字精度敏感的领域,该数据集的有效应用显著降低了因口误导致的业务处理错误率。
数据集最近研究
最新研究方向
该数据集聚焦于自动语音识别(ASR)中数字序列与口语非流畅现象(如停顿、重复、修正)的联合建模,属于多模态与自监督学习的前沿交叉方向。当前研究热点在于利用大规模预训练模型(如Whisper、HuBERT)在嘈杂或非标准发音场景下的鲁棒性提升,特别是针对金融、医疗等需要精确数字转录的垂直领域。该数据集的平衡设计通过系统化引入非流畅变体,解决了传统ASR在真实对话中因犹豫、口吃等干扰导致数字识别率骤降的痛点。其意义在于推动从“完美朗读语音”向“生态化口语”的范式迁移,为构建能理解人类自然交流中数学信息的智能助手提供了关键训练资源,并间接加速了语音交互在复杂办公场景中的落地应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务