遇见数据集

unnamed-split-ar

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是阿拉伯语YODAS v3数据集的改进版本,通过使用Silero VAD(语音活动检测)将长录音(中位长度约5分钟)依据静音段切割为5-45秒的语音片段,每个片段附带对应的转录文本。切割点基于至少150毫秒的停顿,确保不落在语音中间。数据集提供每个片段的起始时间、结束时间、持续时间、语音比例(VAD判定的语音占比)、是否干净切割(clean_cut)等字段。音频格式为Opus 48 kbps 16 kHz单声道Ogg。文本来自YouTube字幕,经过过滤:移除无文本、重复字幕、非语音标记(如[موسيقى])、语音比例低于35%或每字符时长异常(1-30字符/秒)的片段。方言标签(dialect)来自Nawah-Dialect-BERT-6M模型在整段源录音上的预测,包括13种阿拉伯方言和现代标准阿拉伯语(msa),并附带所有14类的概率分布(dialect_probs)。请注意,方言标签是预测结果,可能反映文本语体而非说话人口音,且转录本身由机器生成。数据集按source_id分组,建议按source_id而非行进行数据划分,以避免同一说话人或主题出现在训练和验证集中。许可证为CC-BY-3.0。

This dataset is an improved version of the Arabic YODAS v3 dataset. It uses Silero VAD (Voice Activity Detection) to split long recordings (median length ~5 minutes) into 5-45 second audio segments based on silence intervals, each with corresponding transcription text. The splitting points are based on pauses of at least 150 milliseconds to ensure they do not fall within speech. The dataset provides fields such as start time, end time, duration, speech ratio (proportion of speech determined by VAD), and clean_cut for each segment. Audio is in Opus 48 kbps 16 kHz mono Ogg format. Text comes from YouTube subtitles and is filtered: removing segments with no text, duplicate subtitles, non-speech markers (e.g., [موسيقى]), speech ratio lower than 35%, or abnormal per-character duration (1-30 characters/sec). Dialect labels (dialect) are predicted by the Nawah-Dialect-BERT-6M model on the full source recording, including 13 Arabic dialects and Modern Standard Arabic (msa), with probability distributions for all 14 classes (dialect_probs). Note that dialect labels are predictions and may reflect the text register rather than the speakers accent, and the transcription itself is machine-generated. The dataset is grouped by source_id, and it is recommended to split data by source_id rather than by rows to avoid the same speaker or topic appearing in both training and validation sets. License: CC-BY-3.0.

创建时间:
2026-09-29
原始信息汇总

数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/oddadmix/unnamed-split-ar
  • 许可证:CC-BY-3.0(继承自 YODAS v3)
  • 任务类别:自动语音识别(automatic-speech-recognition)
  • 语言:阿拉伯语(ar)
  • 配置名称:default
  • 划分:train(数据文件路径:data/train-*.parquet)

数据集描述

该数据集是 espnet/yodas3 的 data/ar/ 分区,将长录音(中位数约 5 分钟)切分为 5-45 秒的片段,每个片段带有独立转录文本,可直接用于 ASR 训练的批处理,无需进一步分割。

音频格式:Ogg 格式,Opus 48 kbps 单声道,16 kHz。

加载方式

python from datasets import load_dataset ds = load_dataset("oddadmix/unnamed-split-ar", split="train", streaming=True)

切分来源

上游时间戳为 YouTube 字幕提示(caption cues),并非话语片段。在 data/ar 的一个分片上测量结果:

  • 71.8% 的连续提示严格重叠(中位间隔 -2.36 秒):start + duration 表示提示在屏幕上停留的时长,而非语音结束时间。
  • 仅 9.7% 的提示边界存在 ≥ 0.3 秒的真实静音间隔,因此在字幕边界切分会导致大多数切点落在连续语音内部。
  • 将字幕边界吸附到附近最安静的窗口也无法解决该问题:经独立 VAD 评分,54.8% 的此类切点仍落在语音中。

因此本数据集的切分方式相反:使用 Silero VAD 检测停顿,仅允许 ≥ 150 毫秒的停顿作为切点,然后将转录文本分配给产生的片段。相同测量方式下,0.0% 的切点落在语音中。

由于文本随切分而定,在有词级时间戳的提示中(68% 的提示)通过词时间进行分配,否则按多数重叠分配。cues 保留了贡献的提示片段及其在片段内重定位的时间戳和 partial 标志,因此词级对齐仍可推导。

clean_cut 在超过 45 秒的语音段内无停顿、不得不超限强制切分时为 false;这些片段在此数据集中已被丢弃。speech_ratio 是 VAD 判定为语音的片段比例。

start/end 定位片段在源录音中的位置,source_id 将来自同一源录音的片段分组——请按 source_id 而非按行划分,否则同一说话人和主题会同时出现在划分的两侧。

应用的过滤

  • 丢弃无文本的提示,以及连续重复的提示文本(部分录音会重复播放同一频道结尾字幕达数分钟)。
  • 移除非语音标记([موسيقى]、[ضحك] 等);剩余无文本的片段被丢弃。
  • 丢弃 VAD 语音比例低于 35% 的片段,以及每秒字符数在 1-30 范围之外的片段(视为静音或错位)。

方言标签

dialect 为 13 种阿拉伯语方言之一或 msa,由 Nawah-Dialect-BERT-6M 预测,在整个源录音上预测后复制到其每个片段——单个片段的文本太少,无法可靠分类。dialect_probs 包含全部 14 个类别的概率。

这些是预测结果而非真实标注:它们反映的是转录文本的语言语域,而非说话人的口音,且转录文本本身也是机器生成的。

数据字段

字段名 类型 说明
id string 标识符
source_id string 源录音分组标识
shard string 分片
audio audio 音频
text string 转录文本
start float64 片段在源录音中的起始位置
end float64 片段在源录音中的结束位置
duration float64 时长
clean_cut bool 是否为干净切分
speech_ratio float32 语音比例
n_cues int32 提示数量
cues string 贡献的提示片段
dialect string 方言标签
dialect_score float32 方言得分
dialect_probs struct 14 类别方言概率(bh、dz、eg、iq、lb、ly、ma、msa、ps、sa、sd、sy、tn、ye)
transcript_lang string 转录语言
locale_lang string 本地语言
source_length float64 源录音长度

来源说明

CC-BY-3.0,继承自 YODAS v3。音频从上游 Opus 解码,重采样为 16 kHz 单声道并重新编码,因此属于第二代有损生成。

搜集汇总
数据集介绍
unnamed-split-ar 数据集图片
构建方式
该数据集源自阿拉伯语语音语料库YODAS v3,以长录音为输入,通过语音活动检测(Silero VAD)识别静音停顿,将连续语音切分为5至45秒的片段。与依赖YouTube字幕时间戳的传统切分方式不同,此处仅将时长不少于150毫秒的静音区间作为合法切点,而后依据词级时间对齐或多数重叠策略,将转录文本分配给对应片段。对于超过45秒无停顿的连续语音,则强制切分并标记为非洁净切分,最终予以剔除。
使用方法
使用者可通过Hugging Face数据集库以流式模式加载训练集,直接用于语音识别模型的批量训练,无需额外切分。由于同一来源的片段共享说话人与主题,数据划分应基于source_id字段而非逐行随机拆分,以避免信息泄露。音频字段可解码为16 kHz单声道信号,文本字段作为转录目标,方言概率与语音占比等元数据可用于条件建模或数据筛选,灵活支撑方言感知的语音识别研究。
背景与挑战
背景概述
阿拉伯语自动语音识别(ASR)长期受限于标注语料稀缺与方言多样性,YODAS v3作为大规模多语言语音资源,其阿拉伯语分区源自YouTube长录音,为ASR研究提供了宝贵数据基础。然而原始数据以中位约五分钟的录音形式存在,且转录时间戳源自字幕提示而非真实话语边界,直接用于训练需进一步切分。为释放该资源在阿拉伯语ASR中的潜力,相关研究者将阿拉伯语分区切分为5至45秒的话语级片段,构建了unnamed-split-ar数据集。该数据集涵盖14类阿拉伯语方言标签,以Opus 48 kbps单声道16 kHz格式存储,为方言感知ASR及语音活动检测研究提供了细粒度基准,推动了阿拉伯语语音处理领域的数据标准化进程。
当前挑战
阿拉伯语ASR面临的核心挑战在于方言变体繁多、语音与文本对齐困难以及标注资源匮乏。unnamed-split-ar的构建过程亦充满挑战:上游字幕时间戳与真实语音边界严重错位,71.8%的连续提示严格重叠,仅9.7%的提示边界存在真实静音间隙,导致基于字幕切分的话语片段大量落入连续语音内部;即便将边界吸附至最安静窗口,仍有54.8%的切分点位于语音中。为此,构建者转而采用Silero VAD检测静音停顿,以至少150毫秒的停顿作为唯一合法切分点,并将转录文本按词级时序分配至对应片段,使切分点落入语音的比例降至0.0%。此外,方言标签系基于整段录音的预测结果而非真实标注,且转录文本本身由机器生成,进一步增加了数据可靠性的挑战。
常用场景
经典使用场景
在阿拉伯语自动语音识别(ASR)研究领域,长时录音的语音切分与文本对齐长期依赖人工标注或基于静音能量的启发式方法,而该数据集以语音活动检测(VAD)为基准,将YouTube原始长音频精确切分为5至45秒的语音片段,每个片段均配备独立转录文本,从而为端到端ASR训练提供了即用型的数据单元。其经典使用场景集中于以批处理方式直接加载片段化音频与文本对,规避了训练前繁杂的强制对齐步骤,被广泛用于阿拉伯语声学建模与语言模型联合优化的基准实验中。
解决学术问题
该数据集直面阿拉伯语ASR中标注数据稀缺与方言变异剧烈的双重困境,通过自动化切分与方言概率标注,解决了传统字幕时间戳导致的语音重叠切割问题,使切分点落入语音内部的比例从54.8%降至0.0%。其意义在于为方言辨识、语种识别及多方言ASR系统提供了统一且可复现的数据基础,推动了阿拉伯语语音处理在跨方言泛化能力上的评估与提升,并为低资源方言的声学特征研究提供了量化依据。
实际应用
在实际应用层面,该数据集服务于阿拉伯语语音转写系统、智能语音助手及方言自适应识别引擎的开发与调优,尤其适用于新闻广播、社交媒体视频等非正式口语场景的转录任务。其片段化结构便于构建流式或离线ASR流水线,而方言标签与概率分布则为内容推荐、说话人画像及方言敏感的搜索索引提供了辅助信息,使得系统能够依据地域语言变体动态调整识别策略,提升用户体验与转写准确率。
数据集最近研究
最新研究方向
在阿拉伯语语音识别领域,方言多样性始终是制约模型鲁棒性的核心瓶颈。当前前沿研究正从粗粒度方言分类转向基于声学-文本联合表征的细粒度方言建模,并探索自监督预训练与多任务学习在方言自适应中的应用。unnamed-split-ar数据集通过Silero VAD驱动的语音停顿感知切分,实现了零语音内切点(0.0%),为长音频到话语级片段的自动化构建提供了可复现的范式。其提供的14类方言概率分布与语音比例等元数据,支持方言感知的课程学习与数据筛选策略,有助于缓解阿拉伯语各方言间数据不平衡问题。该数据集契合了低资源方言语音识别和可解释性建模的研究热点,对推动包容性语音技术及跨方言迁移学习具有重要的基准价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务