遇见数据集

rradyu-tis-snat

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Rradyu Tis Snat 是一个卡拜尔语(Kabyle,属于塔马齐特语/柏柏尔语)播客音频数据集,收录自阿尔及利亚国家广播电台 Chaîne 2 的公开播客页面。该电台主要使用塔马齐特语(包括卡拜尔语)进行广播。数据集旨在支持低资源语言的自动语音识别(ASR)、音频分类(如语言识别、节目类型分类)以及文本转语音(TTS)等任务。数据仅包含音频(mp3格式),无对应转录文本。音频内容涵盖新闻简报、脱口秀、文化宗教节目和杂志类节目,每集时长通常为15-30分钟。数据集当前规模小于1K条记录,尚在扩充中。数据按节目(show)分组,每个节目下存放对应剧集的mp3文件,根目录下提供metadata.csv文件,遵循AudioFolder规范,可通过HuggingFace Datasets库直接加载。字段包括:file_name(音频文件相对路径)、show_id(节目在源站点的内部ID)、show_title(节目名称)、episode_title(剧集标题/日期)、source_url(原始mp3 URL)。数据收集采用启发式标题过滤,仅保留明确标记为卡拜尔语的节目,但可能混入少量其他语言或方言的片段。数据集目前未划分训练/验证/测试集,未提供时长、采样率等元数据,也未进行语音活动检测(VAD)分段。使用注意事项:版权/许可问题尚未明确,当前仅限研究用途,不可用于商业或公开分发;音频质量源自原始电台编码(mp3),未进行再编码以避免进一步损失;建议下游用户自行进行语音分割和转录。

Rradyu Tis Snat is a Kabyle (a dialect of Tamazight/Berber) podcast audio dataset collected from the public podcast page of Algerias national radio station Chaîne 2, which primarily broadcasts in Tamazight (including Kabyle). The dataset aims to support automatic speech recognition (ASR), audio classification (e.g., language identification, program type classification), and text-to-speech (TTS) for low-resource languages. The data consists only of audio (mp3 format) without corresponding transcriptions. Audio content includes news briefs, talk shows, cultural and religious programs, and magazine-style programs, with each episode typically lasting 15–30 minutes. The dataset currently contains fewer than 1K records and is still being expanded. Data is organized by show, with mp3 files for each episode stored under the corresponding show directory, and a metadata.csv file at the root directory following the AudioFolder specification, enabling direct loading via the HuggingFace Datasets library. Fields include: file_name (relative path of audio file), show_id (internal ID of the show on the source site), show_title (show name), episode_title (episode title/date), and source_url (original mp3 URL). Data collection used heuristic title filtering to retain only shows explicitly marked as Kabyle, but may include small amounts of other languages or dialects. The dataset is not currently split into train/validation/test sets, does not provide metadata such as duration or sample rate, and has not undergone voice activity detection (VAD) segmentation. Usage notes: copyright/license issues are not yet clarified; currently limited to research purposes only, not for commercial or public distribution; audio quality comes from the original station encoding (mp3) and has not been re-encoded to avoid further loss; downstream users are advised to perform their own speech segmentation and transcription.

创建时间:
2026-07-28
原始信息汇总

数据集概述:Rradyu Tis Snat

Rradyu Tis Snat 是一个卡拜尔语(Taqbaylit)音频播客数据集,音频内容来源于阿尔及利亚公共广播电台 Radio Algérie Chaîne 2 的播客页面。该电台主要使用塔马齐特语(柏柏尔语变体)播出,其中卡拜尔语是主要语言。

基本信息

  • 语言:卡拜尔语(kab),属北部柏柏尔语(塔马齐特/阿马齐格语),主要在阿尔及利亚卡拜利地区使用。
  • 领域:广播语音,涵盖新闻简报、脱口秀、文化及宗教节目、杂志类节目。
  • 模态:仅音频(MP3 格式),当前不包含转写文本。
  • 许可证:MIT
  • 任务类别:自动语音识别、音频分类、文本转语音

数据集结构

音频文件按广播节目分组存放于 data/<show-slug>/ 目录下,仓库根目录包含一个 metadata.csv 文件,遵循 Hugging Face AudioFolder 约定,可直接通过 load_dataset("boffire/rradyu-tis-snat") 加载。

数据字段

字段 类型 说明
file_name string 音频文件的相对路径
show_id int 节目在 radioalgerie.dz 上的内部 ID
show_title string 广播节目/栏目名称
episode_title string 节目集标题或发布日期
source_url string radioalgerie.dz 上的原始 MP3 链接

数据划分:目前无训练/验证/测试划分,为单一未分割集合。

数据收集过程

音频文件直接从 Radio Algérie Chaîne 2 的公开播客页面抓取。节目通过启发式规则过滤:排除明确标注为其他语言或柏柏尔语变体的节目(如莫扎比特语、沙维语、图阿雷格语、阿拉伯语、法语节目),其余节目假定为卡拜尔语。

注意:此过滤基于节目标题的启发式判断,并非逐集语言验证,可能存在少数分类错误的集数。

使用注意事项

许可与权利:音频来自阿尔及利亚国有公共广播电台,重分发条款尚未确认。在当前未明确之前,应将此仓库视为仅供私人/研究用途,不得假定为可自由复用。

已知限制

  • 节目级语言过滤可能包含少量非卡拜尔语集数
  • 无转写文本、说话人标签或内容审核
  • 集数通常为长格式(15–30分钟),大多数 ASR/微调流程需要进一步分段处理
  • 音频质量为原始广播 MP3 编码,未进行重新编码以避免进一步有损降质

数据来源:Radio Algérie Chaîne 2 播客页面(podcast.radioalgerie.dz

仓库地址https://huggingface.co/datasets/boffire/rradyu-tis-snat

当前状态

该数据集为进行中项目,README 标注多处 TODO 待完善,包括:许可证确认、时长/采样率/声道等字段增加、数据划分定义、策展人信息、引用格式、变更日志等。

搜集汇总
数据集介绍
rradyu-tis-snat 数据集图片
构建方式
该数据集聚焦于卡比尔语(Taqbaylit)这一低资源语言,源自阿尔及利亚公共广播电台Chaîne 2的播客节目,旨在为自动语音识别、音频分类及语音合成等研究提供原始语音素材。构建过程中,通过爬虫技术直接抓取电台官网的公开播客音频,并依据节目名称进行启发式过滤,排除使用其他语言或柏柏尔语变体的节目,保留以卡比尔语为主的广播内容。音频文件按节目组织存储,并配以包含文件名、节目ID、节目标题、集标题及来源URL的元数据表格,遵循AudioFolder规范,便于直接加载。目前数据集尚未定义训练/验证/测试划分,也缺少详细的时长、采样率等信息,整体处于持续扩充状态。
特点
该数据集的核心特色在于其稀有性与原生性,作为公开可得的卡比尔语广播语音资源,覆盖新闻、脱口秀、文化及宗教节目等多种内容形式,每集时长通常在15至30分钟之间,反映了真实的电台广播语音特征。其元数据结构简洁,便于扩展,且音频未经重新编码,保留了原始MP3格式,避免额外质量损失。然而,数据集的局限亦清晰可见:语言过滤基于标题启发式,可能混入少量非卡比尔语片段;缺少文本转写、说话人标注及内容审核信息;长音频需下游用户自行切分。此外,版权许可状态尚未明确,目前仅限研究用途。
使用方法
数据集的使用便捷性得益于其遵循HuggingFace AudioFolder约定,用户可通过`load_dataset`函数一行代码导入音频及元数据。鉴于音频为长格式广播节目,建议下游任务先进行语音活动检测(VAD)切分,以适配ASR微调需求。对于语音识别,可结合无监督预训练或自监督特征提取;对于语种识别或节目分类,可利用`show_id`和`show_title`作为标签。由于缺少转写,跨模态任务需外部标注工具。使用时务必注意版权限制,仅限学术研究,并在论文中引用数据集来源。未来若补充划分列和增强元数据,将进一步提升其适用性。
背景与挑战
背景概述
卡拜尔语(Taqbaylit)属于北柏柏尔语支,是阿尔及利亚卡拜利亚地区的主要语言,但在全球范围内属于低资源语言,语音识别和自然语言处理研究长期缺乏可用的语料资源。为缓解这一困境,2026年,由研究员构建了名为“Rradyu Tis Snat”的数据集,其语料源自阿尔及利亚公共广播电台第二频道(Radio Algérie Chaîne 2)的播客节目,该频道主要使用卡拜尔语广播,内容涵盖新闻、脱口秀、文化及宗教节目等。作为首个面向卡拜尔语的广播语音数据集,它填补了该语言在自动语音识别、音频分类及语音合成等任务上的数据空白,为低资源语言的技术发展提供了宝贵的基础资源,对北非柏柏尔语言社区的语言数字化和保存具有里程碑意义。
当前挑战
该数据集面临的挑战多维且复杂。首先,卡拜尔语作为低资源语言,缺乏大规模标注数据,导致模型训练困难;其次,数据集的构建过程采用基于节目标题的启发式过滤,无法保证每个片段均为纯正卡拜尔语,可能混入少量其他语言或方言,影响数据纯净度;再者,原始音频为广播节目,未进行转录、说话人标注或内容审查,且节目时长较长(15-30分钟),需要下游用户自行分段处理,增加了使用门槛;此外,音频源自电台原始MP3编码,虽未重新压缩以避免质量损失,但广播本身的音质波动仍可能影响语音识别性能;最后,版权问题尚未厘清,作为公共广播内容,其再分发权利未获明确授权,限制了数据集的公开使用和研究传播范围。
常用场景
经典使用场景
该数据集作为卡拜尔语(Taqbaylit)广播语音的原始语料库,最经典的应用场景在于自动语音识别(ASR)系统的预训练与微调。鉴于卡拜尔语属于低资源语言,缺乏大规模标注语音数据,研究者可利用该数据集的未转录音频进行无监督或自监督预训练,如wav2vec 2.0、HuBERT等模型,从而学习卡拜尔语的声学表征。此外,数据集还可用于语音分类任务,如语种识别、节目类型分类,以及语音合成(TTS)系统的训练,为卡拜尔语人机交互应用提供基础数据支持。
解决学术问题
该数据集填补了卡拜尔语在语音研究领域的数据空白,解决了低资源语言语音技术发展的关键瓶颈。在学术上,它为计算语言学中的语言文档与保存提供了宝贵资源,支持对卡拜尔语音韵、音系及方言变异的研究。同时,数据集促进了跨语言迁移学习研究,使研究者能够探索如何利用相近语言(如其他柏柏尔语变体)的数据来提升目标语言的ASR性能,对于推动低资源语音识别技术的普适性具有重要意义。
衍生相关工作
基于该数据集,预计将衍生出一系列相关的经典工作。在ASR领域,研究者可能构建卡拜尔语语音识别基准,并开发针对长音频的切分工具(如VAD)以适配语音识别管线。在语言技术方面,可开展声学模型的语言自适应研究,以及多语言柏柏尔语语音系统的联合建模。此外,数据集的收集方法(如启发式过滤)可能催生关于广播语音语料自动构建的通用框架,推动其他低资源语言类似数据集的创建,形成更广泛的语音资源生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务