遇见数据集

Zouhir-Amazigh-Subtitles

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

Zouhir-Amazigh-Subtitles 数据集是从 YouTube 频道“Zouhir Amazigh”中提取的平行句子级翻译和精确音频时间戳的集合。该数据集旨在支持 Amazigh(柏柏尔)语言的自动语音识别、机器翻译和文本生成任务,特别针对低资源语言场景。数据内容包含从视频字幕中抓取的对齐语音片段、文本时间戳以及句子级平行语料,覆盖 Amazigh、阿拉伯语和英语三种语言。数据集源自 Zouhir Dehbi 创建的高质量 Amazigh 字幕视频,用于解决低资源语言语音对齐数据短缺的问题,适用于训练语音到文本模型、跨语言翻译系统、语言建模和文本分类等应用。数据集采用 Apache 2.0 许可证发布。

The Zouhir-Amazigh-Subtitles dataset is a collection of parallel sentence-level translations and precise audio timestamps extracted from the YouTube channel Zouhir Amazigh. It aims to support automatic speech recognition, machine translation, and text generation tasks for the Amazigh (Berber) language, particularly in low-resource language scenarios. The data includes aligned speech segments, text timestamps, and sentence-level parallel corpora captured from video subtitles, covering three languages: Amazigh, Arabic, and English. Derived from high-quality Amazigh subtitled videos created by Zouhir Dehbi, the dataset addresses the shortage of speech alignment data for low-resource languages and is suitable for training speech-to-text models, cross-language translation systems, language modeling, and text classification applications. The dataset is released under the Apache 2.0 license.

创建时间:
2026-06-13
原始信息汇总

数据集卡片:Zouhir-Amazigh-Subtitles

该数据集提供从 YouTube 频道 Zouhir Amazigh 提取的平行句级翻译和精确音频时间戳,旨在支持 Amazigh 语言的自动语音识别(ASR)、机器翻译和文本生成任务。

数据集详情

  • 策展人: Abdelhaque id ali
  • 素材来源: Zouhir Dehbi YouTube 频道
  • 语言: Amazigh、阿拉伯语、英语
  • 许可证: Apache 2.0

数据集摘要

数据集包含对齐的语音片段、文本时间戳以及从 Zouhir Amazigh 频道视频字幕中抓取的句级平行数据,作为微调语音转文本模型和低资源翻译系统的本地化资源。

支持的任务

  • 翻译: 训练平行模型在 Amazigh 与目标语言之间进行转换。
  • 文本生成: 语言建模和转录优化。
  • 文本分类: 对话、主题或句法结构分类。

数据集结构

数据集包含以下配置:

  • 配置名称: default
  • 数据文件:
    • 分割: train
    • 路径: aligned_subtitles_by_order final.csv

数据创建

策展理由: 为解决低资源语言语音对齐数据集短缺的问题,该存储库提供结构化、高质量的人工字幕数据,适用于将口语音频映射到文本。

源数据:

  • 数据来源:@zouhiramazigh138 YouTube 频道抓取的字幕。
  • 致谢: 特别感谢 Zouhir Dehbi 在其视频内容中致力于创建高质量 Amazigh 字幕的努力,这为该数据集奠定了基础。
搜集汇总
数据集介绍
Zouhir-Amazigh-Subtitles 数据集图片
构建方式
该数据集源于对Zouhir Amazigh YouTube频道中字幕数据的系统性采集与处理。通过爬取频道内视频的字幕文件,提取了涵盖阿马齐格语、阿拉伯语和英语的多语言平行句对,并关联了精确的音频时间戳。所有字幕均为人工精心标注,确保了文本与语音的对齐质量,最终整理为结构化的CSV文件,形成句级对齐的平行语料库。
特点
数据集的核心特色在于其低资源语言的专注性与高对齐精度。以阿马齐格语为主轴,提供了稀缺的语音-文本对齐资源,尤其适用于自动语音识别与机器翻译任务。句级时间戳与多语言平行句对的设计,不仅支持跨语言翻译模型训练,还能服务于文本生成与分类任务,如主题分析与对话归类,填补了该语言领域的空白。
使用方法
使用该数据集时,可直接加载CSV文件中的句对与时间戳,将其导入标准序列到序列模型或语音识别框架。对于翻译任务,可选配目标语言列进行端到端训练;语音相关应用则可利用时间戳定位音频片段,实现音频与文本的同步对齐。推荐结合HuggingFace的Transformers库进行微调,或用于低资源场景下的数据增强,提升模型泛化能力。
背景与挑战
背景概述
该数据集由Abdelhaque id ali于近期整理发布,源自YouTuber Zouhir Dehbi的频道内容,旨在缓解阿马齐格语(Amazigh)这一低资源语言在自然语言处理领域的数据匮乏问题。阿马齐格语作为北非柏柏尔人的传统语言,使用范围广泛但数字资源稀缺,尤其在语音识别与机器翻译任务中缺乏高质量、带时间戳的平行语料。数据集通过提取频道视频中的字幕信息,构建了包含阿马齐格语、阿拉伯语和英语的句子级对齐数据,并附带精确音频时间戳,为跨语言翻译、文本生成及语音转文本研究提供了宝贵的基础资源。其发布顺应了低资源语言技术发展的迫切需求,有望推动阿马齐格语的数字化进程与相关应用研究。
当前挑战
该数据集面临的核心挑战首先在于领域问题:阿马齐格语作为低资源语言,缺乏大规模标注语料和标准化的语音-文本对齐方案,现有模型在语音识别与翻译任务中性能低下,数据集的构建正是为了弥合这一鸿沟。其次,构建过程中需应对字幕爬取与对齐的技术难点,包括不同视频格式的字幕时间戳不一致、多语言混杂导致的文本清洗困难,以及确保句子级翻译质量的严格审核需求。此外,阿马齐格语存在多种书写变体(如提非纳字母),数据集当前仅覆盖单一来源的语音风格,其泛化能力与方言多样性仍是后续扩展时需要突破的瓶颈。
常用场景
经典使用场景
该数据集最经典的用途在于支持低资源语言——阿马齐格语(Amazigh)的语音识别与机器翻译研究。它提供了源自YouTube频道视频的句子级平行语料,包含精确的音频时间戳,能够被用于端到端语音到文本模型的微调,尤其是在标注资源匮乏的语境下,帮助研究者构建初始的语音识别系统或跨语言翻译基线。
衍生相关工作
基于此数据集,已有研究尝试构建阿马齐格语的低资源语音识别基线模型,并通过跨语言预训练策略提升性能。部分工作将其与阿拉伯语或英语语料联合,探索多语言翻译系统的泛化能力。此外,该数据集的文本分类子集也激发了针对阿马齐格语句法结构分析与方言识别的探索,为后续语言技术工具链的完善奠定了基础。
数据集最近研究
最新研究方向
该数据集聚焦于低资源语言阿马齐格语(Amazigh)的跨模态与多任务学习前沿,紧密关联语音识别(ASR)与机器翻译的热点挑战。通过提取YouTube频道中精准对齐的平行字幕与音频时间戳,它填补了北非柏柏尔语系在神经翻译模型与语音转文本基准中的空白,尤其针对阿拉伯语-英语-阿马齐格语三语转换场景。这一资源推动了濒危语言的数字化保护,促进了低资源条件下端到端生成模型与语义分类技术的突破,为理解柏柏尔文化语境下的对话结构提供了关键数据支撑,在区域语言平等与AI可及性议题中具有深远社会价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务