遇见数据集

softcatala/wikimedia-common-audio-catalan

收藏
Hugging Face2026-07-19 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个从Wikimedia Commons收集的加泰罗尼亚语音频文件集合,包含512个音频文件(.ogg和.mp3格式),总时长约30.7小时。音频内容涵盖诗歌朗诵、采访、广播节目片段、语音样本、方言录音、口语文章等口语内容,由Wikimedia Commons社区贡献。数据集采用Hugging Face audiofolder布局,包含metadata.csv文件,其中记录了音频文件的相对路径、描述(来自Wikimedia Commons的加泰罗尼亚语描述)、许可证信息和持续时间(秒)。数据来源为Wikimedia Commons中分类为加泰罗尼亚语音频的文件,模态为音频和文本元数据。许可方面,数据集是多种免费许可证的汇编,包括CC0/公共领域、CC BY-SA 4.0、CC BY-SA 3.0等,每个文件的许可证记录在metadata.csv的license列中,使用时需按文件遵守。数据集无验证转录,描述字段是Commons标题而非对齐的转录文本;录音条件异构,来自不同贡献者和设备;说话人人口统计信息未知。

This dataset is a collection of Catalan audio files sourced from Wikimedia Commons, containing 512 audio files in .ogg and .mp3 formats with a total duration of approximately 30.7 hours. The audio content covers various spoken materials including poetry recitations, interviews, radio program clips, speech samples, dialect recordings, and spoken articles, all contributed by the Wikimedia Commons community. The dataset follows the Hugging Face audiofolder layout, and includes a metadata.csv file that records the relative path of each audio file, its Catalan description from Wikimedia Commons, license information, and duration in seconds. The data originates from files categorized as Catalan audio on Wikimedia Commons, with modalities of audio and textual metadata. Regarding licensing, this dataset compiles multiple free licenses such as CC0/public domain, CC BY-SA 4.0, and CC BY-SA 3.0; the license of each individual file is stored in the "license" column of metadata.csv, and users must comply with the license terms of each file when using the dataset. The dataset has no verified transcriptions, and the description field consists of Commons titles rather than aligned transcription texts. The recording conditions are heterogeneous, originating from different contributors and devices, and speaker demographic information is unknown.

提供机构:
softcatala
搜集汇总
数据集介绍
softcatala/wikimedia-common-audio-catalan 数据集图片
构建方式
该数据集源自对Wikimedia Commons平台上加泰罗尼亚语音频页面的系统性扫描与采集。通过解析Commons数据转储,识别并下载所有归类为加泰罗尼亚语的音频文件,同时提取每个文件对应的描述文本与许可证元数据。所有音频均以原始格式存储,未进行额外的转录或注释处理。数据集采用Hugging Face audiofolder格式组织,包含一个统一的metadata.csv文件,记录每个音频文件的路径、描述、许可证及时长信息。构建脚本已开源在Softcatala的公共仓库中,确保数据收集过程可复现。
使用方法
用户可通过Hugging Face datasets库中的load_dataset函数直接加载数据,默认仅包含train拆分,可根据需求自行划分训练、验证与测试集。由于每条样本均携带独立的license字段,建议在使用前按许可证类型过滤,例如筛选CC0许可的音频以规避版权风险。需注意,描述字段不应直接用于监督式语音识别训练,因其并非精确的转录文本。适用于语音识别、语音合成、音频分类等任务的预训练或迁移学习场景,但需预先处理音频质量与格式的异构性问题。
背景与挑战
背景概述
在加泰罗尼亚语自然语言处理与语音技术领域,高质量的语音数据集稀缺,制约了该低资源语言的自动语音识别(ASR)、文本转语音(TTS)及音频分类等任务的进展。为应对这一挑战,Softcatala机构于近年从维基共享资源(Wikimedia Commons)中系统采集并整理了加泰罗尼亚语音频,创建了“Wikimedia Commons Audio — Catalan”数据集。该数据集汇聚了约512段、总时长30.7小时的音频,涵盖诗歌朗诵、访谈、广播节目摘录、方言录音及口语散文等多种类型,每段音频均附带维基共享资源上由社区贡献的描述与许可元数据。作为首个大规模利用维基共享资源构建的加泰罗尼亚语音语料库,它为低资源语言的语音研究提供了宝贵的公开资源,促进了多语言语音技术的发展与评测。
当前挑战
该数据集所解决的领域问题主要在于加泰罗尼亚语语音资源的匮乏,为ASR、TTS及音频分类等任务提供了必要的训练与评测数据。然而,其构建过程中面临多项挑战:首先,音频来源多样,录制设备与环境参差不齐,导致采样率、声道数与信噪比不一,增加了数据标准化与预处理的难度。其次,数据集中缺乏验证过的转写文本,描述字段仅为维基社区编写的说明,而非精准的语音对齐文本,无法直接用于监督式ASR训练。此外,说话人的人口统计学信息(如年龄、性别、方言)完全缺失,限制了模型对说话人特性的建模能力。最后,音频采用的许可协议复杂(包括CC0、CC BY-SA、GFDL等),使用者需逐文件校验许可条件,且部分内容涉及知名公众人物,需额外关注隐私与数据保护法规的合规性。
常用场景
经典使用场景
该数据集汇集了来自维基共享资源的512段加泰罗尼亚语录音,涵盖诗歌朗诵、访谈、广播节目片段、方言录音与口语散文等多种口语体裁。其最经典的用途在于为加泰罗尼亚语语音研究提供一个多样化、真实场景的音频语料库。研究者可依据录音的元描述字段筛选特定主题或风格的音频,用于分析加泰罗尼亚语在不同社会语境中的语音特征、韵律变化和方言差异,从而构建更具鲁棒性的多风格语音处理模型。
解决学术问题
该数据集解决了加泰罗尼亚语语音领域长期存在的公开音频资源稀缺问题,尤其为低资源语言研究提供了重要的数据支撑。通过汇集不同录音设备、环境与说话者的自然语音,它有助于研究真实场景下声学模型的泛化能力,克服实验室条件下数据过于单一的局限性。此外,每条音频附带的许可信息使研究者能够合规地使用数据,推动语音识别、语种识别与音频分类等任务的学术探索,为低资源语言的语音技术发展奠定基础。
实际应用
在实际应用中,该数据集可用于构建面向加泰罗尼亚语的语音助手、自动字幕生成系统和教育类多媒体平台。开发者可以筛选CC0或公共领域授权的录音进行语音合成模型训练,生成具有自然韵律的合成语音。同时,数据集中的多样化录音可作为语音分类器的训练素材,应用于音频内容自动归档、方言识别和说话人身份验证等场景,从而拓展加泰罗尼亚语在智能设备与数字服务中的可用性与普及度。
数据集最近研究
最新研究方向
随着低资源语言语音技术的蓬勃发展,加泰罗尼亚语作为欧洲重要但资源稀缺的语言之一,其语音数据集的建设成为学术与工业界关注的前沿。该数据集通过收集维基共享资源中涵盖诗歌朗诵、访谈、广播节目、方言录音及口语文章等多种形式的512条音频,构建了约30.7小时的多许可语音语料库,为加泰罗尼亚语的自动语音识别、语音合成及音频分类任务提供了弥足珍贵的原始素材。尤其值得关注的是,数据集中混合了CC0、CC BY-SA 3.0/4.0及GFDL等多种开放许可,这为后续研究者在机器学习模型训练中的合规使用提出了新的挑战与机遇,推动了在多许可环境下语音数据伦理治理与版权合规的讨论。同时,该数据集本身不包含已验证的转录文本,提示研究者需探索无监督或弱监督的语音对齐与标注方法,进而催生了结合自监督学习与跨语言迁移的加泰罗尼亚语语音研究新范式,对丰富罗曼语族低资源语音生态具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务