遇见数据集

ArA-DF-2026

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

Arabic Deepfake Challenge 数据集是一个专为阿拉伯语语音深度伪造(欺骗)检测任务设计的音频分类数据集,其核心任务是对输入的音频片段进行二分类,判断其为真实语音(bona fide speech,标签为0)还是伪造/欺骗语音(spoofed speech,标签为1)。数据集包含四个划分:训练集(train,26,268个有标签样本)、开发集(dev,107,428个有标签样本)以及两个无标签的测试集(test_track_1,153,233个样本;test_track_2,141,939个样本)。所有音频均为16 kHz单声道格式,以无损FLAC编码存储于WebDataset TAR分片文件中,每个样本附带同名JSON侧载文件。公共元数据(包括训练集和开发集的标签)以Parquet文件格式提供。在数据组织上,训练集和开发集的文件名包含方言家族(dialect-family)和说话人性别(gender)标记(格式为`<dialect-family>_<gender>_<split>_<7-digit-number>`),而测试集采用匿名化命名(`test_<7-digit-number>`),不暴露方言或性别信息,以评估模型在未知条件下的泛化能力(Track 1)和对真实声学/信道变化的鲁棒性(Track 2)。数据集旨在支持相关算法的研发与评估,并作为挑战赛的基础数据,但明确禁止用于识别说话人或推断说话人的私人属性。

The Arabic Deepfake Challenge dataset is an audio classification dataset designed for Arabic speech deepfake (spoofing) detection tasks. Its core task is to perform binary classification on input audio clips, determining whether they are bona fide speech (label 0) or spoofed speech (label 1). The dataset includes four splits: training set (train, 26,268 labeled samples), development set (dev, 107,428 labeled samples), and two unlabeled test sets (test_track_1, 153,233 samples; test_track_2, 141,939 samples). All audio is in 16 kHz mono format, stored in lossless FLAC encoding within WebDataset TAR shard files, with each audio sample accompanied by a JSON sidecar file of the same name. Public metadata (including labels for the training and development sets) is provided in Parquet file format. In terms of data organization, filenames for the training and development sets contain dialect-family and speaker gender markers (format: `<dialect-family>_<gender>_<split>_<7-digit-number>`), while the test sets use anonymized naming (`test_<7-digit-number>`), hiding dialect and gender information to evaluate model generalization under unknown conditions (Track 1) and robustness to real acoustic/channel variations (Track 2). The dataset is released for research and challenge participation, with explicit prohibition against using it for speaker identification or inferring private speaker attributes.

创建时间:
2026-06-08
原始信息汇总

数据集概述

  • 名称: Arabic Deepfake Challenge Dataset (ArA-DF-2026)
  • 任务: 阿拉伯语语音深度伪造/欺诈检测,属于二元音频分类任务。
  • 标签含义: 0 表示真实语音 (bona fide speech),1 表示伪造语音 (spoofed speech)。
  • 语言: 阿拉伯语 (ar)
  • 许可证: 其他 (other),仅限研究和挑战参与使用,禁止用于识别说话者或推断私人属性。

数据划分

数据划分 样本数 是否包含标签 公开命名规则
train 26,268 <方言家族>_<性别>_<划分>_<7位数字>
dev 107,428 <方言家族>_<性别>_<划分>_<7位数字>
test_track_1 153,233 匿名化,使用 test_<7位数字>
test_track_2 141,939 匿名化,使用 test_<7位数字>
  • 训练集和开发集: 文件名包含方言家族和性别信息;标签由公开元数据文件提供。
  • 测试集: 文件名不暴露方言或性别信息,标签被保留,仅由 Codabench 评估服务器使用。
    • Track 1: 评估对未知评估条件的泛化能力。
    • Track 2: 评估对真实声学/信道变化的鲁棒性。

数据文件

  • 音频: 所有音频为 16 kHz 单声道,格式为无损 FLAC,存储在 WebDataset TAR 分片文件中。
    • 路径: data/{split}/{split}-*.tar
  • 元数据: 公开元数据以 Parquet 格式提供。
    • 路径: metadata/{split}.parquet
  • JSON 侧边文件: 每个 WebDataset 样本包含 <id>.flac<id>.json,所有划分的 JSON 使用相同的非标签模式。
  • 示例提交文件: sample_submission_track_1.csvsample_submission_track_2.csv

提交格式

每个测试轨道需向 Codabench 提交一个 CSV 文件,格式如下:

csv id,label test_0000000,0 test_0000001,1

label 必须为整数类预测:0 表示真实语音,1 表示伪造语音。示例提交文件为格式模板,包含确定的虚拟标签。

数据加载

  • 默认配置: train_dev,加载包含标签的训练和开发集元数据表。
  • 测试集配置: 通过 test_track_1test_track_2 配置加载,不含标签。

加载元数据示例: python from datasets import load_dataset ds = load_dataset("ArabicSpeech/ArA-DF-2026") print(ds["train"][0]) test_track_1 = load_dataset("ArabicSpeech/ArA-DF-2026", "test_track_1")

通过 WebDataset 流式加载音频示例: python from datasets import load_dataset data_files = { "train": "hf://datasets/ArabicSpeech/ArA-DF-2026/data/train/.tar", "dev": "hf://datasets/ArabicSpeech/ArA-DF-2026/data/dev/.tar", "test_track_1": "hf://datasets/ArabicSpeech/ArA-DF-2026/data/test_track_1/.tar", "test_track_2": "hf://datasets/ArabicSpeech/ArA-DF-2026/data/test_track_2/.tar", } ds = load_dataset("webdataset", data_files=data_files, streaming=True) sample = next(iter(ds["train"]))

搜集汇总
数据集介绍
ArA-DF-2026 数据集图片
构建方式
阿拉伯语深度伪造挑战数据集(ArA-DF-2026)是专为阿拉伯语语音深度伪造与欺骗检测任务而构建的基准资源。该数据集以二分类音频分类为核心任务,将语音标注为真实语音(标签0)与伪造语音(标签1)两大类。数据集的构建采用了WebDataset格式的组织方式,所有音频均以16 kHz单声道无损FLAC格式存储于TAR压缩包中。训练集与开发集共包含133,696条带有标签的样本,其文件名编码了方言家族与性别信息;而两个测试集共计295,172条样本则采用匿名化命名,不暴露任何方言或性别属性,以确保评估的公平性。元数据以Parquet表格形式提供,便于加载与处理。
使用方法
研究者可通过Hugging Face的datasets库轻松加载该数据集。默认配置下的train_dev加载器会返回带有标签的训练与开发集元数据表,而test_track_1与test_track_2配置则分别加载不含标签的两个测试集元数据。对于需要直接流式处理音频的研究者,可使用WebDataset加载器读取data目录下的TAR分片,每个样本包含同名的FLAC音频文件与JSON侧边栏文件。最终提交结果需以CSV格式上传至Codabench评测平台,其中每行包含样本ID与预测标签(0或1),Track 1与Track 2各需提交独立的预测文件。
背景与挑战
背景概述
随着生成式语音技术的飞速发展,深度伪造语音的检测已成为音频安全领域的关键议题,尤其在低资源语言环境中,相关研究仍显薄弱。阿拉伯语作为使用人口众多的语言之一,其深度伪造检测面临独特的声学与方言多样性挑战。阿拉伯语深度伪造检测数据集(ArA-DF-2026)由ArabicSpeech研究机构于2026年创建,旨在填补该语言在伪造语音检测领域的数据空白。该数据集聚焦于二进制音频分类任务,区分真实语音与伪造语音,涵盖超过42万条高质量16kHz单声道音频样本,并基于方言家族和性别等元数据进行精细划分。其构建不仅为阿拉伯语伪造检测提供了标准化评测基准,也推动了多语言深度伪造防御技术的发展,对语音取证、信息安全及人工智能伦理研究具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于阿拉伯语语音伪造检测中数据集匮乏与泛化能力不足的问题。由于阿拉伯语包含众多方言变体且声学环境复杂,模型需具备跨方言、跨性别及对不同伪造技术的鲁棒性。Track 1专门评估模型在未见过的评测条件下的泛化能力,Track 2则模拟真实音频中的噪声与信道变异,考验系统的鲁棒性。构建过程中面临的挑战包括:收集并平衡多方言、多性别的真实语音样本,确保数据代表性;生成与真实语音难以区分的伪造样本,涵盖从语音合成到重放攻击的多种攻击方式;设计匿名化的测试集和分轨评测机制,防止过拟合与信息泄露;同时,在WebDataset存储格式下实现大规模音频数据的高效流式加载与标准化处理,保障竞赛公平与可复现性。
常用场景
经典使用场景
在语音伪造检测领域,ArA-DF-2026数据集专为阿拉伯语语音深度伪造与欺骗检测任务而设计,其核心应用场景为二元音频分类,旨在区分真实语音与经过算法生成的伪造语音。该数据集包含超过42万条经过精细划分的语音样本,涵盖训练集、开发集以及两个独立的测试集,其中测试集专门用于评估模型在未见过的语音条件和复杂声学环境下的泛化能力与鲁棒性。音频数据采用16 kHz单声道FLAC无损格式存储,并通过WebDataset TAR分片高效分发,便于大规模流式加载与训练。这一设计使得该数据集成为研究阿拉伯语场景下抗欺骗语音识别系统不可或缺的基础资源。
解决学术问题
该数据集着力解决了阿拉伯语深度伪造语音检测研究中数据匮乏这一瓶颈问题。长期以来,语音反欺骗研究主要集中于英语等资源丰富语种,阿拉伯语因标注数据稀缺而进展缓慢。ArA-DF-2026通过提供大规模、多方言、包含性别标签的语音样本,为模型训练提供了丰富的声学与语言学异质性。其测试集Track 1专门面向未知条件泛化挑战,Track 2则聚焦于真实环境下的声学与信道扰动鲁棒性,从而系统性地支撑了以下学术问题的探索:如何构建跨方言、跨性别、跨声学环境的通用伪造语音检测器,以及如何评估模型在不暴露敏感属性信息条件下的公平性与隐私保护能力。
实际应用
在实际应用中,ArA-DF-2026可有效支撑阿拉伯语语音安全系统的开发与部署。例如,在银行电话客服、政务语音验证、智能家居语音助手等需要身份鉴权的场景中,该数据集训练的检测模型能够实时识别合成语音或重放攻击,防止欺诈行为。此外,在媒体内容审核领域,该数据集可用于鉴别网络传播的阿拉伯语音频是否为AI生成,维护信息真实性。其两个测试轨道的差异化设计也使其能够模拟不同部署环境——从理想实验室条件到嘈杂公共场所——从而为产业界的模型选型与阈值设定提供可靠依据,降低误报与漏报风险。
数据集最近研究
最新研究方向
当前,随着深度伪造音频技术对阿拉伯语系社会安全与信息真实性构成的严峻威胁,ArA-DF-2026数据集应运而生,聚焦于多方言、多性别条件下的语音深伪检测前沿。该数据集不仅设计了两个差异化测试轨道——Track 1评估模型对未见场景的泛化能力,Track 2着重检验其在真实声学信道变异下的鲁棒性,还通过隐藏测试集标签和匿名化处理,激励研究者探索免于偏见干扰的通用检测框架。这一挑战赛机制与Codabench平台的结合,正推动阿拉伯语欺骗检测从实验室理想条件向复杂现实场景的跨越,其意义在于为低资源语种的音频安全防线树立新基准,并促进性别与方言公平性评估体系的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务