遇见数据集

Codec-SUPERB/dcase2016_task2_extract_unit

收藏
Hugging Face2023-12-19 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: academicodec_hifi_16k_320d path: data/academicodec_hifi_16k_320d-* - split: academicodec_hifi_16k_320d_large_uni path: data/academicodec_hifi_16k_320d_large_uni-* - split: academicodec_hifi_24k_320d path: data/academicodec_hifi_24k_320d-* - split: audiodec_24k_320d path: data/audiodec_24k_320d-* - split: dac_16k path: data/dac_16k-* - split: dac_24k path: data/dac_24k-* - split: dac_44k path: data/dac_44k-* - split: encodec_24k path: data/encodec_24k-* - split: funcodec_en_libritts_16k_gr1nq32ds320 path: data/funcodec_en_libritts_16k_gr1nq32ds320-* - split: funcodec_en_libritts_16k_gr8nq32ds320 path: data/funcodec_en_libritts_16k_gr8nq32ds320-* - split: funcodec_en_libritts_16k_nq32ds320 path: data/funcodec_en_libritts_16k_nq32ds320-* - split: funcodec_en_libritts_16k_nq32ds640 path: data/funcodec_en_libritts_16k_nq32ds640-* - split: funcodec_zh_en_16k_nq32ds320 path: data/funcodec_zh_en_16k_nq32ds320-* - split: funcodec_zh_en_16k_nq32ds640 path: data/funcodec_zh_en_16k_nq32ds640-* - split: speech_tokenizer_16k path: data/speech_tokenizer_16k-* dataset_info: features: - name: id dtype: string - name: unit sequence: sequence: int64 splits: - name: academicodec_hifi_16k_320d num_bytes: 13827534 num_examples: 72 - name: academicodec_hifi_16k_320d_large_uni num_bytes: 13827534 num_examples: 72 - name: academicodec_hifi_24k_320d num_bytes: 20739534 num_examples: 72 - name: audiodec_24k_320d num_bytes: 44241486 num_examples: 72 - name: dac_16k num_bytes: 84608718 num_examples: 72 - name: dac_24k num_bytes: 234909006 num_examples: 72 - name: dac_44k num_bytes: 69429102 num_examples: 72 - name: encodec_24k num_bytes: 10372110 num_examples: 72 - name: funcodec_en_libritts_16k_gr1nq32ds320 num_bytes: 110622030 num_examples: 72 - name: funcodec_en_libritts_16k_gr8nq32ds320 num_bytes: 110622030 num_examples: 72 - name: funcodec_en_libritts_16k_nq32ds320 num_bytes: 110622030 num_examples: 72 - name: funcodec_en_libritts_16k_nq32ds640 num_bytes: 55326030 num_examples: 72 - name: funcodec_zh_en_16k_nq32ds320 num_bytes: 110622030 num_examples: 72 - name: funcodec_zh_en_16k_nq32ds640 num_bytes: 110622030 num_examples: 72 - name: speech_tokenizer_16k num_bytes: 27657294 num_examples: 72 download_size: 175718409 dataset_size: 1128048498 --- # Dataset Card for "dcase2016_task2_extract_unit" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 配置项: - 配置名称:default 数据文件: - 数据拆分:academicodec_hifi_16k_320d,路径:data/academicodec_hifi_16k_320d-* - 数据拆分:academicodec_hifi_16k_320d_large_uni,路径:data/academicodec_hifi_16k_320d_large_uni-* - 数据拆分:academicodec_hifi_24k_320d,路径:data/academicodec_hifi_24k_320d-* - 数据拆分:audiodec_24k_320d,路径:data/audiodec_24k_320d-* - 数据拆分:dac_16k,路径:data/dac_16k-* - 数据拆分:dac_24k,路径:data/dac_24k-* - 数据拆分:dac_44k,路径:data/dac_44k-* - 数据拆分:encodec_24k,路径:data/encodec_24k-* - 数据拆分:funcodec_en_libritts_16k_gr1nq32ds320,路径:data/funcodec_en_libritts_16k_gr1nq32ds320-* - 数据拆分:funcodec_en_libritts_16k_gr8nq32ds320,路径:data/funcodec_en_libritts_16k_gr8nq32ds320-* - 数据拆分:funcodec_en_libritts_16k_nq32ds320,路径:data/funcodec_en_libritts_16k_nq32ds320-* - 数据拆分:funcodec_en_libritts_16k_nq32ds640,路径:data/funcodec_en_libritts_16k_nq32ds640-* - 数据拆分:funcodec_zh_en_16k_nq32ds320,路径:data/funcodec_zh_en_16k_nq32ds320-* - 数据拆分:funcodec_zh_en_16k_nq32ds640,路径:data/funcodec_zh_en_16k_nq32ds640-* - 数据拆分:speech_tokenizer_16k,路径:data/speech_tokenizer_16k-* 数据集信息: 特征字段: - 名称:id,数据类型:字符串 - 名称:unit,结构:嵌套序列(内层序列元素为64位整型) 数据拆分信息: - 拆分名称:academicodec_hifi_16k_320d,字节占用:13827534,样本数量:72 - 拆分名称:academicodec_hifi_16k_320d_large_uni,字节占用:13827534,样本数量:72 - 拆分名称:academicodec_hifi_24k_320d,字节占用:20739534,样本数量:72 - 拆分名称:audiodec_24k_320d,字节占用:44241486,样本数量:72 - 拆分名称:dac_16k,字节占用:84608718,样本数量:72 - 拆分名称:dac_24k,字节占用:234909006,样本数量:72 - 拆分名称:dac_44k,字节占用:69429102,样本数量:72 - 拆分名称:encodec_24k,字节占用:10372110,样本数量:72 - 拆分名称:funcodec_en_libritts_16k_gr1nq32ds320,字节占用:110622030,样本数量:72 - 拆分名称:funcodec_en_libritts_16k_gr8nq32ds320,字节占用:110622030,样本数量:72 - 拆分名称:funcodec_en_libritts_16k_nq32ds320,字节占用:110622030,样本数量:72 - 拆分名称:funcodec_en_libritts_16k_nq32ds640,字节占用:55326030,样本数量:72 - 拆分名称:funcodec_zh_en_16k_nq32ds320,字节占用:110622030,样本数量:72 - 拆分名称:funcodec_zh_en_16k_nq32ds640,字节占用:110622030,样本数量:72 - 拆分名称:speech_tokenizer_16k,字节占用:27657294,样本数量:72 下载总大小:175718409 数据集总大小:1128048498 --- # “dcase2016_task2_extract_unit”数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
Codec-SUPERB
原始信息汇总

数据集概述

数据集配置

  • 默认配置:
    • 包含多个数据文件,每个文件对应不同的分割和路径:
      • academicodec_hifi_16k_320d:路径为 data/academicodec_hifi_16k_320d-*
      • academicodec_hifi_16k_320d_large_uni:路径为 data/academicodec_hifi_16k_320d_large_uni-*
      • academicodec_hifi_24k_320d:路径为 data/academicodec_hifi_24k_320d-*
      • audiodec_24k_320d:路径为 data/audiodec_24k_320d-*
      • dac_16k:路径为 data/dac_16k-*
      • dac_24k:路径为 data/dac_24k-*
      • dac_44k:路径为 data/dac_44k-*
      • encodec_24k:路径为 data/encodec_24k-*
      • funcodec_en_libritts_16k_gr1nq32ds320:路径为 data/funcodec_en_libritts_16k_gr1nq32ds320-*
      • funcodec_en_libritts_16k_gr8nq32ds320:路径为 data/funcodec_en_libritts_16k_gr8nq32ds320-*
      • funcodec_en_libritts_16k_nq32ds320:路径为 data/funcodec_en_libritts_16k_nq32ds320-*
      • funcodec_en_libritts_16k_nq32ds640:路径为 data/funcodec_en_libritts_16k_nq32ds640-*
      • funcodec_zh_en_16k_nq32ds320:路径为 data/funcodec_zh_en_16k_nq32ds320-*
      • funcodec_zh_en_16k_nq32ds640:路径为 data/funcodec_zh_en_16k_nq32ds640-*
      • speech_tokenizer_16k:路径为 data/speech_tokenizer_16k-*

数据集信息

  • 特征:

    • id:类型为字符串
    • unit:类型为整数序列
  • 分割:

    • academicodec_hifi_16k_320d:字节数为 13827534,示例数为 72
    • academicodec_hifi_16k_320d_large_uni:字节数为 13827534,示例数为 72
    • academicodec_hifi_24k_320d:字节数为 20739534,示例数为 72
    • audiodec_24k_320d:字节数为 44241486,示例数为 72
    • dac_16k:字节数为 84608718,示例数为 72
    • dac_24k:字节数为 234909006,示例数为 72
    • dac_44k:字节数为 69429102,示例数为 72
    • encodec_24k:字节数为 10372110,示例数为 72
    • funcodec_en_libritts_16k_gr1nq32ds320:字节数为 110622030,示例数为 72
    • funcodec_en_libritts_16k_gr8nq32ds320:字节数为 110622030,示例数为 72
    • funcodec_en_libritts_16k_nq32ds320:字节数为 110622030,示例数为 72
    • funcodec_en_libritts_16k_nq32ds640:字节数为 55326030,示例数为 72
    • funcodec_zh_en_16k_nq32ds320:字节数为 110622030,示例数为 72
    • funcodec_zh_en_16k_nq32ds640:字节数为 110622030,示例数为 72
    • speech_tokenizer_16k:字节数为 27657294,示例数为 72
  • 数据集大小:

    • 下载大小:175718409 字节
    • 数据集大小:1128048498 字节
搜集汇总
数据集介绍
Codec-SUPERB/dcase2016_task2_extract_unit 数据集图片
构建方式
在音频编码与语音表征学习领域,Codec-SUPERB/dcase2016_task2_extract_unit数据集应运而生,旨在为音色转换、语音解码等下游任务提供标准化的离散单元评测基准。该数据集基于DCASE2016 Task2原始录音,通过多种前沿神经音频编解码器提取离散化语音单元。构建时,研究者选取了涵盖不同采样率(16kHz、24kHz、44kHz)与编码架构的模型,包括AcademiCodec、AudioDec、DAC、EnCodec、FunCodec及SpeechTokenizer等,共计15种配置,每种配置对应72条语音片段。每条样本以字符串标识符与整数序列形式存储,其中单元序列由对应编解码器输出的离散码本索引构成,从而实现了对原始音频的高效压缩与结构化表征。
特点
该数据集的核心特色在于其多维度、跨模型的统一评测框架。首先,它集成了15种差异显著的编解码器配置,覆盖了从低比特率(如EnCodec 24kHz)到高保真度(如DAC 44kHz)的广泛编码空间,为比较不同算法在离散单元提取上的效果提供了公平平台。其次,所有样本均源自同一原始录音集,确保了跨配置对比时声学内容的一致性。此外,数据集以HuggingFace Datasets格式组织,每个拆分的单元序列长度虽因编解码器而异,但均保留完整的时间对齐信息,便于研究者直接用于分析单元粒度、重构质量与下游任务性能之间的关联。
使用方法
使用该数据集时,推荐通过HuggingFace Datasets库加载,利用load_dataset函数指定'Codec-SUPERB/dcase2016_task2_extract_unit'名称,并通过split参数选择所需编解码器配置(如'academicodec_hifi_16k_320d')。加载后的数据包含'id'与'unit'两个字段,其中'unit'为嵌套整数列表,代表每个时间步的离散码索引。研究者可将其作为输入特征,用于训练或评估音色转换模型、语音编解码器,或作为预训练语音表征的离散化中间层。建议结合对应的编解码器重构模块,通过单元序列重建波形,以评估信息保留程度与感知质量。
背景与挑战
背景概述
在语音与音频编码领域,神经编解码模型(如EnCodec、DAC、Funcodec等)的快速发展为高质量音频压缩与表示学习开辟了新路径。然而,不同模型在离散化单元提取上的异构性,使得跨模型、跨采样率的系统评估面临显著障碍。Codec-SUPERB/dcase2016_task2_extract_unit数据集正是在这一背景下应运而生,由相关研究团队基于DCASE 2016任务2的声学场景数据构建,旨在系统性地比较多种主流神经编解码器(包括Academicodec、AudioDec、DAC、EnCodec、Funcodec及SpeechTokenizer)在不同采样率(16kHz、24kHz、44kHz)与配置下的单元提取效果。该数据集通过提供标准化的单元序列标注,为评估编解码器在声学单元一致性、压缩效率与下游任务适配性等核心维度上的表现奠定了基准,对推动音频表示学习的可复现性与公平对比具有重要影响。
当前挑战
该数据集所应对的核心挑战之一在于神经编解码器评估的碎片化:现有模型各采用独特的量化策略与码本设计,缺乏统一的单元提取规范,导致不同方法间的性能比较常因数据格式、采样率或码本大小的差异而失准。构建过程中,如何确保来自15种不同配置的编解码器在DCASE 2016原始音频上生成可对齐的单元序列,成为技术难点——这要求对每种模型的输入输出进行严格的参数校准,并处理因帧率差异导致的时序对齐问题。此外,72个样本的有限规模虽聚焦于特定声学场景,却对模型泛化性提出严峻考验,如何在保持评估精度的同时避免过拟合偏差,仍是该数据集在推广至更广泛音频任务时亟待解决的挑战。
常用场景
经典使用场景
Codec-SUPERB/dcase2016_task2_extract_unit数据集专为评估和比较不同神经音频编解码器(如EnCodec、DAC、Funcodec等)提取的离散单元表示而构建。其经典使用场景聚焦于声学场景分类任务,通过将原始音频信号转换为多种编解码器生成的单元序列,研究者得以在统一基准上量化不同编解码器对下游声学场景识别性能的影响。该数据集包含72个样本,每个样本对应多种编解码器配置下的离散单元表征,为探究编解码器参数(如采样率、码本大小、量化维度)与任务表现之间的关联提供了标准化测试平台。
衍生相关工作
该数据集衍生了一系列关于离散音频单元通用性的经典研究。例如,基于该基准,学者们提出了跨编解码器单元对齐方法,通过对比不同编解码器在相同声学场景下的单元分布差异,揭示了码本利用率与语义保留能力之间的关联。另有工作利用该数据集验证了预训练语音单元(如SpeechTokenizer)在声学场景分类中的迁移优势,推动了自监督学习在音频编解码领域的交叉融合。这些衍生工作共同构建了从单元提取到下游任务评估的完整研究范式。
数据集最近研究
最新研究方向
在神经音频编解码器与语音表征学习领域,Codec-SUPERB/dcase2016_task2_extract_unit数据集为多维度声学单元提取研究提供了关键基准。该数据集整合了AcademiCodec、AudioDec、DAC、EnCodec、FunCodec及SpeechTokenizer等主流编解码器在不同采样率(16kHz至44kHz)与量化配置下的输出单元,覆盖从粗粒度到细粒度的语音离散表征。当前前沿研究方向聚焦于评估编解码器在声学事件检测任务中的泛化能力,尤其是对比残差矢量量化(RVQ)与分组量化策略对单元语义保真度的影响。随着FunCodec在跨语言(中英)场景的扩展,该数据集正推动语音离散表征向多语言、多码率兼容的方向演进,为下一代低比特率语音通信与生成式模型提供关键训练与评测资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务