遇见数据集

fastt

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集是一个面向语音识别研究的综合资源,包含多个配置子集,覆盖从原始音频到模型嵌入及评估指标的多层次信息。基础配置(base)提供16kHz采样率的音频、对应文本、说话人ID和章节ID,适用于语音识别模型的训练与评估。默认配置(default)包含文本、转录、模型嵌入(如来自不同语音模型的表示)、MFCC特征以及字错误率(WER)及其分解(替换、删除、插入错误)等评估指标,可用于语音识别系统的性能分析。MFCC配置仅提供MFCC特征,便于快速特征提取。模型系列配置(model_data2vec, model_espnet_conformer, model_espnet_transformer, model_wav2vec2, model_wav2vec2_large, model_whisper_large_v3)分别存储了对应模型(如Data2Vec、ESPNet Conformer/Transformer、Wav2Vec2、Whisper)的嵌入表示及其归一化转录、WER等指标,支持模型表示分析。探测配置(probe_espnet_conformer, probe_espnet_transformer, probe_whisper_large_v3)包含通过线性探测获得的评估结果,如R²、皮尔逊相关系数、斯皮尔曼相关系数、选择性等,用于衡量模型内部表示与语言特征(如音素、词性等)的关联。数据集划分为验证集(clean/other)和测试集(clean/other),其中clean子集为低噪声环境,other子集包含更多背景噪声。总体样本数:验证集clean约2703条,验证集other约2864条,测试集clean约2620条,测试集other约2939条。数据集适用于语音识别、语音表示学习、模型评估、特征分析等任务。

This dataset is a comprehensive resource for speech recognition research, containing multiple configuration subsets covering multi-level information from raw audio to model embeddings and evaluation metrics. The base configuration provides audio at 16kHz sampling rate, corresponding transcripts, speaker IDs, and chapter IDs, suitable for training and evaluating speech recognition models. The default configuration includes text, transcripts, model embeddings (e.g., representations from different speech models), MFCC features, and evaluation metrics such as word error rate (WER) and its decompositions (substitution, deletion, insertion errors), which can be used for performance analysis of speech recognition systems. The MFCC configuration only provides MFCC features for fast feature extraction. The model series configurations (model_data2vec, model_espnet_conformer, model_espnet_transformer, model_wav2vec2, model_wav2vec2_large, model_whisper_large_v3) store the corresponding model embeddings (e.g., Data2Vec, ESPNet Conformer/Transformer, Wav2Vec2, Whisper) along with normalized transcripts, WER, and other metrics, supporting model representation analysis. The probe configurations (probe_espnet_conformer, probe_espnet_transformer, probe_whisper_large_v3) contain evaluation results obtained via linear probing, such as R², Pearson correlation coefficient, Spearman correlation coefficient, and selectivity, used to measure the association between model internal representations and linguistic features (e.g., phonemes, parts of speech). The dataset is divided into validation sets (clean/other) and test sets (clean/other), where the clean subset has low-noise environments and the other subset contains more background noise. Total sample counts: validation clean ~2703, validation other ~2864, test clean ~2620, test other ~2939. The dataset is suitable for tasks such as speech recognition, speech representation learning, model evaluation, and feature analysis.

创建时间:
2026-08-15
原始信息汇总

数据集 fastt 概述

该数据集主要围绕语音识别任务构建,基于 LibriSpeech 数据,包含多个配置,涵盖原始音频、转录文本、模型嵌入、MFCC 特征及探测分析结果。

总体构成

数据集包含多个子配置,按功能可分为以下几类:

  • 原始音频与文本base):包含音频文件(16kHz 采样率)、文本转录、说话人及章节信息。
  • 聚合特征defaultmfcc):提供文本、转录、嵌入向量、MFCC 特征及 WER 统计。
  • 模型输出与嵌入model_*):多个语音模型(如 Canary、Data2Vec、ESPnet、Wav2Vec2、Whisper 等)的转录结果、WER 指标及池化嵌入向量。
  • 探测分析结果probe_*probe):线性探测评估结果,包含各模型在不同层、池化方式下的 R²、相关性等指标。

主要配置详情

base 配置

  • 特征id(字符串)、file(字符串)、audio(音频,16000 Hz)、text(字符串)、speaker_id(整数)、chapter_id(整数)、nsamples(整数)
  • 数据划分
    • validation_clean:2,703 条
    • validation_other:2,864 条
    • test_clean:2,620 条
    • test_other:2,939 条
  • 下载大小:约 1.34 GB;数据集总大小:约 1.42 GB

default 配置

  • 特征text(字符串)、transcription(字符串)、embedding(float16 序列)、mfcc(float16 序列)、n_frames(整数)、sub/dele/ins/nref(整数)、wer(浮点数)
  • 数据划分
    • validation:5,567 条
    • test:5,559 条
  • 下载大小:约 5.96 GB;数据集总大小:约 6.00 GB

mfcc 配置

  • 特征id(字符串)、mfcc(float16 序列)、mfcc_n_frames(整数)
  • 数据划分:与 base 相同的四个划分(validation_clean、validation_other、test_clean、test_other),条数一致
  • 下载大小:约 95.0 MB;数据集总大小:约 114.9 MB

model_* 系列配置

每个配置对应一个独立的语音识别模型,包含 idtranscriptiontranscription_normtext_norm、WER 相关指标(werwer_raw 及子错误计数),以及从特定层提取的池化嵌入(如 pool_l*_meanmaxminsumstdfirstlast),向量的维度因模型而异。

涉及模型及嵌入维度:

配置名 模型说明 嵌入维度
model_canary_qwen_2_5b Canary Qwen 2.5B 1024
model_data2vec Data2Vec 768
model_espnet_conformer ESPnet Conformer 512
model_espnet_transducer ESPnet Transducer 512
model_espnet_transformer ESPnet Transformer 512
model_mfcc_pooled MFCC 池化 13
model_parakeet_tdt_0_6b_v2 Parakeet TDT 0.6B v2 1024
model_wav2vec2 Wav2Vec2 768
model_wav2vec2_large Wav2Vec2 Large 1024
model_whisper_large_v3 Whisper Large v3 1280

各模型配置均包含 validation_cleanvalidation_othertest_cleantest_other 四个划分,具体条数分别为:2703、2864、2620、2939。各模型总体数据规模约在 163 MB 至 403 MB 之间。

probe_* 系列配置

提供探测分析结果,包含以下字段:

  • 模型信息modellayerpoolingtargetsplitfeaturetrain_on
  • 性能指标cv_r2r2selectivityr2_beyond_lengthr2_length_onlypearson_rspearman_rp_valuermser2_shuffledr2_dummy
  • 统计信息alphadofn_trainn_evaln_features

每个探测配置仅含 train 划分,包含 14 条示例,数据集规模约 3 KB。

数据规模总结

配置类别 划分数量 单条示例数范围 总数据集大小
base 4 个划分 2,620 - 2,939 约 1.42 GB
default 2 个划分 5,559 - 5,567 约 6.00 GB
mfcc 4 个划分 2,620 - 2,939 约 115 MB
model_* 4 个划分/配置 2,620 - 2,939 约 163 MB - 403 MB
probe_* 1 个划分/配置 14 约 3 KB

应用方向

该数据集适用于:

  • 语音识别模型的评估与基准测试
  • 语音嵌入特征的可解释性分析(通过线性探测)
  • 不同模型层输出与语音属性(如时长、错误率)之间的关系研究
搜集汇总
数据集介绍
fastt 数据集图片
构建方式
本数据集基于LibriSpeech基准,整合了多种前沿语音识别模型的推理结果与深层特征。构建过程首先收集原始音频及对应文本,随后通过多模型(如Whisper、Wav2Vec2等)生成转写文本与词错误率(WER)指标,并提取各模型中间层的池化特征(如均值、最大值等)。此外,还包含了MFCC声学特征及针对语音时长、替换、删除、插入等误差的细粒度标注,形成了多层次、多维度的语音分析资源。
使用方法
使用者可通过HuggingFace datasets库便捷加载不同配置,如基础音频数据、模型特征或探针结果。适用于语音识别误差分析、模型内部表征探究、时长预测及特征可视化等研究场景。数据划分为干净与嘈杂的验证集和测试集,便于在统一框架下评估和对比模型性能,或作为下游任务的输入特征,亦可复现探针实验以验证假设。
背景与挑战
背景概述
fastt数据集诞生于自动语音识别(ASR)与可解释性研究交汇的前沿领域,旨在系统性地剖析深度语音模型对时长等基础声学属性的编码机制。该数据集由多组研究人员基于LibriSpeech语料库精炼而成,围绕语音时长这一核心维度,集成了从传统MFCC特征到Whisper Large V3等十余种主流ASR模型的中间层表征与词错误率(WER)等行为指标,并辅以线性探针(probing)分析结果,为探究语音模型内部表征与时长属性的因果关系提供了宝贵的基准。作为连接语音信号处理与可解释人工智能的桥梁,fastt数据集为验证时长对ASR性能的约束性影响、推动时长鲁棒性研究提供了关键资源,对设计面向真实场景的语音系统具有重要的理论与实践意义。
当前挑战
该数据集所着力应对的领域挑战在于,尽管现代ASR模型在标准评估集上已取得显著进展,但其对语音时长属性的敏感性与内核编码机制仍晦暗不明,这限制了系统在语速异常、间歇停顿等非规范场景下的适应能力。构建过程中,研究人员面临多重技术壁垒:一是需从多个异构ASR体系(如wav2vec2、Conformer、Whisper等)中统一提取并池化不同层级的表征,确保特征对齐与可比性;二是需在保持音频内容一致的前提下准确操控时长,并在无参考文本的原始转录中精确计算WER及替换、删除、插入等细粒度错误指标;三是探针实验的设计需严谨控制时长与内容的混淆效应,通过随机打乱与基准回归科学地验证时长信息的线性可解性,从而确保结论的稳健性与可解释性。
常用场景
经典使用场景
FASTT数据集在语音处理与自然语言处理交叉领域内,是一个融合了音频、文本、说话人信息及多模型投出的深层次表征的综合性语料库。其经典使用场景聚焦于语音识别系统的性能诊断与误差分析,研究者可基于该数据集对诸如Whisper、Wav2Vec2及Conformer等前沿模型的转录结果进行细粒度的词错误率评估,结合内嵌的编辑操作计数(替换、删除、插入)与多种池化策略下的中间层特征,深入探究模型在不同噪声环境及说话风格下的行为差异。
解决学术问题
该数据集系统性地解决了语音识别领域内长期存在的可解释性匮乏与评测碎片化问题。通过标准化并预计算多种当前最先进结构在标准测试基准上的多层表征及误差统计,FASTT为定量刻画模型内部语音特征与最终识别失误之间的映射关系提供了翔实素材。这促进了对自监督预训练模型中语言知识分布、长度泛化机制以及跨说话人鲁棒性等关键学术命题的实证研究,从而推动了语音识别理论从‘黑盒’走向‘白盒’的进程。
实际应用
在实际应用层面,FASTT数据集的价值体现在其支持高效模型选型与部署决策。得益于已包含的众多主流语音识别系统的生成结果及其对应的MFCC特征,开发者能绕过繁冗的初步推理流程,直接利用其内含的丰富嵌入与误差统计来比较不同架构在各类鲁棒性挑战下的表现。这使得其可以直接作为辅助工具服务于智能助手、字幕生成、会议转写等产品的语音引擎优化中,帮助定位失败案例,快速迭代更精准、更可靠的商业级语音交互系统。
数据集最近研究
最新研究方向
在当前语音识别领域,针对模型内部表征的深度剖析与解释性研究成为前沿热点。FASTT数据集应运而生,它集成了多种主流语音模型的中间层特征、音素级对齐信息及丰富的元数据,为探索模型决策机制提供了宝贵资源。该数据集不仅涵盖经典的wav2vec2、Whisper等模型,还纳入了最新的Canary-Qwen等混合架构,其精细的池化特征与对齐标签,正助力研究者揭示语音模型如何编码语言学信息,推动可解释语音AI的发展,对提升模型鲁棒性与公平性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务