遇见数据集

test-y

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

LangPipe ASR数据集(test-y)是一个用于自动语音识别(ASR)和语音处理研究的音频转录数据集。它包含1000个乌克兰语短音频片段及其对应的文本转录,并提供了丰富的元数据标注,包括音频基本属性(如时长、信噪比、响度)、质量评估标签、语音活动检测(静音比、语音比)、语言信息(音频语言、文本语言、语码转换检测及类型)、说话人相关数据(匿名说话人标签、说话人索引、相似度)以及语音内容分析(如填充词检测与标注、不文明用语检测与统计)。这些元数据使得数据集不仅适用于基础ASR模型训练与评估,还特别适合语音质量分析、多语言及语码转换语音研究、话语不流利性(如填充词)分析、说话人相关研究等更广泛的语音处理任务。数据集采用CC BY 4.0许可证发布,用户可通过Hugging Face数据集查看器直接收听音频样本。

The LangPipe ASR dataset (test-y) is an audio transcription dataset designed for automatic speech recognition (ASR) and speech processing research. It contains 1000 short Ukrainian audio clips with corresponding text transcriptions, accompanied by rich metadata annotations. Each sample includes core data such as 16kHz sampled audio files (the audio field) and transcription text (the transcription field). Additionally, the dataset provides numerous auxiliary analysis features, including basic audio attributes (e.g., duration, signal-to-noise ratio, loudness), quality assessment labels, speech activity detection (silence ratio, speech ratio), language information (audio language, text language, code-switching detection and types), speaker-related data (anonymous speaker labels, speaker indices, similarity), and speech content analysis (e.g., filler word detection and annotation, offensive language detection and statistics). These detailed metadata make the dataset suitable not only for basic ASR model training and evaluation but also for broader speech processing tasks such as speech quality analysis, multilingual and code-switching speech research, disfluency analysis (e.g., filler words), and speaker-related studies. The dataset is released under the CC BY 4.0 license, and users can directly listen to audio samples via the Hugging Face dataset viewer.

创建时间:
2026-07-07
原始信息汇总

数据集概述

数据集名称:LangPipe ASD 数据集 (HuggingFace 名称: Yehor/test-y)

许可证:Creative Commons Attribution 4.0 International (CC-BY-4.0)

主要语言:乌克兰语

数据集大小:少于 1,000 个样本

任务类别:自动语音识别、音频分类

标签:音频、语音、自动语音识别、说话人日记化、数据集


数据集结构

数据集包含一个训练划分(train),共 1,000 个样本。

划分 样本数量
train 1,000

数据特征

数据集包含丰富的音频和文本特征,具体如下:

  • audio:音频样本,采样率为 16 kHz。
  • transcription:音频的文本转录。
  • transcription_original:原始文本转录。
  • turns:说话人轮次信息列表,包含以下字段:
    • speaker(说话人标签)
    • speaker_index(说话人索引)
    • start(开始时间)
    • end(结束时间)
    • text(该轮次文本)
  • has_pii:是否包含个人身份信息(布尔值)。
  • num_pii_objects:个人身份信息对象的数量。
  • duration:音频时长(秒)。
  • speech_rms_dbfs:语音响度估计(dBFS)。
  • noise_rms_dbfs:噪声响度估计(dBFS)。
  • snr_db:信噪比估计值。
  • quality:音频样本质量标签。
  • silence_ratio:静音比例。
  • speech_ratio:语音比例。
  • fillers:检测到的填充词或话语标记列表,包含以下字段:
    • label(标签)
    • language(语言)
    • kind(类型)
    • start(开始时间)
    • end(结束时间)
    • confidence(置信度)
  • filler_count:检测到的填充词数量。
  • obscene:检测到的冒犯性词汇列表,包含以下字段:
    • term(词条)
    • matched(匹配内容)
    • language(语言)
    • start(开始时间)
    • end(结束时间)
    • confidence(置信度)
  • obscene_count:检测到的冒犯性词汇数量。
  • code_switching:是否检测到语码转换(布尔值)。
  • code_switching_type:语码转换类型(如有)。
  • code_switching_confidence:语码转换检测的置信度。
  • code_switching_primary_language:检测到的主要语言。
  • code_switching_secondary_language:检测到的次要语言(如有)。
  • audio_language:音频中检测到的语言。
  • text_language:转录文本中检测到的语言。
  • speaker:匿名化说话人标签。
  • speaker_index:说话人数字索引。
  • speaker_similarity:说话人相似性得分。
  • source_file:源文件。
  • loudness_lufs:响度(LUFS)。
  • loudness_range_lu:响度范围(LU)。
  • true_peak_dbtp:真实峰值(dBTP)。
  • chunk_start:音频块开始时间。
  • chunk_end:音频块结束时间。

预期用途

该数据集适用于以下研究和应用场景:

  • 自动语音识别(ASR)
  • 音频转录研究
  • 语音质量分析
  • 多语言及语码转换语音实验
  • 填充词及语音不流畅性分析
搜集汇总
数据集介绍
test-y 数据集图片
构建方式
在自动语音识别与音频处理研究领域,高质量标注数据集的构建是推动技术发展的核心基石。test-y数据集以乌克兰语语音为核心,精心采集了1000条短音频片段,每条音频均与对应的文本转写、声学质量标签、信噪比测量值及语种信息等元数据相绑定。构建过程中,数据集不仅保留了原始转写,还进一步通过算法标注了填充词、不雅词汇、语码转换事件及说话人相似度等精细维度,从而形成一个多层级、多属性的结构化语音数据集。
特点
该数据集最显著的特征在于其丰富的元数据维度与精细化的标注粒度。除基础的音频与转写外,每条样本均包含语音与噪声的均方根幅度、信噪比、沉默率及语音占比等声学品质指标,为语音质量评估提供了量化依据。尤为突出的是,数据集还系统性地标注了填充词、不雅用语及语码转换现象,并附带置信度与语种信息,使得研究者能够从语音内容、声学特征、语言混合度及说话人身份等多重视角展开分析。
使用方法
在Hugging Face生态中,用户可通过Datasets库便捷加载该数据集,利用'audio'列直接聆听样本的同时,依据'transcription'列进行语音识别模型的训练与评估。其多元属性支持研究者开展自动语音识别、音频转写、语音质量分析、多语种及语码转换实验、填充词与话语不流利性检测等任务。建议结合Python脚本对元数据进行过滤(如按quality或snr_db筛选子集),以适配特定场景下的模型调优与消融研究。
背景与挑战
背景概述
test-y数据集诞生于自动语音识别(ASR)与语音处理研究蓬勃发展的背景下,由开发者Yehor于近期创建,旨在为乌克兰语及其他多语种语音研究提供高质量的标注资源。该数据集聚焦于短音频片段及其对应的文本转写,涵盖了丰富的元数据,如时长、质量标签、信噪比、语言信息、填充词标注及语码转换指示等,为细粒度的语音特征分析奠定了坚实基础。其发布填补了中小规模、多维度标注语音数据集的空白,尤其适合用于多语言ASR、语音质量评估及语码转换实验,对推动低资源语言语音技术的发展具有重要价值。
当前挑战
领域问题的挑战主要体现在多语种语码转换和口语不流利现象的处理上。数据集需应对填充词、脏话及语码转换的准确检测,这要求模型能理解复杂的语言混合与语境突变。构建过程中的挑战则源于标注任务的复杂性:手动标注1000条音频的填充词和语码转换需要语言学专家介入,且不同语言间的声学差异使得信噪比与质量标签的自动化提取难以保证一致性。此外,说话人去标识化和平滑区分噪声与语音的挑战,进一步考验了数据集的预处理真实性,为后续模型泛化性带来潜在瓶颈。
常用场景
经典使用场景
在语音处理与自然语言理解交叉领域,test-y数据集为自动语音识别(ASR)和音频转录研究提供了精细化的实验平台。其经典应用场景聚焦于利用短音频片段与对应文本转录,结合丰富的音视频元数据(如信噪比、语速比、停顿比例等)来训练和评估端到端或混合型ASR模型。研究者可借助该数据集探索语音质量对转录准确率的影响,亦可利用其标注的说话人身份、填充词及脏话检测等信息,推动多说话人角色区分与口语流利度分析的深入研究。
衍生相关工作
围绕test-y数据集的细粒度标注特性,衍生出一系列经典学术工作。在ASR领域,研究者基于其语音质量标签发展了分层解码策略,通过动态调整注意力机制以应对不同信噪比的语音片段;在口语处理方面,填充词与语码转换的标注催生了流利度自动评估系统,以及用于双语ASR端到端训练的Meta-Learning方法。此外,其说话人相似度指标被用作声纹识别与聚类实验的对比基准,推动了跨语音片段的说话人跟踪技术在会议转录系统中的应用落地。
数据集最近研究
最新研究方向
在语音处理领域的前沿探索中,该数据集凭借其精细的元数据标注(包括填充词检测、脏话识别、语码转换标记及说话人相似度评分),为多维度语音理解与质量评估研究提供了优质资源。近年来,随着多语言及语码混合场景在全球化通信中的激增,研究者开始利用此类数据驱动说话人日志与语种识别模型的鲁棒性提升,并通过噪声与信噪比指标优化低资源场景下的语音识别管线。此外,数据集中填充词与不雅内容的标注,为情感计算、对话流畅性分析与自然语言交互系统的伦理审计打开了新的窗口,推动了从单纯转录向深层语义与交互质量评估的范式迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务