遇见数据集

LHCP-ASR-segments

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是LHCP-ASR Segments,一个从原始LHCP-ASR语料库(高能粒子物理领域窄域英文ASR基准测试)衍生的段级音频数据集。与原始语料库不同,本数据集直接提供经过处理的段级音频(每段时长小于30秒),专门用于评估。它包含两个测试子集:test.2020(4017个样本)和test.2022(9738个样本)。每个样本包含音频文件和对应的转录文本,以及演讲级别的元数据,包括演讲标识符(talk_id)、段在演讲中的顺序位置(segment_pos)、演讲标题(title)和主要演讲者标识符(speaker_id)。文本转录中已去除<UNK>标记。该数据集适用于窄域自动语音识别(ASR)模型的评估和基准测试。数据规模约为10K到100K样本。语言为英语,许可协议为CC-BY-NC-ND 4.0。

This dataset is LHCP-ASR Segments, a segment-level audio dataset derived from the original LHCP-ASR corpus (a narrow-domain English ASR benchmark for high-energy particle physics). Unlike the original corpus, this dataset directly provides preprocessed segment-level audio (each segment is less than 30 seconds) specifically for evaluation. It contains two test subsets: test.2020 (4017 samples) and test.2022 (9738 samples). Each sample includes an audio file and its corresponding transcription, along with talk-level metadata including talk_id, segment_pos, title, and speaker_id. The <UNK> tokens have been removed from the transcriptions. This dataset is suitable for evaluating and benchmarking narrow-domain automatic speech recognition (ASR) models. The data size is approximately 10K to 100K samples. Language: English. License: CC-BY-NC-ND 4.0.

提供机构:
MLLP Research Group
创建时间:
2026-09-08
原始信息汇总

LHCP-ASR Segments 数据集概述

基本信息

  • 数据集名称: LHCP-ASR Segments
  • 语言: 英语 (en)
  • 许可证: CC-BY-NC-ND 4.0
  • 任务类别: 自动语音识别 (Automatic Speech Recognition)
  • 标签: audio, automatic-speech-recognition, speech, particle-physics, cern, narrow-domain
  • 数据规模: 10K < n < 100K 条样本
  • 总数据量: 约 3.95 GB(下载大小约 4.11 GB)

内容简介

LHCP-ASR Segments 是一个从 mllp/LHCP-ASR 数据集中导出的分段级(segment-level)音频数据集,用于高能粒子物理学领域的窄域自动语音识别(ASR)基准测试。原始语料由欧洲核子研究中心(CERN)提供。

与原始数据集(mllp/LHCP-ASR)的区别

  1. 无子集划分:音频直接以分段形式提供(每段音频时长小于30秒),不包含 longform 配置。
  2. 评估分区:仅包含测试(test)分区,具体为 test.2020test.2022
  3. 文本规范化:移除了手动转录中用于标记无法辨识语音的 <UNK> 标记。
  4. 新增元数据:每个样本包含 talk 级别的元数据字段(talk_idsegment_postitlespeaker_id)。

元数据字段说明

  • talk_id (str): 该音频分段所属演讲的唯一标识符。
  • segment_pos (int): 该分段在所属演讲中的顺序位置。
  • title (str): 全体演讲(plenary talk)的标题。
  • speaker_id (str): 演讲的主要报告人标识符。注意该字段指向演讲的指派报告人,并不严格代表每个分段中实际发声的人,分段中可能包含会议主持或问答环节观众的声音。
  • transcription (str): 音频对应的文字转录内容。
  • audio (audio): 音频文件。

数据分区统计

分区 样本数量 数据大小
test.2020 4,017 约 1.67 GB
test.2022 9,738 约 2.28 GB
合计 13,755 约 3.95 GB

数据格式

每个样本的特征包括:talk_id(字符串)、segment_pos(uint16整数)、title(字符串)、speaker_id(字符串)、transcription(字符串)、audio(音频类型)。数据可通过 Hugging Face datasets 库直接加载,支持加载完整数据集或指定测试分区(如 test.2020test.2022)。

引用信息

使用该数据集时,应引用原始论文:Santamaría-Jordà 等人于 Interspeech 2025 发表的关于 LHCP-ASR 语料库的论文(DOI: 10.21437/Interspeech.2025-2630)。

法律声明

语音和文本数据由欧洲核子研究中心(CERN)根据合同 PO OV9177345 提供,并遵循 CERN 文献服务器(CDS)的使用条款与条件。

搜集汇总
数据集介绍
LHCP-ASR-segments 数据集图片
构建方式
LHCP-ASR-segments数据集是基于高能粒子物理领域窄域自动语音识别基准测试需求而构建的精细分割版本。该数据集源自LHCP-ASR语料库,针对原始长时间音频进行了重新切分,生成每个短于30秒的独立音频片段,并删除了子集层级结构,直接以分段形式呈现。构建过程中,数据集仅保留了评估用的测试分区(test.2020和test.2022),并移除了手动转录中表示不可辨识语音的<UNK>标记,以确保文本的纯净性。此外,每个样本均补充了演讲级别的元数据,包括演讲标识符、段落在演讲中的顺序位置、演讲标题及主讲人标识符,从而为语音识别研究提供了丰富且结构化的数据支撑。
特点
该数据集的显著特点在于其面向高能粒子物理演讲场景的窄域属性,专为评估自动语音识别系统在该专业领域的表现而设计。数据集包含约14,000个音频片段,覆盖了2020年和2022年两个不同时期的测试集,规模适中(10K-100K),且英语为唯一语言。每个音频片段均附有演讲级别的元数据,如演讲标题和主持人标识符,有助于研究者进行多维度分析。特别之处在于,音频片段中可能包含会议主席或问答环节观众的语音,而非严格遵循主讲人的声音,这反映了真实会议场景的复杂性,为系统鲁棒性测试提供了更具挑战性的数据。
使用方法
用户可通过Hugging Face的datasets库便捷地加载该数据集。简单的load_dataset函数调用即可获取完整数据,或者指定特定的测试分区(如test.2020或test.2022)进行针对性评估。数据集中每个样本包含音频文件与转录文本,可直接用于自动语音识别模型的推理与基准测试。此外,丰富的元数据字段支持用户自定义过滤或分组,例如按演讲标题或说话人进行子集分析,便于探索系统在不同演讲或说话人条件下的性能。该数据集适用于学术研究和工业应用中的窄域ASR性能验证。
背景与挑战
背景概述
LHCP-ASR-segments数据集由西班牙瓦伦西亚理工大学的机器学习与语言处理研究团队(MLLP)于2025年创建,并发表于Interspeech 2025。该数据集聚焦于高能粒子物理领域的窄域自动语音识别(ASR)基准测试,源自欧洲核子研究中心(CERN)的公开讲座录音。其核心研究问题在于评估ASR系统在专业术语密集、口音多样且具有高度领域特异性的语音内容上的性能。作为LHCP-ASR的段级版本,本数据集提供了短于30秒的音频片段,并附带了谈话级别的元数据,为窄域ASR研究提供了标准化的测试平台,对推动科学领域专用语音识别技术的进步具有重要影响。
当前挑战
该数据集面对的挑战主要包括:一是领域语音识别难题,高能粒子物理讲座充斥着复杂的专业术语、符号和缩写,且讲话者口音多样,对ASR系统的词汇覆盖和声学建模构成严峻考验;二是数据构建挑战,原始会议录音存在背景噪声、多人发言交替和语音不连贯等问题,需要精细切割为语义完整的段级样本,同时剔除难以辨认的语音(如<UNK>标记)并保留准确的元数据,涵盖讲话者身份、谈话标题和演讲顺序,这一过程中对同步文本与音频的校准及元数据的准确性提出了高度要求。
常用场景
经典使用场景
LHCP-ASR-segments数据集作为高能粒子物理领域窄域自动语音识别(ASR)基准测试的核心资源,其经典使用场景聚焦于学术演讲音频的片段级识别任务。该数据集将CERN大型强子对撞机实验中的全体会议报告切分为低于30秒的音频片段,并配以人工精校的转录文本及丰富的演讲元数据。研究者可借此评估ASR系统在专业术语密集、口音多元、语速多变等复杂声学条件下的识别性能,特别适用于验证模型对窄领域词汇的泛化能力与鲁棒性。其测试集明确分为2020与2022两个时间批次,为跨时域的模型性能对比提供了标准化的评测依据。
实际应用
在实际应用层面,LHCP-ASR-segments可直接服务于科学会议内容的自动化处理流程,包括演讲的实时字幕生成、学术报告的语音检索与摘要生成,以及多语言会议的同传辅助。对于CERN等大型科研机构,该数据集支持构建定制化的语音助手,用于会议记录的快速归档与知识提取,使研究人员能够高效回溯跨年份的讨论脉络。同时,片段级设计便于部署于边缘计算设备,实现了低延迟的语音转写服务,在保障数据隐私的前提下,提升了学术交流的可及性。这一资源亦可用于教育领域,为粒子物理课程提供真实的听力训练素材,促进科学传播。
衍生相关工作
该数据集衍生的相关工作不仅限于ASR模型本身的改进,还催生了多项交叉研究。例如,基于其说话人与主题元数据,研究者探索了说话人验证与语者分离技术在学术会议场景的迁移应用。另有工作利用该语料进行科学术语的上下文感知语言模型微调,显著提升了专业领域语音识别的准确性。此外,该数据集为低资源窄域语音合成提供了训练素材,用于生成自然流畅的物理讲座音频。在评测方法论上,其分时间批次的设计启发了对ASR系统时间泛化能力的研究,相关成果发表于Interspeech等顶级会议,形成了围绕科学语音处理的开源生态,促进了物理学与人工智能社区的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务