LHCP-ASR-segments
收藏资源简介:
该数据集是LHCP-ASR Segments,一个从原始LHCP-ASR语料库(高能粒子物理领域窄域英文ASR基准测试)衍生的段级音频数据集。与原始语料库不同,本数据集直接提供经过处理的段级音频(每段时长小于30秒),专门用于评估。它包含两个测试子集:test.2020(4017个样本)和test.2022(9738个样本)。每个样本包含音频文件和对应的转录文本,以及演讲级别的元数据,包括演讲标识符(talk_id)、段在演讲中的顺序位置(segment_pos)、演讲标题(title)和主要演讲者标识符(speaker_id)。文本转录中已去除<UNK>标记。该数据集适用于窄域自动语音识别(ASR)模型的评估和基准测试。数据规模约为10K到100K样本。语言为英语,许可协议为CC-BY-NC-ND 4.0。
This dataset is LHCP-ASR Segments, a segment-level audio dataset derived from the original LHCP-ASR corpus (a narrow-domain English ASR benchmark for high-energy particle physics). Unlike the original corpus, this dataset directly provides preprocessed segment-level audio (each segment is less than 30 seconds) specifically for evaluation. It contains two test subsets: test.2020 (4017 samples) and test.2022 (9738 samples). Each sample includes an audio file and its corresponding transcription, along with talk-level metadata including talk_id, segment_pos, title, and speaker_id. The <UNK> tokens have been removed from the transcriptions. This dataset is suitable for evaluating and benchmarking narrow-domain automatic speech recognition (ASR) models. The data size is approximately 10K to 100K samples. Language: English. License: CC-BY-NC-ND 4.0.
LHCP-ASR Segments 数据集概述
基本信息
- 数据集名称: LHCP-ASR Segments
- 语言: 英语 (en)
- 许可证: CC-BY-NC-ND 4.0
- 任务类别: 自动语音识别 (Automatic Speech Recognition)
- 标签: audio, automatic-speech-recognition, speech, particle-physics, cern, narrow-domain
- 数据规模: 10K < n < 100K 条样本
- 总数据量: 约 3.95 GB(下载大小约 4.11 GB)
内容简介
LHCP-ASR Segments 是一个从 mllp/LHCP-ASR 数据集中导出的分段级(segment-level)音频数据集,用于高能粒子物理学领域的窄域自动语音识别(ASR)基准测试。原始语料由欧洲核子研究中心(CERN)提供。
与原始数据集(mllp/LHCP-ASR)的区别
- 无子集划分:音频直接以分段形式提供(每段音频时长小于30秒),不包含
longform配置。 - 评估分区:仅包含测试(test)分区,具体为
test.2020和test.2022。 - 文本规范化:移除了手动转录中用于标记无法辨识语音的
<UNK>标记。 - 新增元数据:每个样本包含 talk 级别的元数据字段(
talk_id、segment_pos、title、speaker_id)。
元数据字段说明
- talk_id (str): 该音频分段所属演讲的唯一标识符。
- segment_pos (int): 该分段在所属演讲中的顺序位置。
- title (str): 全体演讲(plenary talk)的标题。
- speaker_id (str): 演讲的主要报告人标识符。注意该字段指向演讲的指派报告人,并不严格代表每个分段中实际发声的人,分段中可能包含会议主持或问答环节观众的声音。
- transcription (str): 音频对应的文字转录内容。
- audio (audio): 音频文件。
数据分区统计
| 分区 | 样本数量 | 数据大小 |
|---|---|---|
| test.2020 | 4,017 | 约 1.67 GB |
| test.2022 | 9,738 | 约 2.28 GB |
| 合计 | 13,755 | 约 3.95 GB |
数据格式
每个样本的特征包括:talk_id(字符串)、segment_pos(uint16整数)、title(字符串)、speaker_id(字符串)、transcription(字符串)、audio(音频类型)。数据可通过 Hugging Face datasets 库直接加载,支持加载完整数据集或指定测试分区(如 test.2020、test.2022)。
引用信息
使用该数据集时,应引用原始论文:Santamaría-Jordà 等人于 Interspeech 2025 发表的关于 LHCP-ASR 语料库的论文(DOI: 10.21437/Interspeech.2025-2630)。
法律声明
语音和文本数据由欧洲核子研究中心(CERN)根据合同 PO OV9177345 提供,并遵循 CERN 文献服务器(CDS)的使用条款与条件。




