tiron-eval-meetings
收藏资源简介:
Tiron evaluation meetings 是一个用于自动语音识别和说话人日志基准测试的评估数据集。它包含 17 个完整的、保留的会议录音,专门用于在 Tiron 模型卡上复现和比较模型性能。数据集整合了来自三个知名公开语料库的远场单通道音频:AMI Meeting Corpus(4 个会议)、ICSI Meeting Corpus(3 个会议)和 NOTSOFAR-1 评估集(10 个会议)。所有音频均为 16 kHz 单声道 WAV 格式,并附带有说话人归属的参考文本转录。每个数据样本提供完整的会议音频文件、一个包含按时间顺序排列的说话人话语列表(包含说话人ID、开始时间、结束时间和文本)的 JSON 文件,以及(仅限 NOTSOFAR 子集)标注为未知的音频时间片段信息。数据集的打包格式旨在与 Tiron 测试工具兼容,以支持标准化的评估流程。
Tiron evaluation meetings is an evaluation dataset for automatic speech recognition and speaker diarization benchmarking. It contains 17 complete, held-out meeting recordings specifically designed for reproducing and comparing model performance on the Tiron model card. The dataset integrates far-field single-channel audio from three well-known public corpora: AMI Meeting Corpus (4 meetings), ICSI Meeting Corpus (3 meetings), and the NOTSOFAR-1 evaluation set (10 meetings). All audio is in 16 kHz mono WAV format and comes with reference text transcriptions including speaker attribution. Each data sample provides the full meeting audio file, a JSON file containing a chronologically ordered list of speaker utterances (with speaker ID, start time, end time, and text), and (for the NOTSOFAR subset only) information on audio time segments labeled as unknown. The dataset is packaged to be compatible with the Tiron testing tool to support standardized evaluation processes.
数据集概述
Tiron evaluation meetings 是一个用于自动语音识别(ASR)基准测试的评估数据集,包含 17 场完整的会议录音,旨在配合 Trelis/tiron 模型进行性能评测。
数据集信息
- 许可证:CC BY 4.0
- 任务类型:自动语音识别(automatic-speech-recognition)
- 语言:英语(en)
- 标签:会议转录(meeting-transcription)、说话人日志化(speaker-diarization)、基准测试(benchmark)
数据构成
数据集包含 17 场完整会议,分为以下三个子集:
| 分割 | 会议数量 | 来源 | 音频说明 |
|---|---|---|---|
ami |
4 场 (ES2004a, IS1009a, TS3003a, EN2002a) | AMI Meeting Corpus | 单个远场麦克风 (Array1-01) |
icsi |
3 场 (Bmr013, Bmr018, Bro021) | ICSI Meeting Corpus | 4 个远场 PZM 房间麦克风的均值混音 |
notsofar |
10 场 (MTG_* 会话) | NOTSOFAR-1 eval set | 每个会议一个单通道远场设备 |
数据格式
每条数据记录包含:
corpus:所属语料库名称meeting_id:会议唯一标识符audio:整场会议的 16 kHz 单声道 WAV 音频文件utterances_json:参考转录文本列表(每条包含speaker_id,begin_time,end_time,text)unknown_spans_json:仅 NOTSOFAR 子集包含,标记[start, end]范围的未知内容区间(用于掩码规则)duration_s:音频时长(秒)
许可证与归属
- AMI Meeting Corpus — © 爱丁堡大学和 AMI 联盟,CC BY 4.0。音频为原始 Array1-01 远场通道,转录从 NXT 注释转换为扁平话语列表。
- ICSI Meeting Corpus — © 国际计算机科学研究所,CC BY 4.0。音频为四个远场 PZM 房间麦克风通道(chanE/chanF/chan6/chan7)的均值下混音,转录从 MRT 转换而来。
- NOTSOFAR-1 — © 微软,CC BY 4.0。音频为每个会话的单个单通道远场设备,参考转录来自
gt_transcription.json。
评分规范
模型卡中使用的评分惯例(cpWER、按语料库池化、NOTSOFAR 的 <UNKNOWN/> 掩码规则)实现在 Tiron harness 评估脚本中。




