遇见数据集

tiron-eval-meetings

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Tiron evaluation meetings 是一个用于自动语音识别和说话人日志基准测试的评估数据集。它包含 17 个完整的、保留的会议录音,专门用于在 Tiron 模型卡上复现和比较模型性能。数据集整合了来自三个知名公开语料库的远场单通道音频:AMI Meeting Corpus(4 个会议)、ICSI Meeting Corpus(3 个会议)和 NOTSOFAR-1 评估集(10 个会议)。所有音频均为 16 kHz 单声道 WAV 格式,并附带有说话人归属的参考文本转录。每个数据样本提供完整的会议音频文件、一个包含按时间顺序排列的说话人话语列表(包含说话人ID、开始时间、结束时间和文本)的 JSON 文件,以及(仅限 NOTSOFAR 子集)标注为未知的音频时间片段信息。数据集的打包格式旨在与 Tiron 测试工具兼容,以支持标准化的评估流程。

Tiron evaluation meetings is an evaluation dataset for automatic speech recognition and speaker diarization benchmarking. It contains 17 complete, held-out meeting recordings specifically designed for reproducing and comparing model performance on the Tiron model card. The dataset integrates far-field single-channel audio from three well-known public corpora: AMI Meeting Corpus (4 meetings), ICSI Meeting Corpus (3 meetings), and the NOTSOFAR-1 evaluation set (10 meetings). All audio is in 16 kHz mono WAV format and comes with reference text transcriptions including speaker attribution. Each data sample provides the full meeting audio file, a JSON file containing a chronologically ordered list of speaker utterances (with speaker ID, start time, end time, and text), and (for the NOTSOFAR subset only) information on audio time segments labeled as unknown. The dataset is packaged to be compatible with the Tiron testing tool to support standardized evaluation processes.

提供机构:
Trelis
创建时间:
2026-07-23
原始信息汇总

数据集概述

Tiron evaluation meetings 是一个用于自动语音识别(ASR)基准测试的评估数据集,包含 17 场完整的会议录音,旨在配合 Trelis/tiron 模型进行性能评测。

数据集信息

  • 许可证:CC BY 4.0
  • 任务类型:自动语音识别(automatic-speech-recognition)
  • 语言:英语(en)
  • 标签:会议转录(meeting-transcription)、说话人日志化(speaker-diarization)、基准测试(benchmark)

数据构成

数据集包含 17 场完整会议,分为以下三个子集:

分割 会议数量 来源 音频说明
ami 4 场 (ES2004a, IS1009a, TS3003a, EN2002a) AMI Meeting Corpus 单个远场麦克风 (Array1-01)
icsi 3 场 (Bmr013, Bmr018, Bro021) ICSI Meeting Corpus 4 个远场 PZM 房间麦克风的均值混音
notsofar 10 场 (MTG_* 会话) NOTSOFAR-1 eval set 每个会议一个单通道远场设备

数据格式

每条数据记录包含:

  • corpus:所属语料库名称
  • meeting_id:会议唯一标识符
  • audio:整场会议的 16 kHz 单声道 WAV 音频文件
  • utterances_json:参考转录文本列表(每条包含 speaker_id, begin_time, end_time, text
  • unknown_spans_json:仅 NOTSOFAR 子集包含,标记 [start, end] 范围的未知内容区间(用于掩码规则)
  • duration_s:音频时长(秒)

许可证与归属

  • AMI Meeting Corpus — © 爱丁堡大学和 AMI 联盟,CC BY 4.0。音频为原始 Array1-01 远场通道,转录从 NXT 注释转换为扁平话语列表。
  • ICSI Meeting Corpus — © 国际计算机科学研究所,CC BY 4.0。音频为四个远场 PZM 房间麦克风通道(chanE/chanF/chan6/chan7)的均值下混音,转录从 MRT 转换而来。
  • NOTSOFAR-1 — © 微软,CC BY 4.0。音频为每个会话的单个单通道远场设备,参考转录来自 gt_transcription.json

评分规范

模型卡中使用的评分惯例(cpWER、按语料库池化、NOTSOFAR 的 <UNKNOWN/> 掩码规则)实现在 Tiron harness 评估脚本中。

搜集汇总
数据集介绍
tiron-eval-meetings 数据集图片
构建方式
在语音识别与说话人日志领域的评估中,可靠且标准化的基准测试至关重要。该数据集整合了三个权威会议语料库——AMI Meeting Corpus、ICSI Meeting Corpus及NOTSOFAR-1挑战集的17场完整远场会议,构建过程遵循严格的流水线。对于AMI数据,采用单一远距离麦克风(Array1-01)的原始单声道16 kHz WAV音频,并将NXT格式的标注转换为扁平的语句列表;ICSI数据则通过对四个远距离PZM房间麦克风通道进行平均下混得到单声道音频,同时从MRT格式转录;NOTSOFAR-1数据保留了每个会话中单一通道远距离设备的原始录音及对应的真实转录。所有时间线均对齐,并提供标注者标记的未知音频片段(仅在NOTSOFAR中),最终形成统一的评估集合。
特点
该数据集的核心特点在于其高度标准化的基准测试能力,为Tiron模型的性能评估提供了可复现的验证框架。每个样本均包含整场会议的16 kHz单声道WAV音频文件、带有说话人标签的参考语句列表(含起始时间、结束时间及文本),以及NOTSOFAR特有的未知音频跨度信息。数据来源于三种不同场景的会议设定,涵盖多种远场麦克风配置和环境噪声条件,充分考验模型在实际复杂场景中的鲁棒性。评估指标采用cpWER并按语料库进行池化统计,同时引入NOTSOFAR的未知音频掩码规则,使得评测结果具备严格的科学意义。
使用方法
研究者可借助Tiron评测工具链(harness)轻松复现模型卡上的基准结果。使用前需安装该工具库,并确保每个会议样本的音频文件与对应的JSON结构化标注数据(包括说话人ID、时间戳及文本)正确关联。数据集按照语料库分为三个子集(ami、icsi、notsofar),用户可直接加载对应分组的WAV文件和转录文件,利用harness内置的评估脚本计算cpWER等指标。对于NOTSOFAR子集,需特别关注未知音频跨度的掩码规则,该规则在评估时会自动应用以提升测量准确性。所有数据均以CC BY 4.0许可发布,允许广泛的科研用途。
背景与挑战
背景概述
Tiron评估会议数据集(Tiron evaluation meetings)由Trelis Research机构于2024年创建,旨在为远场单通道会议转录与说话人日志化任务提供标准化的基准测试平台。该数据集整合了AMI会议语料库、ICSI会议语料库及NOTSOFAR-1挑战数据集中的17个完整会议录音,每个样本均为16 kHz单声道WAV格式的远场音频,并附带说话人标注的参考转录文本。通过统一的评估协议(如cpWER指标和未知片段掩码规则),该数据集为比较不同语音处理模型在真实会议场景下的性能提供了可重复的评测框架,对推动自动语音识别与说话人日志化技术的交叉研究具有重要参考价值。
当前挑战
该数据集聚焦于解决远场单通道音频中重叠语音、嘈杂环境及未知说话人片段等实际挑战,这些因素严重制约了会议转录系统的词错误率表现。构建过程中面临三大难点:不同来源会议语料库(AMI、ICSI、NOTSOFAR-1)的音频格式(如ICS中使用四路话筒均值混合)与转录标注体系(如NXT与MRT格式)需要统一标准化;NOTSOFAR-1数据中标注为<UNKNOWN/>的不可识别语音片段需设计专门掩码规则以准确评估模型性能;此外,还需确保从16 kHz音频到参考时间线的同步一致性以及跨库评估指标的可复现性,这要求精密的预处理流水线与评估脚本设计。
常用场景
经典使用场景
在语音识别与说话人日志领域,tiron-eval-meetings数据集为远场多说话人会议场景下的自动语音识别(ASR)与说话人日志联合评估提供了标准化的基准测试平台。该数据集包含来自AMI、ICSI和NOTSOFAR-1三个经典会议语料库的17场完整会议录音,均为远场单声道16kHz音频,并配有说话人归属的参考转录文本。研究者通常利用该数据集在统一的评估框架下(如Tiron评估工具链)计算cpWER等指标,以衡量系统在真实会议环境中的综合表现。其核心使用价值在于提供了一个公开、可复现的评估协议,使得不同会议场景下的ASR与说话人日记化技术的比较成为可能,尤其适用于验证模型在远场、多通道混响及重叠语音等挑战性条件下的鲁棒性。
实际应用
在实际应用层面,该数据集为商业智能会议系统、远程协作平台的语音转写与说话人标记功能的性能验证提供了现实依据。智能会议纪要系统需要在不获取多通道阵列数据的前提下,仅依靠单声道远场录音完成说话人区分、逐句转写以及未知语音段的标注。该数据集的NOTSOFAR-1部分特别引入了人工标记的未知语音片段,模拟了真实场景中模糊不清或非言语发音的干扰情况,这一设计使得开发人员能够直接评估商用小麦克风拾音时的系统容错率。此外,会议记录自动化工具可将该数据集作为基准,验证其能否在无视觉线索辅助的音频会议中准确区分参会者,从而为高管会议、在线课堂等隐私敏感场景的语音分析方案提供可靠且可追溯的检验基础。
衍生相关工作
tiron-eval-meetings数据集的发布直接催生了一批以统一评估为核心的衍生工作。其中最典型的是由Tirlis Research团队开发的Tiron评估工具链,该开源项目实现了cpWER指标计算和NOTSOFAR掩码规则,使得研究者能够在该数据集上实现一键复现评估。此外,该数据集还支撑了多届学术评测任务的规范化进程,例如NOTSOFAR-1挑战赛即直接采用该数据集的定稿分割与评分逻辑,推动了远场会议转写技术的公平竞争。在实际工作流中,后续的说话人日志模型(如EEND-EDA)和端到端ASR系统(如Whisper的微调版本)常以该数据集上的结果作为论文必报指标,逐步形成了跨语料库的、标准化的学术共识。围绕该数据集的模型卡文档和社区讨论,也进一步推动了开放科学文化在语音研究中的落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务