遇见数据集

FluidInference/ami-corpus-mirror

收藏
Hugging Face2026-07-06 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是AMI会议语料库的一个镜像子集,专门用于FluidAudio的说话人日志化基准测试。它包含了AMI公开手动注释v1.6.2(重新打包自官方存档,内容相同,包括segments/、words/、corpusResources/meetings.xml)和官方16个会议AMI-SDM评估分割的音频文件(EN2002、ES2004、IS1009、TS3003 × a–d),这些音频文件从上游AMI语料库镜像获取。数据集由AMI联盟/爱丁堡大学根据知识共享署名4.0国际许可证分发,本仓库在相同许可证下未更改地重新分发并注明归属。使用此数据时需引用相关文献。

This dataset is a mirrored subset of the AMI Meeting Corpus, specifically designed for speaker diarization benchmarking of FluidAudio. It includes the publicly available manual annotations of AMI v1.6.2 (repackaged from the official archive with identical content, including directories segments/, words/, and the file corpusResources/meetings.xml) and the audio files from 16 official AMI-SDM evaluation split meetings (EN2002, ES2004, IS1009, TS3003 × a–d), which are mirrored from the upstream AMI Corpus. The dataset is distributed by the AMI Consortium / The University of Edinburgh under the Creative Commons Attribution 4.0 International License. This repository redistributes it unchanged under the same license with proper attribution. Relevant literature should be cited when using this dataset.

提供机构:
FluidInference
搜集汇总
数据集介绍
FluidInference/ami-corpus-mirror 数据集图片
构建方式
AMI会议语料库镜像数据集(AMI Corpus Mirror)源自爱丁堡大学研究团队构建的AMI Meeting Corpus,专注于收录用于说话人日志化(speaker diarization)基准测试的音频与标注子集。该镜像数据集由FluidAudio团队从上游官方服务器抓取并重新打包,包含AMI公开人工标注文件v1.6.2版本(内含分段、词汇及会议元数据),以及AMI-SDM评估划分的16场会议音频(如EN2002、ES2004、IS1009、TS3003各四段)。所有文件均保持原始内容不变,以压缩包和独立WAV格式组织,确保与官方语料库的完全一致性。
特点
该数据集的独到之处在于其作为稳定性镜像的定位,一方面完整保留了原始AMI语料库在说话人日志化场景下的标准评估划分与精细人工标注,另一方面有效规避了上游服务器可用性波动对持续集成测试和本地基准运行的干扰。数据集采用Creative Commons Attribution 4.0国际许可证分发,强调对原始版权与引用的尊重,同时通过GitHub托管实现了资源的快速、可靠获取。
使用方法
使用者可通过FluidAudio命令行工具自动调用该镜像,执行`swift run fluidaudiocli diarization-benchmark --auto-download`命令,该命令优先从本镜像下载数据,仅在镜像不可用时回退至爱丁堡大学官方服务器。此外,用户亦可直接下载压缩包与音频文件,解压后将标注目录与WAV文件配对,用于自定义的说话人日志化模型训练或评估流程。引用该数据集时,需依照规范引用Carletta等人的AMI会议语料库相关论文。
背景与挑战
背景概述
AMI会议语料库(AMI Meeting Corpus)由爱丁堡大学等机构的研究人员于2005年创建,旨在推动多模态会议场景下的语音与交互分析研究。该数据集专注于真实会议环境中的说话人识别、语音分割等核心问题,为自然语言处理和音频分析领域提供了标准化基准。其发布以来,在说话人日志(speaker diarization)任务中影响深远,成为评估算法性能的权威参考。本镜像版本由FluidAudio团队维护,确保基准测试的稳定性与可重复性,进一步巩固了其在学术与工业界的地位。
当前挑战
该数据集当前面临多方面的挑战。首先,在领域问题层面,会议场景中的重叠语音、噪声干扰及多人交互复杂性,使得说话人日志任务难以实现高精度。其次,构建过程中,原始数据依赖爱丁堡服务器的可用性,导致访问不稳定;镜像版本虽缓解此问题,但需确保版本一致性。此外,标注信息的更新与维护面临挑战,如不同版本间的格式兼容性,以及应对日益增长的高质量训练数据需求,均需持续投入资源以保持基准的时效性。
常用场景
经典使用场景
AMI会议语料库(AMI Meeting Corpus)是语音处理与多模态交互研究领域的一座里程碑式资源,专注于记录真实会议场景中的多说话人对话。该数据集最经典的使用场景在于说话人日志(Speaker Diarization)任务,即自动识别音频中“谁在何时说话”。研究者可基于其提供的头戴式麦克风单通道音频(SDM)与精细的人工标注,系统性地评估和优化聚类算法、嵌入提取模型,以解决多说话人重叠、声纹切换等复杂问题,推动会议场景下语音结构化理解的发展。
衍生相关工作
围绕AMI语料库,众多经典工作应运而生。例如,FluidAudio等开源框架将其作为说话人日志基准的核心组件,通过集成多个最先进的嵌入模型(如ECAPA-TDNN)和聚类算法,形成可复现的评测流水线。此外,该数据集催生了针对会议场景的语音活动检测、关键词检索及情感分析等延伸任务,推动了端到端说话人日志模型(如EEND)的发展,其原始文献——Carletta等人的2005年论文——至今仍是该领域引用量最高的奠基性成果之一。
数据集最近研究
最新研究方向
AMI语料库镜像为说话人日志(Speaker Diarization)领域提供了稳定可靠的基准测试数据源,解决了上游服务器不稳定导致的评估可重复性难题。当前研究前沿聚焦于基于深度学习的端到端说话人日志模型,例如结合Transformer架构与注意力机制的声纹分割聚类方法,以及利用自监督预训练技术减少对人工标注依赖的创新范式。该镜像通过标准化SDM(单麦克风)音频子集与官方标注,促进了FluidAudio等开源工具在会议场景下的公平比较,进而推动语义理解与多模态融合的交叉研究。其CC-BY-4.0许可协议助力学术社区构建更开放的评测生态,为智能会议系统在真实环境中的鲁棒性验证提供了关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务