遇见数据集

SLT 2026 SmartGlasses Challenge Dataset

收藏
arXiv2026-08-12 更新2026-08-14 收录
官方服务:

资源简介:

SLT 2026 SmartGlasses Challenge数据集是由西北工业大学等多所机构联合构建的面向智能眼镜的第一人称多说话人语音处理基准。该数据集包含714个真实场景会话,总时长106.98小时,涵盖双人对话和多人会议两大场景,采用四通道MEMS麦克风阵列录制。数据通过“大纲引导自发言语”协议采集,辅以LLM辅助生成对话大纲,确保自然性与语义复杂度,并经过人工标注与两轮交叉验证。数据集旨在评估带时间戳的说话人属性语音识别(TSA-ASR)和口语理解(SLU)任务,特别是在高重叠率、长上下文和动态声学环境下的表现,弥补了现有基准在可穿戴设备场景下的不足。

The SLT 2026 SmartGlasses Challenge Dataset is a first-person multi-speaker speech processing benchmark for smart glasses, jointly constructed by Northwestern Polytechnical University and several other institutions. It contains 714 real-world session recordings with a total duration of 106.98 hours, covering two primary scenarios: two-person dialogues and multi-person meetings, and was recorded using a four-channel MEMS microphone array. The data was collected via the outline-guided spontaneous speech protocol, where dialogue outlines were generated with the assistance of LLMs to guarantee naturalness and semantic complexity, and underwent manual annotation and two rounds of cross-validation. This dataset aims to evaluate tasks including timestamped speaker-attributed speech recognition (TSA-ASR) and spoken language understanding (SLU), particularly performance under high speech overlap, long context, and dynamic acoustic environments, thus filling the gap of existing benchmarks in wearable device application scenarios.

创建时间:
2026-08-12
搜集汇总
数据集介绍
SLT 2026 SmartGlasses Challenge Dataset 数据集图片
构建方式
该数据集依托定制智能眼镜所搭载的四通道MEMS麦克风阵列,以16kHz采样率同步采集真实场景下的自我中心音频,覆盖居家、餐厅、商场、街道等八类日常对话场景及三类会议场景。采用“大纲引导式自发对话”协议,借助大语言模型生成涵盖说话人角色、交际目标与关键语义事件的对话大纲,引导参与者自然交流,从而在保留真实对话中打断、重叠、重复等自然现象的同时,确保录音内容具备构建问答任务所需的语义复杂度。所有语音均以TextGrid格式进行人工标注,包含化名说话人ID、时间戳与中文转写,并通过两轮交叉校验确保标注一致性。针对口语理解任务,构建了平衡声学推理、语义推理及声学-语义联合推理的三类四选一选择题,由大语言模型辅助生成初稿后经人工审核与多轮校验,以保证答案唯一性与证据一致性。数据集总计包含714个会话,时长106.98小时,覆盖88名年龄19至34岁的说话人,并按会话划分为训练、开发与测试子集。
特点
该数据集的核心特色在于其真实性与挑战性的高度融合。首先,采用可穿戴式四通道麦克风阵列固定于眼镜镜腿的离嘴采集几何结构,统一硬件配置确保性能差异源于场景与说话人构成而非设备不一致。其次,数据涵盖短时双人对话与长时多人会议两种交互形态,会话平均时长分别为5.2分钟与19分钟,说话人数3至8人不等,且语音重叠率呈现显著梯度,双人对话平均重叠率7.5%,多人会议达13.6%,最高可至45%,对说话人归属与时序对齐构成严峻考验。再次,数据集首次在统一基准下联合评测时间戳说话人属性语音识别与口语理解,其中口语理解题目按声学、语义及联合推理1:1:1均衡分布,声学类问题要求直接从原始音频中提取副语言线索,突破文本转写所能承载的信息边界。此外,数据经过严格的隐私脱敏处理,说话人身份以化名标识,仅保留评估所需信息,兼顾研究可用性与伦理合规性。
使用方法
该数据集支持双轨任务体系,为研究人员提供差异化研究入口。在时间戳说话人属性语音识别任务中,参赛系统需输出带时间戳的分说话人转写,采用tcpCER指标(时间窗5秒)评估,侧重检验模型在重叠语音下的说话人分离与跟踪能力。在口语理解任务中,系统需回答基于会话内容设计的四选一问题,评估指标为准确率,其中涉及声学推理的题目要求模型具备超越文本的听觉理解力。数据集明确规定了系统设计约束:语音识别需采用端到端大模型范式,允许前端辅助处理;口语理解须由音频-语言模型直接消费音频或音频-文本输入,禁止仅依赖ASR转写的文本级联方案;外部数据与预训练模型限用公开开源资源,单任务可学习参数量上限为35B。该设计鼓励联合建模与多模态融合探索,同时通过统一的评估协议保障结果可比性,为自我中心多说话人语音处理研究提供了坚实的基准平台。
背景与挑战
背景概述
随着大型语言模型与多模态技术的迅猛发展,智能眼镜作为可穿戴语音交互平台展现出巨大潜力,其以自我为中心的录音视角为连续音频感知与辅助决策提供了独特机遇。然而,现有语料库与基准测试大多基于固定位置拾音设备,难以反映可穿戴场景下动态声学环境、说话人重叠及空间方位不明确所带来的复杂挑战。为此,IEEE SLT 2026智能眼镜挑战赛应运而生,由西北工业大学等多家顶尖机构联合构建,旨在系统评估自我中心多说话人语音处理技术。该数据集包含106小时的四通道真实场景语音,涵盖双人对话与多方会议两种交互模式,并联合评测时间戳说话人属性语音识别与口语理解任务,填补了该领域缺乏统一基准的空白,对推动可穿戴语音接口的发展具有里程碑意义。
当前挑战
该数据集所面临的挑战体现在多个层面。首先,在领域问题层面,自我中心多说话人场景中的动态声学条件、高度说话人重叠以及穿戴者为中心的录音几何结构,导致语音识别与理解系统难以准确进行说话人归属和时间对齐。其次,在评测任务层面,口语理解中的声学推理问题严重依赖原始音频细粒度证据,而现有音频语言模型对此类问题的处理能力显著不足。此外,在数据集构建过程中,需在保持对话自然性的同时确保语义复杂度,并兼顾注释一致性、隐私保护以及多通道数据采集的标准化,这些均构成了严峻的技术与工程双重挑战。
常用场景
经典使用场景
该数据集专为可穿戴智能眼镜设备上的自我中心多说话人语音处理而构建,涵盖双人对话和多方会议两大场景。经典的基准评测框架同时整合了带时间戳的说话人属性自动语音识别(TSA-ASR)与口语语言理解(SLU)两个子任务,通过106小时四通道真实录音和714个会话,为评估设备佩戴视角下的动态声学环境、说话人重叠和空间歧义提供了标准化的评测平台。研究社区普遍利用该数据集对端到端大模型架构、多通道信号处理策略及音频-语言模型在真实场景中的泛化能力进行系统测试,藉以明确当前技术的性能边界与待突破的关键环节。
解决学术问题
该数据集填补了自我中心多说话人语音处理领域联合评测基准的空白,解决了现有语料库(如AMI、AISHELL-4等)多采用固定位置录音、无法反映可穿戴设备移动声学特性这一学术痛点。通过统一任务设定,研究者得以系统探究TSA-ASR与SLU在真实重叠交互中的相互影响与独立瓶颈,揭示转录准确率与语义理解能力之间的非对称性。其发布有力地推动了说话人重叠下的鲁棒声学建模、长上下文音频推理以及声学-语义联合推理等核心科学问题的研究深化,为该领域树立了新的标准化评测基准。
衍生相关工作
该数据集的推出催生了多项关联性的前沿工作,在挑战赛框架下汇聚了众多参与者对端到端架构的革新尝试,如融合Whisper编码器与Qwen3解码器的MTD方案,以及基于WavLM的声学编码和Mixture-of-Experts组件的复杂语音建模。围绕多通道输入策略,研究者对比了通道平均、波束成形与引导源分离等前端处理之于整体识别性能的影响,衍生出若干针对重叠语音与资源受限部署的优化方法。此外,音频-语言模型在SLU子任务上的适应策略——从推理时增强到参数高效微调——亦成为后续探讨的活跃分支,延伸了该基准的研究广度,使其成为推动智能语音处理进步的重要开源资产。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务