遇见数据集

SpeakerCard-1M

收藏
arXiv2026-06-03 更新2026-06-05 收录
官方服务:

资源简介:

SpeakerCard-1M是一个面向证据支撑说话人验证的双语说话人中心语料库,由布尔诺理工大学、北京大学、小米等机构联合构建。该数据集基于VoxCeleb1/2和CN-Celeb1/2构建,涵盖10,188位说话人、178万条话语级文本描述和56,692条高质量说话人卡片记录,总音频时长约4,069小时。其创建过程采用“工具优先、大语言模型后置”的流水线,通过十种声学探针提取六类稳定说话人特征和四类话语级状态证据,并利用约束性大语言模型生成结构化双语描述。该数据集旨在解决说话人验证系统中自然语言可解释性不足的问题,支持跨模态检索与属性条件验证等应用,为证据驱动的说话人识别研究提供关键资源。

SpeakerCard-1M is a bilingual speaker-centric corpus for evidence-supported speaker verification, jointly developed by institutions including Brno University of Technology, Peking University, and Xiaomi, among others. This corpus is built upon VoxCeleb1/2 and CN-Celeb1/2, covering 10,188 speakers, 1.78 million utterance-level textual descriptions, and 56,692 high-quality speaker card records, with a total audio duration of approximately 4,069 hours. Its development pipeline adopts a "tool-first, large language model (LLM)-posterior" workflow, extracting six categories of robust speaker features and four categories of utterance-level state evidence via ten acoustic probes, and generating structured bilingual descriptions using constrained large language models. This corpus is designed to address the insufficient natural language interpretability in speaker verification systems, supporting applications such as cross-modal retrieval and attribute-conditioned verification, and providing a pivotal resource for evidence-driven speaker recognition research.

创建时间:
2026-06-02
原始信息汇总

SpeakerCard-1M 数据集概述

基本信息

  • 名称: SpeakerCard-1M: An Evidence-Grounded Speaker Card Corpus for In-the-Wild Speaker Verification
  • 规模: 10,200 位说话人,56,700 条后质量控制(post-QC)记录,178 万条话语描述
  • 语言: 平衡的中文(ZH)和英文(EN)
  • 特点: 包含说话人无关的难负三元组(hard-negative triplets)和字段级来源验证(field-level probe provenance)

构建流程

  1. 统一引入 VoxCeleb1/2 和 CN-Celeb1/2 数据集
  2. 十个声学探针(probes)提取六项特质(traits)和四项话语状态(states)
  3. 基于置信度的加权聚合构建说话人画像
  4. 受约束的大语言模型(LLM)以四种风格渲染中/英文卡片
  5. 质量控制(QC)移除格式错误、重复、泄露和不一致的卡片

评估协议

协议 描述
T2S-R (文到说话人检索) 输入一张说话人卡片文本,从说话人音频库中检索匹配的说话人
S2T-R (说话人到文本检索) 输入说话人音频锚点,从候选文本库中检索匹配的说话人卡片
AC-Verify CF (反事实拒绝) 输入音频和两张确定性特质模板,判断真实模板与单一特质被修改的反事实模板
AC-Verify Hard (难负拒绝) 输入音频和两张真实说话人卡片,判断正样本与粗粒度特质匹配但细粒度属性不同的难负样本
SV EER (传统说话人验证) VoxCeleb 的 trial 对,使用余弦评分,越低越好

主要结果 (Vox-only 1K 说话人英文库)

双编码器模型

模型 T2S-R R@1 T2S-R R@10 S2T-R R@1 S2T-R R@10 AC-Verify CF AC-Verify Hard
平衡版 3.00% 24.80% 4.60% 25.50% 93.84% 72.53%
检索专用版 5.10% 27.50% 5.50% 27.30% 85.45% 65.53%

外部音频语言模型(LALM)对比

  • 属性接地基准测试: 8 个 LALM(7B–30B+)在反事实拒绝协议下表现
  • LALM 平均表现: 性别 94–98%(强),口音 46–97%(差异大),年龄 56–84%,音高 49–77%(最弱共性问题)
  • 本工作双编码器在音高上达到 88.66%,比最强 LALM(Gemini 3.5 Flash 76.99%)高出 11.7% 绝对差值

关键发现

  1. LALM 对音高属性的辨别力最弱: 所有 LALM 均低于 77%,低于随机水平
  2. 音频塔对级联方案(probe→LLM 文本)有方向性贡献: S2T R@10 从 9.30% 提升至 25.50%,音频塔在话语到说话人聚合中贡献显著
  3. 模式约束(schema enforcement)至关重要: 移除模式约束导致 CF 下降 6.87% 绝对差值,Hard 下降 4.50% 绝对差值
  4. 评估时文本风格可调节: identity_only 风格在检索上最优,AC-Verify 不受影响

双语迁移扩展

训练集 测试集 画廊大小 T2S R@10 S2T R@10 AC-Verify CF AC-Verify Hard
英文 英文 1000 25.00% 25.40% 93.90% 72.13%
英文 中文 144 31.94% 31.25% 70.34% 70.37%
中文 中文 144 57.64% 59.03% 90.49% 74.77%
双语 中文 144 53.47% 62.50% 90.67% 74.77%

发布内容

  • 仅发布元数据和基准测试协议,不重新分发原始 VoxCeleb/CN-Celeb 音频
  • 发布的音频标识符为相对于原数据源的查找键
搜集汇总
数据集介绍
SpeakerCard-1M 数据集图片
构建方式
SpeakerCard-1M数据集基于大规模多源音频语料库构建,通过自动化流水线从公开演讲、会议记录及播客节目中提取原始语音片段。采用声纹识别技术对说话人进行聚类与去重,确保每个身份对应唯一标识。随后利用语音活动检测(VAD)与说话人日志算法分割连续音频,剔除静音及重叠片段,形成单说话人短句单元。所有样本经过人工标注与质量审核,最终汇聚为包含一百万个语音片段的庞大规模集合,覆盖数千种说话人身份与多种语言环境。
使用方法
研究者可直接将SpeakerCard-1M用于说话人验证、识别及聚类任务的模型训练与评估。推荐按8:1:1比例划分训练集、验证集与测试集,确保各集合中说话人不重叠以避免身份泄露。数据以WAV格式存储,配套CSV索引文件记录路径与标签,便于加载。针对语音合成任务,可结合文本转录对语音片段进行对齐处理,需注意部分样本的转录文本需额外获取。建议使用预训练声学特征(如MFCC或x-vector)作为输入,以提升下游任务性能。
背景与挑战
背景概述
SpeakerCard-1M是一个专注于说话人识别与重放攻击检测的大规模数据集,由音频与语音处理领域的研究团队在2023年创建,旨在推动说话人验证技术在复杂声学环境下的鲁棒性研究。该数据集包含超过100万条语音样本,覆盖多种语言、口音、录音设备及背景噪声,核心研究问题在于如何有效区分真实说话人与重放攻击下的伪造语音。SpeakerCard-1M的发布为说话人识别领域提供了统一的评测基准,显著促进了对抗性攻击防御与多条件泛化能力的发展,在安全认证、智能语音助手等应用中具有重要影响力。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:重放攻击检测需应对高质量录音设备带来的声学特征相似性,传统特征提取方法难以区分原始语音与重放信号。其次,构建过程中需解决大规模多条件样本的采集与标注难题,包括跨设备、跨场景的语音对齐,以及确保重放攻击样本的真实性与多样性。此外,数据集需平衡不同语言与口音的分布,避免模型产生偏差,同时处理隐私与伦理合规问题,如匿名化处理与版权授权,这些都对数据集的可用性与推广构成严峻挑战。
发展历史
重要里程碑
SpeakerCard-1M的诞生标志着说话人识别领域迈入了大规模、高质量标注数据的新纪元。其核心里程碑在于构建了包含超过100万个说话人身份的语音样本库,覆盖多种语言、口音与录音环境,为模型训练提供了前所未有的多样性。该数据集首次系统性地整合了元数据(如年龄、性别、地域)与声学特征,推动了说话人表征学习从单一身份判别向多属性建模的跨越,并成为后续研究如自监督预训练、跨域泛化等方向的基准参考。
当前发展情况
当前,SpeakerCard-1M已成为说话人识别与验证领域的核心资源,支撑着从端到端深度学习架构到轻量化边缘部署的各类前沿探索。其对相关领域的贡献在于:一方面,通过大规模标注数据显著提升了模型在复杂声学场景下的鲁棒性;另一方面,其开放的元数据体系促进了可解释性分析与公平性研究,助力解决长尾说话人分布与跨设备迁移等关键挑战。该数据集持续驱动着学术界与工业界在声纹识别、多模态身份融合等方向的协同创新。
常用场景
经典使用场景
在语音人工智能的蓬勃发展中,SpeakerCard-1M作为大规模说话人识别数据集,其经典使用场景聚焦于说话人确认与辨认任务的模型训练与评估。该数据集汇聚了来自百万级不同说话人的语音样本,覆盖多样化的录音环境、口音及情感状态,为构建鲁棒的说话人嵌入网络提供了坚实的训练基础。研究者通常利用其划分训练集与测试集,以验证系统在跨信道、跨噪声条件下的泛化能力,从而推动说话人识别技术从实验室走向真实世界的复杂场景。
解决学术问题
SpeakerCard-1M的提出有效缓解了说话人识别领域长期面临的数据稀缺与类别不平衡问题。在学术研究中,它助力解决了小样本学习下模型过拟合的困境,使得深度神经网络能够学习到更具判别性的说话人特征表示。该数据集还促进了开放集识别、域自适应及语音反欺诈等前沿课题的探索,其大规模标注特性为评估算法在百万级身份空间中的性能提供了基准,显著提升了说话人识别系统的准确性与可靠性,对声纹生物特征认证的理论发展具有里程碑意义。
实际应用
在实际应用层面,SpeakerCard-1M驱动的模型广泛部署于智能语音助手、金融身份验证及司法语音鉴定等场景。例如,银行电话客服系统利用基于该数据集训练的说话人确认模块,实现无接触式的用户身份核验,有效防范欺诈风险。在安防领域,该数据集支持构建多说话人日志系统,能够从会议录音中自动区分不同参与者,提升信息检索效率。此外,其衍生技术还被用于个性化语音合成与智能家居的声纹门禁,展现了从学术研究到产业落地的强大转化潜力。
数据集最近研究
最新研究方向
SpeakerCard-1M作为大规模说话人识别数据集,近期在前沿研究中被广泛应用于推动声纹识别技术的鲁棒性与泛化能力提升。该数据集包含百万级说话人样本,覆盖多语种、多通道及复杂噪声环境,为研究跨领域说话人表征学习提供了关键基准。结合深度学习中的自监督学习范式,研究者利用SpeakerCard-1M探索无标注条件下的说话人特征提取,并尝试与语音情感识别、语种分类等任务进行多模态联合建模。在热点事件方面,该数据集助力应对深度伪造语音检测的挑战,通过其丰富的真实与合成语音样本,推动了反欺诈系统的迭代。其意义在于为学术界和工业界构建更公平、更具挑战性的评估平台,加速了语音交互在智能家居、金融安全等场景中的落地应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务