SpeakerCard-1M
收藏资源简介:
SpeakerCard-1M是一个面向证据支撑说话人验证的双语说话人中心语料库,由布尔诺理工大学、北京大学、小米等机构联合构建。该数据集基于VoxCeleb1/2和CN-Celeb1/2构建,涵盖10,188位说话人、178万条话语级文本描述和56,692条高质量说话人卡片记录,总音频时长约4,069小时。其创建过程采用“工具优先、大语言模型后置”的流水线,通过十种声学探针提取六类稳定说话人特征和四类话语级状态证据,并利用约束性大语言模型生成结构化双语描述。该数据集旨在解决说话人验证系统中自然语言可解释性不足的问题,支持跨模态检索与属性条件验证等应用,为证据驱动的说话人识别研究提供关键资源。
SpeakerCard-1M is a bilingual speaker-centric corpus for evidence-supported speaker verification, jointly developed by institutions including Brno University of Technology, Peking University, and Xiaomi, among others. This corpus is built upon VoxCeleb1/2 and CN-Celeb1/2, covering 10,188 speakers, 1.78 million utterance-level textual descriptions, and 56,692 high-quality speaker card records, with a total audio duration of approximately 4,069 hours. Its development pipeline adopts a "tool-first, large language model (LLM)-posterior" workflow, extracting six categories of robust speaker features and four categories of utterance-level state evidence via ten acoustic probes, and generating structured bilingual descriptions using constrained large language models. This corpus is designed to address the insufficient natural language interpretability in speaker verification systems, supporting applications such as cross-modal retrieval and attribute-conditioned verification, and providing a pivotal resource for evidence-driven speaker recognition research.
SpeakerCard-1M 数据集概述
基本信息
- 名称: SpeakerCard-1M: An Evidence-Grounded Speaker Card Corpus for In-the-Wild Speaker Verification
- 规模: 10,200 位说话人,56,700 条后质量控制(post-QC)记录,178 万条话语描述
- 语言: 平衡的中文(ZH)和英文(EN)
- 特点: 包含说话人无关的难负三元组(hard-negative triplets)和字段级来源验证(field-level probe provenance)
构建流程
- 统一引入 VoxCeleb1/2 和 CN-Celeb1/2 数据集
- 十个声学探针(probes)提取六项特质(traits)和四项话语状态(states)
- 基于置信度的加权聚合构建说话人画像
- 受约束的大语言模型(LLM)以四种风格渲染中/英文卡片
- 质量控制(QC)移除格式错误、重复、泄露和不一致的卡片
评估协议
| 协议 | 描述 |
|---|---|
| T2S-R (文到说话人检索) | 输入一张说话人卡片文本,从说话人音频库中检索匹配的说话人 |
| S2T-R (说话人到文本检索) | 输入说话人音频锚点,从候选文本库中检索匹配的说话人卡片 |
| AC-Verify CF (反事实拒绝) | 输入音频和两张确定性特质模板,判断真实模板与单一特质被修改的反事实模板 |
| AC-Verify Hard (难负拒绝) | 输入音频和两张真实说话人卡片,判断正样本与粗粒度特质匹配但细粒度属性不同的难负样本 |
| SV EER (传统说话人验证) | VoxCeleb 的 trial 对,使用余弦评分,越低越好 |
主要结果 (Vox-only 1K 说话人英文库)
双编码器模型
| 模型 | T2S-R R@1 | T2S-R R@10 | S2T-R R@1 | S2T-R R@10 | AC-Verify CF | AC-Verify Hard |
|---|---|---|---|---|---|---|
| 平衡版 | 3.00% | 24.80% | 4.60% | 25.50% | 93.84% | 72.53% |
| 检索专用版 | 5.10% | 27.50% | 5.50% | 27.30% | 85.45% | 65.53% |
外部音频语言模型(LALM)对比
- 属性接地基准测试: 8 个 LALM(7B–30B+)在反事实拒绝协议下表现
- LALM 平均表现: 性别 94–98%(强),口音 46–97%(差异大),年龄 56–84%,音高 49–77%(最弱共性问题)
- 本工作双编码器在音高上达到 88.66%,比最强 LALM(Gemini 3.5 Flash 76.99%)高出 11.7% 绝对差值
关键发现
- LALM 对音高属性的辨别力最弱: 所有 LALM 均低于 77%,低于随机水平
- 音频塔对级联方案(probe→LLM 文本)有方向性贡献: S2T R@10 从 9.30% 提升至 25.50%,音频塔在话语到说话人聚合中贡献显著
- 模式约束(schema enforcement)至关重要: 移除模式约束导致 CF 下降 6.87% 绝对差值,Hard 下降 4.50% 绝对差值
- 评估时文本风格可调节:
identity_only风格在检索上最优,AC-Verify 不受影响
双语迁移扩展
| 训练集 | 测试集 | 画廊大小 | T2S R@10 | S2T R@10 | AC-Verify CF | AC-Verify Hard |
|---|---|---|---|---|---|---|
| 英文 | 英文 | 1000 | 25.00% | 25.40% | 93.90% | 72.13% |
| 英文 | 中文 | 144 | 31.94% | 31.25% | 70.34% | 70.37% |
| 中文 | 中文 | 144 | 57.64% | 59.03% | 90.49% | 74.77% |
| 双语 | 中文 | 144 | 53.47% | 62.50% | 90.67% | 74.77% |
发布内容
- 仅发布元数据和基准测试协议,不重新分发原始 VoxCeleb/CN-Celeb 音频
- 发布的音频标识符为相对于原数据源的查找键





