MAV-Celeb
收藏资源简介:
MAV-Celeb是由林茨大学等机构联合构建的多模态说话人识别数据集,包含YouTube访谈、脱口秀等场景下的双语(英语-乌尔都语)音频-视觉样本。数据集包含4039个英语训练样本和9304个乌尔都语训练样本,每个样本均包含人脸图像(.jpg)和语音片段(.wav)的成对数据。数据通过预训练模型提取特征,并采用分层结构按模态、身份和语言组织。该数据集旨在解决多模态说话人识别中的模态缺失和跨语言泛化问题,为生物识别、媒体分析等领域提供基准支持。
MAV-Celeb is a multimodal speaker recognition dataset jointly constructed by the University of Linz and other institutions. It encompasses bilingual (English-Urdu) audio-visual samples collected from scenarios including YouTube interviews and talk shows. The dataset comprises 4039 English training samples and 9304 Urdu training samples, with each sample containing paired data of facial images (.jpg) and audio clips (.wav). Features are extracted from the dataset via pre-trained models, and the data is organized in a hierarchical structure based on modality, speaker identity and language. This dataset aims to address the issues of modality missing and cross-language generalization in multimodal speaker recognition, providing benchmark support for fields such as biometrics and media analysis.
POLYSIM 2026 Grand Challenge 数据集概述
任务描述
POLYSIM 2026挑战赛旨在解决闭集说话人分类问题,使用**音频(语音)和视觉(面部)**两种模态。目标是在以下现实挑战下,从给定样本中分类说话人的身份:
- 测试时一种模态(面部)可能完全缺失
- 测试语言可能不同于训练语言
- 所有条件下必须使用单一统一模型
参赛者需要设计鲁棒、模态无关且跨语言的模型。
任务设置
挑战赛包含四种任务设置,涵盖多模态、缺失模态和跨语言场景。
P3:同语言多模态
- 训练:音频 + 面部
- 测试:音频 + 面部
- 语言:相同
- 描述:标准多模态说话人分类设置。
P4:缺失模态(仅音频)
- 训练:音频 + 面部
- 测试:仅音频
- 语言:相同
- 描述:测试时面部模态完全缺失。不允许重新训练。
P5:跨语言多模态
- 训练:音频 + 面部
- 测试:音频 + 面部
- 语言:不同
- 描述:在模态完全可用的情况下评估跨语言泛化能力。
P6:跨语言缺失模态
- 训练:音频 + 面部
- 测试:仅音频
- 语言:不同
- 描述:最具挑战性的设置,结合了跨语言测试和推理时面部模态缺失。
任务设置总结
| 设置 | 训练模态 | 测试模态 | 语言 |
|---|---|---|---|
| P3 | 音频 + 面部 | 音频 + 面部 | 相同 |
| P4 | 音频 + 面部 | 仅音频 | 相同 |
| P5 | 音频 + 面部 | 音频 + 面部 | 跨语言 |
| P6 | 音频 + 面部 | 仅音频 | 跨语言 |
数据集
概述
数据集MavCeleb包含从多个说话人在多种语言下收集的配对语音音频和面部图像/视频帧。
模态
- 音频:语音片段
- 视觉:面部图像或面部轨迹
- 标签:说话人ID
数据划分
- 训练集 - 原始数据,特征
- 开发集(标签隐藏)
- 测试集(标签隐藏)
缺失模态设置
- 缺失模态仅发生在测试时
- 缺失模态是明确且完全的(面部缺失)
- 训练数据始终包含两种模态
评估协议
评估目标在于研究:
- 多模态说话人分类性能
- 对面部模态缺失的鲁棒性
- 在未见语言上的泛化能力
指标
- 准确率
排名
- 指标为P3、P4、P5和P6分别计算
- 最终排名基于所有设置下的平均分数
提交要求
参赛者必须提交一个ZIP压缩包,其中包含CSV文件,每种语言对一个文件。压缩包内的文件必须按以下方式命名:
- submission_v1_<phase>_English_English.csv
- submission_v1_<phase>_English_Urdu.csv
其中<phase>为val(开发集)或test(评估集)。
参考基线
相关资源链接
- 挑战赛网页:https://mmosc.github.io/fame2027.github.io/index.html#home
- 评估计划:https://arxiv.org/abs/2603.24569

- 1POLY-SIM: Polyglot Speaker Identification with Missing Modality Grand Challenge 2026 Evaluation Plan林茨大学·计算感知研究所; 密歇根大学弗林特分校; 罗马大学; 穆罕默德·本·扎耶德人工智能大学; Fortemedia新加坡公司; IT:U跨学科转型大学奥地利分校; 奥格斯堡大学; 林茨理工大学·以人为中心的人工智能组 · 2026年



