遇见数据集

tiiuae/visper

收藏
Hugging Face2025-04-17 更新2024-06-12 收录
官方服务:

资源简介:

--- license: cc-by-nc-2.0 language: - ar - fr - es - zh pretty_name: visper --- # ViSpeR: Multilingual Audio-Visual Speech Recognition This repository contains **ViSpeR**, a large-scale dataset and models for Visual Speech Recognition for Arabic, Chinese, French, Arabic and Spanish. ## Dataset Summary: Given the scarcity of publicly available VSR data for non-English languages, we collected VSR data for the most four spoken languages at scale. Comparison of VSR datasets. Our proposed ViSpeR dataset is larger in size compared to other datasets that cover non-English languages for the VSR task. For our dataset, the numbers in parenthesis denote the number of clips. We also give the clip coverage under TedX and Wild subsets of our ViSpeR dataset. | Dataset | French (fr) | Spanish (es) | Arabic (ar) | Chinese (zh) | |-----------------|-----------------|-----------------|-----------------|-----------------| | **MuAVIC** | 176 | 178 | 16 | -- | | **VoxCeleb2** | 124 | 42 | -- | -- | | **AVSpeech** | 122 | 270 | -- | -- | | **ViSpeR (TedX)** | 192 (160k) | 207 (151k) | 49 (48k) | 129 (143k) | | **ViSpeR (Wild)** | 680 (481k) | 587 (383k) | 1152 (1.01M) | 658 (593k) | | **ViSpeR (full)** | 872 (641k) | 794 (534k) | 1200 (1.06M) | 787 (736k) | ## Downloading the data: First, use the provided video lists to download the videos and put them in seperate folders. The raw data should be structured as follows: ```bash Data/ ├── Chinese/ │ ├── video_id.mp4 │ └── ... ├── Arabic/ │ ├── video_id.mp4 │ └── ... ├── French/ │ ├── video_id.mp4 │ └── ... ├── Spanish/ │ ├── video_id.mp4 │ └── ... ``` ## Processing the data: Please refer to our for further details [visper github](https://github.com/YasserdahouML/visper) ## Intended Use This dataset can be used to train models for visual speech recognition. It's particularly useful for research and development purposes in the field of audio-visual content processing. The data can be used to assess the performance of current and future models. ## Limitations and Biases Due to the data collection process focusing on YouTube, biases inherent to the platform may be present in the dataset. Also, while measures are taken to ensure diversity in content, the dataset might still be skewed towards certain types of content due to the filtering process. ## ViSpeR paper coming soon ## Check our VSR related works ```bash @inproceedings{djilali2023lip2vec, title={Lip2Vec: Efficient and Robust Visual Speech Recognition via Latent-to-Latent Visual to Audio Representation Mapping}, author={Djilali, Yasser Abdelaziz Dahou and Narayan, Sanath and Boussaid, Haithem and Almazrouei, Ebtessam and Debbah, Merouane}, booktitle={Proceedings of the IEEE/CVF International Conference on Computer Vision}, pages={13790--13801}, year={2023} } @inproceedings{djilali2024vsr, title={Do VSR Models Generalize Beyond LRS3?}, author={Djilali, Yasser Abdelaziz Dahou and Narayan, Sanath and LeBihan, Eustache and Boussaid, Haithem and Almazrouei, Ebtesam and Debbah, Merouane}, booktitle={Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision}, pages={6635--6644}, year={2024} } ```

--- 许可证:CC BY-NC 2.0 语言: - 阿拉伯语(ar) - 法语(fr) - 西班牙语(es) - 中文(zh) 展示名称:ViSpeR --- # ViSpeR:多语言音视觉语音识别 本仓库包含**ViSpeR**,一款面向阿拉伯语、中文、法语、西班牙语的大规模视觉语音识别(Visual Speech Recognition, VSR)数据集与模型。 ## 数据集概述: 鉴于非英语语言的公开可用VSR数据集较为稀缺,我们针对全球使用人数最多的四种口语语言规模化收集了VSR数据。 ### VSR数据集对比 本研究提出的ViSpeR数据集,相较于其他面向非英语语言的VSR任务数据集,规模更为庞大。本数据集括号内的数字代表视频片段(clip)的数量,同时我们还给出了ViSpeR数据集在TedX与Wild子集下的片段覆盖情况。 | 数据集 | 法语(fr) | 西班牙语(es) | 阿拉伯语(ar) | 中文(zh) | |-----------------|-----------------|-----------------|-----------------|-----------------| | **MuAVIC** | 176 | 178 | 16 | -- | | **VoxCeleb2** | 124 | 42 | -- | -- | | **AVSpeech** | 122 | 270 | -- | -- | | **ViSpeR(TedX子集)** | 192(160k) | 207(151k) | 49(48k) | 129(143k) | | **ViSpeR(Wild子集)** | 680(481k) | 587(383k) | 1152(1.01M) | 658(593k) | | **ViSpeR(全量数据集)** | 872(641k) | 794(534k) | 1200(1.06M) | 787(736k) | ## 数据下载: 首先,使用提供的视频列表下载视频,并将其放置于独立文件夹中。原始数据应按照如下结构组织: bash Data/ ├── Chinese/ │ ├── video_id.mp4 │ └── ... ├── Arabic/ │ ├── video_id.mp4 │ └── ... ├── French/ │ ├── video_id.mp4 │ └── ... ├── Spanish/ │ ├── video_id.mp4 │ └── ... ## 数据处理: 如需了解更多细节,请参阅我们的[ViSpeR GitHub仓库](https://github.com/YasserdahouML/visper)。 ## 预期用途 本数据集可用于训练视觉语音识别模型,尤其适用于音视觉内容处理领域的研究与开发工作,同时可用于评估当前及未来模型的性能表现。 ## 局限性与偏差 由于数据采集过程聚焦于YouTube平台,该数据集可能存在该平台固有的偏差。此外,尽管我们已采取措施确保内容多样性,但受筛选流程影响,数据集仍可能偏向某些特定类型的内容。 ## ViSpeR相关论文即将发布 ## 查阅我们的VSR相关研究成果 bibtex @inproceedings{djilali2023lip2vec, title={Lip2Vec: Efficient and Robust Visual Speech Recognition via Latent-to-Latent Visual to Audio Representation Mapping}, author={Djilali, Yasser Abdelaziz Dahou and Narayan, Sanath and Boussaid, Haithem and Almazrouei, Ebtessam and Debbah, Merouane}, booktitle={Proceedings of the IEEE/CVF International Conference on Computer Vision}, pages={13790--13801}, year={2023} } @inproceedings{djilali2024vsr, title={Do VSR Models Generalize Beyond LRS3?}, author={Djilali, Yasser Abdelaziz Dahou and Narayan, Sanath and LeBihan, Eustache and Boussaid, Haithem and Almazrouei, Ebtesam and Debbah, Merouane}, booktitle={Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision}, pages={6635--6644}, year={2024} }

提供机构:
tiiuae
原始信息汇总

ViSpeR: Multilingual Audio-Visual Speech Recognition

数据集概述

ViSpeR是一个大规模的多语言视听语音识别数据集,涵盖阿拉伯语、中文、法语和西班牙语。由于非英语语言的视听语音识别(VSR)数据稀缺,我们收集了这四种最常用语言的大规模VSR数据。

数据集比较

ViSpeR数据集在覆盖非英语语言的VSR任务方面,规模大于其他数据集。数据集中的数字表示片段数量。ViSpeR数据集分为TedX、Wild和完整三个子集。

数据集 法语 (fr) 西班牙语 (es) 阿拉伯语 (ar) 中文 (zh)
MuAVIC 176 178 16 --
VoxCeleb2 124 42 -- --
AVSpeech 122 270 -- --
ViSpeR (TedX) 192 (160k) 207 (151k) 49 (48k) 129 (143k)
ViSpeR (Wild) 680 (481k) 587 (383k) 1152 (1.01M) 658 (593k)
ViSpeR (full) 872 (641k) 794 (534k) 1200 (1.06M) 787 (736k)

数据下载

使用提供的视频列表下载视频,并将它们分别放入不同的文件夹中。原始数据应按以下结构组织:

bash Data/ ├── Chinese/ │ ├── video_id.mp4 │ └── ... ├── Arabic/ │ ├── video_id.mp4 │ └── ... ├── French/ │ ├── video_id.mp4 │ └── ... ├── Spanish/ │ ├── video_id.mp4 │ └── ...

数据处理

请参考我们的visper github以获取更多详细信息。

预期用途

该数据集可用于训练视听语音识别模型,特别适用于音频-视觉内容处理领域的研究和开发。数据可用于评估当前和未来模型的性能。

局限性和偏见

由于数据收集过程集中在YouTube上,数据集中可能存在平台固有的偏见。此外,尽管采取了措施确保内容的多样性,但由于筛选过程,数据集可能仍偏向于某些类型的内容。

搜集汇总
数据集介绍
构建方式
视觉语音识别(Visual Speech Recognition, VSR)领域长期面临非英语语言数据稀缺的瓶颈。为填补这一空白,ViSpeR数据集应运而生,其构建过程以大规模、多语言为核心导向。研究团队从YouTube平台广泛采集阿拉伯语、汉语、法语及西班牙语四种语言的视频内容,并依据来源将数据划分为TedX与Wild两个子集。TedX子集聚焦于结构化演讲场景,而Wild子集则涵盖更为多样化的自然语境。通过系统化的视频列表索引与下载流程,原始视频被整理为按语言分列的文件夹结构,每一视频文件均以独立ID命名,最终形成包含超过290万条视频片段的大规模资源库,显著超越了现有非英语VSR数据集的规模。
特点
ViSpeR数据集的核心特色在于其规模与多语言覆盖的深度。与MuAVIC、VoxCeleb2及AVSpeech等现有数据集相比,ViSpeR在法语、西班牙语、阿拉伯语及汉语上均提供了更丰富的视频片段数量,其中阿拉伯语子集包含约1200小时视频(逾106万条片段),汉语子集亦达787小时。这一体量优势使得模型训练能够获得更充分的视觉语音特征学习。此外,数据集的双子集设计——TedX与Wild——分别模拟了受控演讲环境与真实世界多变场景,为评估模型的泛化能力提供了天然基准。这种结构不仅支持跨语言研究,还允许研究者深入探索不同语境下视觉语音识别的鲁棒性。
使用方法
ViSpeR数据集专为视觉语音识别模型的训练与评估而设计,尤其适用于多语言音频-视觉内容处理研究。使用者需首先从提供的视频列表中下载原始视频,并按语言(如Arabic/、Chinese/等)分类存入独立文件夹。随后,可参照配套的GitHub仓库(visper)中的处理流程,对视频进行面部区域裁剪、音频对齐等预处理操作,以生成适用于VSR模型的标准输入格式。该数据集兼容现有的深度学习框架,研究者可直接将其用于训练唇读模型,或评估模型在跨语言、跨场景任务中的表现。需注意,数据集基于YouTube内容构建,可能隐含平台固有的内容偏差,使用者应在分析结果时审慎考虑这一局限性。
背景与挑战
背景概述
视觉语音识别(Visual Speech Recognition, VSR)作为多模态学习领域的前沿方向,旨在通过分析说话者的唇部运动等视觉线索来解码语音内容,对于嘈杂环境下的语音交互、听力辅助及安全验证等场景具有重要价值。然而,现有VSR数据集多集中于英语,非英语语言的资源极度匮乏,严重制约了该技术的全球化推广与跨语言泛化能力。在此背景下,由Yasser Abdelaziz Dahou Djilali等研究人员领衔,联合多个国际机构于2024年创建的ViSpeR数据集应运而生。该数据集覆盖阿拉伯语、中文、法语及西班牙语四种全球使用广泛的语言,总时长超过3600小时,包含约290万个视频片段,其规模远超MuAVIC、VoxCeleb2等现有非英语VSR数据集。ViSpeR的发布不仅填补了非英语VSR大规模数据集的空白,更为多语言视觉语音识别模型的训练与评估提供了坚实基准,显著推动了该领域向多语言、高鲁棒性方向的发展。
当前挑战
ViSpeR数据集所面临的挑战首先体现在领域问题的复杂性上:视觉语音识别本身需克服唇部运动模糊、光照变化、视角差异及说话人面部遮挡等视觉干扰,同时还需应对不同语言间发音口型差异大、音素-视位映射关系不统一等跨语言难题,这使得模型在单一语言上的高精度尚难以直接迁移至多语言场景。其次,在数据集构建过程中,研究人员遭遇了多重技术瓶颈:从YouTube等开放平台海量视频中自动筛选高质量唇部区域样本时,需平衡数据规模与标注噪声,尤其是阿拉伯语和中文等语料稀缺性导致的数据不均衡问题尤为突出;此外,视频下载、人脸检测、唇部裁剪及音视频同步等流水线处理环节存在累积误差,加之平台内容偏见可能引入特定口音或语体风格的偏向性,均对数据集的纯净度与代表性构成挑战。这些挑战不仅考验数据采集与清洗策略的鲁棒性,也要求后续模型设计具备更强的跨域适应与抗噪能力。
常用场景
经典使用场景
在视觉语音识别(VSR)这一前沿交叉领域中,ViSpeR数据集以其多语种、大规模的特性,成为训练和评估跨语言唇读模型的核心资源。研究者可借助其涵盖阿拉伯语、中文、法语和西班牙语的高质量视频片段,构建能够从无声面部运动序列中精准解码语音内容的深度学习架构。该数据集尤其适用于探索视觉模态在嘈杂环境或静音场景下的替代性语音理解路径,为多模态感知系统的鲁棒性提升提供了关键实验平台。
解决学术问题
ViSpeR数据集有效缓解了非英语语言VSR研究长期面临的数据匮乏困境,填补了阿拉伯语、中文等语种在视觉语音资源上的显著空白。通过提供超过300万条带有标注的视频片段,它使学界能够系统性地研究跨语言视觉语音表征的共性与差异,推动对唇读模型泛化能力的深入评估。该数据集的发布促进了多语种VSR基准测试的建立,为探究语言特异性视觉特征与语音识别性能之间的关联机制奠定了数据基础。
衍生相关工作
基于ViSpeR数据集,研究者已衍生出Lip2Vec等代表性工作,通过潜在空间映射实现视觉到音频表征的高效转换,显著提升了跨模态语音识别的计算效率。后续的VSR泛化性研究进一步利用该数据集检验了模型在非LRS3语料上的迁移能力,揭示了现有视觉语音识别架构在面对多语种、多场景数据时的性能边界。这些工作共同推动了视觉语音识别从单一语种向多语种通用框架的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务