LAHAJA
收藏资源简介:
LAHAJA数据集由印度理工学院马德拉斯分校的AI4Bharat团队创建,旨在评估多口音的印度语自动语音识别系统。该数据集包含12.5小时的印度语音频,来自132名说话者,覆盖了印度的83个地区。数据集的内容包括阅读和即兴演讲,涉及多个领域和使用场景。数据集的创建过程包括招募参与者、数据收集、转录和统计分析。LAHAJA数据集主要应用于语音识别技术的研究和开发,特别是在处理印度语的多口音问题上。
The LAHAJA dataset was created by the AI4Bharat team at the Indian Institute of Technology Madras, aiming to evaluate multi-accent Indian language automatic speech recognition (ASR) systems. This dataset contains 12.5 hours of Indian speech audio, sourced from 132 speakers across 83 regions in India. The content of the dataset includes both read and impromptu speeches, covering multiple domains and application scenarios. The dataset creation process encompasses participant recruitment, data collection, transcription, and statistical analysis. The LAHAJA dataset is primarily used for the research and development of speech recognition technologies, particularly for addressing the multi-accent challenges in Indian language speech recognition.
LAHAJA 数据集概述
数据集介绍
LAHAJA 是一个用于评估印度语(Hindi)自动语音识别(ASR)系统的多口音基准测试数据集。该数据集包含12.5小时的印度语音频,由来自印度83个地区的132名说话者提供,涵盖了阅读和即兴演讲等多种主题和用例。
数据集资源
数据集详情
数据集包含以下内容:
audio文件夹:包含所有语音数据。meta-data-lahaja.csv映射文件:包含转录文本及说话者详细信息。
CSV文件内容
verbatim:转录文本的逐字版本。normalized:转录文本的规范化版本。duration:音频录制时长(秒)。scenario:语音数据类型(阅读/即兴)。fname:文件名。native_language:参与者的母语。gender:性别(男/女)。age_group:参与者的年龄组。native_state:说话者的原籍州。native_district:说话者的原籍区。sp_id:唯一说话者ID。text:规范化转录文本的清洁版本(去除括号)。lang:语言ID(hi)。job_category:说话者的工作类别。occupation_domain:说话者的职业领域(教育与研究、医疗保健[医疗与制药]、政府、技术与服务、信息与媒体、金融服务[银行与保险]、运输与物流、娱乐、社会服务、制造业与零售)。occupation:说话者的职业。job_type:说话者的工作类别(兼职、全职、其他)。age-group:说话者的年龄组(18-30、30-45、45-60、60+)。qual:说话者的最高教育资格。
数据集文件结构
Lahaja ├── audio │ ├── <filename>.wav │ . │ . │ . └── meta-data-lahaja.csv

- 1LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems印度理工学院马德拉斯分校 · 2024年



