遇见数据集

Balti-Tamko 02: Continuous speech dataset for Balti ASR.

收藏
Zenodo2025-06-12 更新2026-05-26 收录
官方服务:

资源简介:

Balti Continuous Speech Dataset OverviewThe Balti Continuous Speech Dataset comprises read speech recordings from 118 native Balti speakers (balanced gender representation) collected across the valleys of Baltistan in northern Pakistan. This corpus is designed to support automatic speech recognition (ASR) research and language preservation efforts for the endangered Balti language. Key Specifications Volume: 1.4 GB Duration: 4.43 hours Samples: 5,074 audio files (16-bit PCM WAV format, 44.1 kHz) Annotation: Parallel transcriptions in Perso-Arabic script, with ongoing expansion to include Yige (Tibetan script) to capture phonetic nuances and support cross-script ASR development. Data Structure Original Split: 80% training, 20% evaluation (held-out) Proposed Refinement: 80% training, 10% development (validation), 10% test File Format: Audio: .wav (librosa-compatible) Transcripts: .tsv (tab-separated) with S.No and Balti Sentence fields Validation & Quality Control All utterances were verified by native Balti linguists to ensure phonetic and lexical accuracy. Sentences were designed to cover 50 distinct linguistic patterns, balancing lexical diversity and ASR utility. Unique Value Proposition Cultural Preservation: First open corpus to pair Perso-Arabic and Yige (Tibetan) transcriptions, bridging modern and historical Balti orthographies. Research-Ready: Pre-structured for ASR pipelines (train/dev/test splits) with clear metadata. Low-Resource Focus: Addresses the scarcity of publicly available Balti speech data. Potential Applications Multilingual ASR for endangered languages Cross-script speech recognition (Perso-Arabic ↔ Yige) Phonetic studies of Tibetan-origin languages Ethical Compliance Speaker consent documented for research use Anonymized metadata (no PII retained)

提供机构:
Zenodo
创建时间:
2025-06-12
二维码
社区交流群
二维码
科研交流群
商业服务