遇见数据集

VOTE400

收藏
arXiv2021-01-20 更新2024-06-21 收录
官方服务:

资源简介:

VOTE400是由电子通信研究所和MINDs Lab公司合作创建的大型韩语语音数据集,专注于老年人的语音分析和识别。该数据集包含300小时的连续对话语音和100小时的朗读语音,均由65岁以上的老年人录制。数据收集过程中,得到了韩国政府机构Ji-Won Center的支持,通过其支持的Saa-Raang-It-Gi项目收集了自发对话语音,并通过专门的语音收集系统收集了朗读语音。VOTE400旨在提升老年护理机器人的语音识别性能,解决现有商业语音识别系统在老年人语音识别上的不足。

VOTE400 is a large-scale Korean speech dataset co-created by the Electronics and Communications Research Institute and MINDs Lab, Inc., focusing on speech analysis and recognition for the elderly. The dataset contains 300 hours of continuous conversational speech and 100 hours of read speech, all recorded by seniors aged 65 and above. During the data collection process, it received support from the South Korean government agency Ji-Won Center. Spontaneous conversational speech was collected through its supported Saa-Raang-It-Gi project, while read speech was collected via a dedicated speech collection system. VOTE400 aims to improve the speech recognition performance of elderly care robots, addressing the shortcomings of existing commercial speech recognition systems in recognizing elderly speech.

创建时间:
2021-01-20
搜集汇总
数据集介绍
VOTE400 数据集图片
构建方式
在老龄化社会背景下,语音交互技术对老年关怀机器人至关重要,然而传统语音识别系统难以准确处理老年人因发音模糊、颤音和语速缓慢等特征产生的语音信号。为攻克这一难题,VOTE400数据集应运而生。其构建依托韩国独居老人支持中心(Ji-Won Center)的社区服务项目,通过社会工作者家访时的智能手机录制,收集了约300小时的自然对话语音;同时,利用平板电脑客户端引导老人朗读精心挑选的2,250条日常语句,额外采集了100小时的朗读语音。所有原始录音经过敏感信息筛查、人耳可理解性质量审核及人工转写,最终形成覆盖韩国11个地区、包含3,381名参与者的庞大数据集合。
特点
VOTE400数据集以高龄人群语音为核心,呈现出鲜明的领域专精特性。其对话语音部分平均年龄达79.47岁,女性参与者占比84%,真实反映了老年群体在自然交流中的发音变异性与方言多样性。朗读语音则采用44.1kHz高采样率录制,确保了声学细节的保真度,且最终包含7,832个独特语句,远超初始设计数量,体现了老年人在实际朗读中产生的语音变异。该数据集兼具规模性与地域代表性,涵盖首尔、釜山等主要城市及乡村地区,为研究年龄相关的声学退化规律提供了宝贵资源。
使用方法
VOTE400数据集专为学术非商业研究开放获取,旨在推动老年关怀领域的语音技术发展。研究者可直接从官方仓库(https://ai4robot.github.io/mindslab-etri-vote400)下载WAV格式的音频文件及对应转写文本。对话语音与朗读语音采用不同的文件命名规则,分别包含参与者ID、性别、年龄、区域等元数据,便于按人口统计学特征进行子集划分。初步实验表明,基于该数据集微调的LSTM声学模型在老年人语音识别准确率上显著优于商业云端引擎,尤其对特定方言区域(如全罗南道)的识别提升幅度可达20%,验证了其在领域适配中的实用价值。
背景与挑战
背景概述
随着全球人口老龄化趋势的加剧,语音交互技术在养老辅助机器人等场景中扮演着日益重要的角色。然而,现有商用语音识别系统在面对65岁以上老年人群体的语音信号时,常因发音不精确、颤音及语速缓慢等问题而表现不佳。为填补这一研究空白,韩国电子通信研究院(ETRI)与MINDs Lab Inc.于2021年联合发布了VOTE400(Voice Of The Elderly 400 Hours)数据集。该数据集包含约300小时的连续对话语音和100小时的朗读语音,全部采集自韩国各地3381名65岁以上老年人,覆盖多元地域与性别分布。VOTE400旨在为老年护理机器人领域提供大规模、高质量的语音资源,推动针对老年人语音特征的识别技术研究,其开源发布对学术界具有重要影响力。
当前挑战
VOTE400数据集所面临的核心挑战首先源于老年语音本身的声学特性:老年人发音中辅音不清晰、包含颤音且语速较慢,导致传统语音识别模型在特征提取与声学建模上存在显著性能瓶颈。其次,在数据构建过程中,对话语音采集依赖社会工作者上门录制,环境噪声大、发音模糊片段多,需经过严格的人工筛选与质检流程,以确保数据可用性。此外,朗读语音虽在受控环境下采集,但老年人实际朗读时产生的变体与原文偏差,使得最终句子数量超出预期,增加了标注与对齐的复杂性。这些挑战共同制约了老年语音识别系统的泛化能力与实用化部署。
常用场景
经典使用场景
VOTE400数据集作为迄今为止规模最大的韩语老年人语音语料库之一,在语音分析与识别领域展现出不可替代的经典应用价值。该数据集精心收录了来自韩国12个地区、年龄65岁以上的3381位老年人的300小时对话语音与100小时朗读语音,覆盖了丰富的地域口音与性别差异。研究者常利用这一资源训练端到端的自动语音识别模型,以应对老年人语音中特有的辅音发音模糊、震颤现象及语速缓慢等声学挑战,从而显著提升系统对老年用户语音的转录准确率。
衍生相关工作
VOTE400数据集衍生了多项经典研究工作,推动了老年人语音技术生态的繁荣。研究者基于该语料库开展了老年人语音特征提取与声学建模的专项研究,例如利用韵律分析与频谱特征揭示衰老对发音器官的影响。同时,该数据集被用于迁移学习与域自适应方法的验证,探索如何将通用语音模型高效适配至老年群体。此外,基于VOTE400的语音增强与去噪技术研究也相继涌现,旨在提升嘈杂环境下老年人语音的清晰度,为构建包容性人机交互系统奠定了坚实基础。
数据集最近研究
最新研究方向
随着全球人口老龄化进程的加速,面向老年群体的智能语音交互技术成为人机交互领域的前沿热点。VOTE400作为迄今为止规模最大的韩语老年语音数据集,涵盖约300小时的自发对话语音与100小时的朗读语音,采集自韩国12个地区、平均年龄近80岁的3381名参与者,其丰富的地域与性别多样性为研究老年语音的声学退化特征提供了坚实的数据基础。该数据集不仅揭示了老年语音在辅音发音模糊、颤音及语速放缓等方面的独特模式,更通过初步实验证明,基于VOTE400微调的语音识别系统在老年语音理解上显著优于通用云端引擎,这为开发面向养老机器人的鲁棒语音接口铺平了道路。当前,VOTE400已开源供非商业研究使用,正推动着从声学模型适配到跨代际交互设计的系统性变革,其影响辐射至智能家居、远程医疗及辅助机器人等老龄化社会亟需的智能服务领域。
相关研究论文
  • 1
    VOTE400(Voide Of The Elderly 400 Hours): A Speech Dataset to Study Voice Interface for Elderly-Care电子通信研究所和MINDs Lab公司 · 2021年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务