南京话方言语音标注训练数据
收藏资源简介:
本数据集聚焦南京话方言的语音识别与自然口语理解。南京话是江淮官话的代表性方言之一,在南京都市圈的本地生活服务、社区沟通、文化传承中有实际需求,现有普通话语音模型难以处理南京话的儿化音、入声及特定声调变异。本数据在专业录音棚采集一位南京本地女性说话人的自发口语叙事,每段语音均附有人工汉字转写,并标注儿化音密度(高/中/低),完整保留南京话特有的语气及词汇。 独立性与必要性 本数据集的特征——真实口语表达、话题自然延续、包含丰富的儿化音及方言修辞——是训练面向南京地区智能语音系统的关键资源。目前公开发音的南京话语料较为稀缺,本数据集填补了这一空白,具有明确的独立存在价值,是推动南京话语音识别、方言保护及本地化人机交互的必要基础数据。一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的南京话自然口语叙事语音,均为WAV格式,采样率48kHz。录音环境为强吸声、高信噪比的专业声学环境,确保音频质量。采集内容为一位南京本地女性说话人的自发独白叙事,话题覆盖日常生活、社会观察、情感思考等,无预设脚本干预。预处理阶段,使用音频处理工具批量读取每段语音的时长(秒),统一文件命名格式,并对音频进行音量归一化、静音段切除等标准化处理,保证数据一致性。 二、特征标注 由精通南京话的专业标注人员对每段语音进行精细化人工标注,针对方言数据特点增加差异化标注项: 语音转写:将音频内容逐字转写为标准汉字,完整保留南京话特有词汇及特有句式,忠实记录语气助词; 儿化音密度分级:根据每段语音中儿化音(如“碗儿”、“碟儿”、“小孩儿”等)出现的总次数除以时长,将儿化音密度分为高、中、低三级,用于训练模型在不同儿化音密度下的方言识别与合成能力; 场景标注:根据内容统一标注场景为“南京话”; 说话人属性:标注说话人性别(女)。 三、数据结构化与打包 将上述技术参数(时长、采样率)与人工标注结果汇总为结构化表格文件,每行对应一段语音,字段包括:语音文件名、时长(秒)、采样率(kHz)、场景、说话人/音色、性别、类型、来源与授权、文本、儿化音密度。 四、数据应用说明 本数据集可直接用于训练南京话方言场景下的语音识别模型、口语语义理解模型、方言语音合成系统等AI任务。数据集中每段语音均包含完整的转写文本及儿化音密度标注,标注规范、结构清晰,可作为南京话智能化应用的基准训练数据,尤其适用于南京地区的智能客服、本地化语音助手、社区便民服务以及方言文化数字化保护等垂直场景。




