遇见数据集

上海话方言语音标注训练数据

收藏
浙江省数据知识产权登记平台2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

本数据集聚焦上海话方言的语音识别与自然口语理解。上海话是吴语太湖片的代表,在本地智能客服、社区服务、文化传承等领域有强烈需求。现有普通话语音模型无法处理上海话的浊音声母、入声及连续变调。本数据在专业录音棚采集一位上海本地男性说话人的自然口语叙事,每段语音均附有人工汉字转写,并标注浊音声母清晰度(高/中/低),完整保留上海话特有词汇及语序。 独立性与必要性 本数据集的特征——真实口语化表达、话题自然流转、包含丰富的浊音声母与语气词——是训练面向上海地区智能化语音系统的关键资源。目前公开发音的上海话语料较为稀缺,本数据集填补了这一空白,具有明确的独立存在价值,是推动上海话语音识别、方言保护及本地化人机交互的必要基础数据。 一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的上海话自然口语叙事语音,均为WAV格式,采样率48kHz。录音环境为强吸声、高信噪比的专业声学环境,确保音频质量。采集内容为一位上海本地男性说话人的自发独白叙事,内容覆盖日常叙事类话题,无预设脚本干预。预处理阶段,使用音频处理工具批量读取每段语音的时长(秒),统一文件命名格式,并对音频进行音量归一化、静音段切除等标准化处理,保证数据一致性。 二、特征标注 由精通上海话的专业标注人员对每段语音进行精细化人工标注,针对上海话特点增加差异化标注项: 语音转写:将音频内容逐字转写为标准汉字,完整保留上海话特有词汇及特有句式,必要时用助词体现语气,确保转写文本忠实反映方言发音与用词习惯; 浊音声母清晰度分级:根据语音中浊音声母(如“b、d、g、z、v”等)的发音清晰度(是否低沉有力、声带振动明显),将每段语音的浊音声母清晰度分为高、中、低三级,用于训练模型在不同浊音保存度下的方言识别能力; 场景标注:根据内容统一标注场景为“上海话”; 说话人属性:标注说话人性别(男)。 三、数据结构化与打包 将上述技术参数(时长、采样率)与人工标注结果汇总为结构化表格文件,每行对应一段语音,字段包括:语音文件名、时长(秒)、采样率(kHz)、场景、说话人/音色、性别、类型、来源与授权、文本、浊音声母清晰度。 四、数据应用说明 本数据集可直接用于训练上海话方言场景下的语音识别模型、口语语义理解模型、方言语音合成系统等AI任务。数据集中每段语音均包含完整的转写文本及浊音声母清晰度标注,标注规范、结构清晰,可作为上海话智能化应用的基准训练数据,尤其适用于上海地区的智能客服、本地化语音助手、社区便民服务以及方言文化数字化保护等垂直场景。

创建时间:
2026-06-24
搜集汇总
数据集介绍
上海话方言语音标注训练数据 数据集图片
背景与挑战
背景概述
该数据集包含在上海专业录音棚采集的上海本地男性说话人的自然口语叙事语音,所有音频均为WAV格式,采样率48kHz,并经过音量归一化和静音切除等标准化处理。每段语音均配有逐字汉字转写,以及浊音声母清晰度的分级标注(高/中/低),完整保留了上海话特有词汇和语序。数据可直接用于训练上海话语音识别、口语理解及语音合成等模型,适用于上海地区智能客服、本地化语音助手、社区服务及方言文化数字化保护等场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务