遇见数据集

湖南塑普方言语音标注训练数据

收藏
浙江省数据知识产权登记平台2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

本数据集聚焦湖南塑普(湖南口音普通话)的语音识别与自然口语理解,核心解决现有标准普通话模型难以准确识别塑普中声调偏误、鼻边音不分、平翘舌混淆等特征的问题,通过专业录音棚采集的湖南本地女性说话人自发对话语音及“方言纯度”三级标注,支撑模型在不同方言纯度下的识别与适应能力。除内部训练外,该数据集可广泛复用于湖南地区智能客服与本地生活服务的语音交互、方言区普通话教学辅助、口音识别与方言适应系统开发、本地化语音助手及智能家居设备的口音适配,以及面向湖南市场的语音产品本地化优化等多元场景,为湖南地区普通话智能化应用提供高质量基准数据。一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的湖南塑普自然对话语音,均为WAV格式,采样率48kHz。录音环境为强吸声、高信噪比的专业声学环境,确保音频质量。采集内容为一位湖南本地女性说话人的自发对话,话题覆盖日常生活、社会热点、个人观点等,无预设脚本干预。预处理阶段,使用音频处理工具批量读取每段语音的时长(秒),统一文件命名格式,并对音频进行音量归一化、静音段切除等标准化处理,保证数据一致性。 二、特征标注 由熟悉湖南口音的专业标注人员对每段语音进行精细化人工标注,针对方言数据特点增加差异化标注项: 语音转写:将音频内容逐字转写为标准汉字,完整保留湖南塑普特有词汇及口音影响下的用词习惯,确保转写文本忠实反映发音与口语表达; 方言纯度分级:根据语音中方言词汇的密集程度、声调特征(如阳平读低升、上声不明显)的明显度,将每段语音的方言纯度分为高、中、低三级。该分级用于训练模型在不同方言纯度下的识别与适应能力; 场景标注:根据内容统一标注场景为“湖南塑普”; 说话人属性:标注说话人性别(女)。 三、数据结构化与打包 将上述技术参数(时长、采样率)与人工标注结果汇总为结构化表格文件,每行对应一段语音,字段包括:语音文件名、时长(秒)、采样率(kHz)、场景、说话人/音色、性别、类型、来源与授权、文本、方言纯度。 四、数据应用说明 本数据集可直接用于训练湖南塑普方言口音场景下的语音识别模型、口语语义理解模型、方言口音适应系统等AI任务。数据集中每段语音均包含完整的转写文本及方言纯度标注,标注规范、结构清晰,可作为湖南地区普通话智能化应用的基准训练数据,尤其适用于湖南地区的智能客服、本地化语音助手、方言区普通话教学以及口音识别等垂直场景。

创建时间:
2026-06-24
搜集汇总
数据集介绍
湖南塑普方言语音标注训练数据 数据集图片
背景与挑战
背景概述
本数据集收录了湖南本地女性说话人在专业录音棚内录制的湖南塑普自然对话语音,以WAV格式(48kHz采样率)存储,并对每段语音进行了逐字转写、方言纯度(高/中/低)三级标注及场景、性别等属性标注。其核心目标是解决标准普通话模型对塑普中声调偏误、鼻边音不分、平翘舌混淆等特征的识别问题,可广泛用于训练语音识别、口语理解、口音适应等模型,支撑湖南地区智能客服、本地化语音助手、方言教学及口音识别等应用场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务