遇见数据集

有声读物文本拼音标注数据

收藏
杭州数据交易所2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

用于训练TTS、ASR、预训练模型(ChineseBERT)。提升多音字与罕见字准确发音、语音合成自然度、拼音 - 汉字转换鲁棒性、中文 NLP 语义理解。服务于有声读物合成、语言学习、无障碍辅助、儿童教育、内容审核、智能语音助手等场景。

创建时间:
2025-12-30
搜集汇总
数据集介绍
有声读物文本拼音标注数据 数据集图片
背景与挑战
背景概述
该数据集包含美文、小说、儿童故事等有声读物文本的汉字与拼音标注,总时长35小时,数据量约4-5GB。可用于训练TTS、ASR及ChineseBERT预训练模型,提升多音字与罕见字的发音准确性、语音合成自然度以及拼音-汉字转换的鲁棒性。适用于有声读物合成、语言学习、儿童教育及智能语音助手等场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务