Text-To-IPA
收藏资源简介:
该数据集名为“Text to IPA Phoneme”,旨在提供德语文本到国际音标(IPA)音素的转换对。数据集包含50,000个样本,每个样本由两个字段组成:klartext字段包含原始的德语文本,phon字段包含对应的IPA音标表示。数据以Parquet格式存储,文件路径为data/all_data.parquet。该数据集适用于德语语音处理、文本到语音(TTS)前端处理、语音学研究和发音建模等任务。数据集采用MIT许可证发布。
The dataset is named Text to IPA Phoneme and aims to provide conversion pairs from German text to International Phonetic Alphabet (IPA) phonemes. It contains 50,000 samples, each consisting of two fields: the klartext field contains the original German text, and the phon field contains the corresponding IPA phonetic transcription. The data is stored in Parquet format at the file path data/all_data.parquet. This dataset is suitable for tasks such as German speech processing, text-to-speech (TTS) front-end processing, phonetics research, and pronunciation modeling. It is released under the MIT license.
数据集概述:Text-To-IPA
- 数据集名称:Text to IPA Phoneme
- 数据集大小:50,000 条记录
- 语言:德语(de)
- 许可证:MIT
- 目的:将德语文本转换为国际音标(IPA)音素表示
数据集结构
- 列字段:
klartext:包含德语明文文本phon:包含对应的IPA音素序列
- 数据文件:所有数据存储于
data/all_data.parquet文件中,该文件包含上述两列
数据加载
-
推荐使用 Python 的
pandas库,并以pyarrow作为引擎进行加载 -
替代引擎:
fastparquet -
示例代码(加载并预览数据): python import pandas as pd path = data/all_data.parquet df = pd.read_parquet(path) print(df.shape) print(df.columns) print(df.head(3)) print(df.iloc[0][klartext], ->, df.iloc[0][phon])
-
另外,
datasets库的加载示例脚本位于examples/load_with_datasets.py





