遇见数据集

iisys-hof/olaph-data-v2

收藏
Hugging Face2026-05-11 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用OLaPh框架创建的,用于训练OLaPhLLM v2模型。它包含来自FineWeb数据集(以及Wiktionary的单词语料)的多语言文本,自动音素化为英语、德语、法语和西班牙语的文本-音素对。数据集旨在支持音素化模型及相关语音或语言任务的研究与开发。

language: - 英语 - 德语 - 法语 - 西班牙语 license: odc-by tags: - 音素化 - 字素转音素(Grapheme-to-Phoneme,G2P) - 多语言 - olaph pretty_name: OLaPh音素化数据集v2 dataset_info: dataset_name: olaph-data version: 2.0.0 created_by: IISYS霍夫大学(IISYS Hof University) size_categories: - 100万<样本量<1000万 --- # OLaPh音素化数据集v2 ## 数据集概览 本数据集依托[OLaPh框架(OLaPh framework)]构建,用于训练[OLaPhLLM v2]。数据集包含源自FineWeb数据集(FineWeb datasets)的多语言文本(以及来自维基词典(Wiktionary)的单词语料),并针对英语、德语、法语与西班牙语自动生成了文本-音素配对数据。 ## 源数据 文本采集自以下来源: - [HuggingFaceFW/fineweb](https://huggingface.co/datasets/HuggingFaceFW/fineweb) - [HuggingFaceFW/fineweb-2](https://huggingface.co/datasets/HuggingFaceFW/fineweb-2) - [维基词典(Wiktionary)](https://wiktionary.org) ## 音素化处理 所有文本均通过[**OLaPh框架(OLaPh framework)**]完成自动处理与音素化标注。 ## 预期用途 本数据集旨在支持音素化模型及相关语音、语言学任务的研究与开发工作。 ### 引用 bibtex @misc{wirth2026olaphoptimallanguagephonemizer, title={OLaPh: Optimal Language Phonemizer}, author={Johannes Wirth}, year={2026}, eprint={2509.20086}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2509.20086}, }

提供机构:
iisys-hof
二维码
社区交流群
二维码
科研交流群
商业服务