遇见数据集

mongolian-script-text

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集是一个精心整理的高质量平行语料库,包含现代西里尔蒙古文与传统蒙古文(Mongol Bicig)的对照文本。数据集旨在支持低资源脚本的自然语言处理应用,包括自动转写、正字法映射和形态分析。当前收录了20世纪经典的蒙古文学、诗歌和儿童歌曲,例如B. Rinchen的诗歌《Minii Nutag》、D. Natsagdorj的《Mongol Khel》以及传统童谣。数据以JSONL格式按流派组织,每个样本包含两个字段:cyrillic(西里尔蒙古文)和bicig(传统蒙古文Unicode)。数据集规模较小(少于1K样本),适用于转写与序列映射(如微调ByT5、mT5、MarianMT等模型)、形态对齐(学习古元音保留、后缀和谐及词根完整性)以及文本归一化(构建拼写检查器和文学评估基准)等任务。数据集采用Apache 2.0许可证发布。

This dataset is a carefully curated high-quality parallel corpus containing paired texts of modern Cyrillic Mongolian and traditional Mongolian script (Mongol Bicig). It aims to support low-resource script natural language processing applications, including automatic transliteration, orthographic mapping, and morphological analysis. Currently, it includes classic Mongolian literary works, poems, and childrens songs from the 20th century, such as B. Rinchens poem Minii Nutag, D. Natsagdorjs Mongol Khel, and traditional nursery rhymes. The data is organized in JSONL format by genre, with each sample containing two fields: cyrillic (Cyrillic Mongolian) and bicig (traditional Mongolian Unicode). The dataset is small (fewer than 1K samples) and suitable for tasks such as transliteration and sequence mapping (e.g., fine-tuning ByT5, mT5, MarianMT models), morphological alignment (learning archaic vowel retention, suffix harmony, and root integrity), and text normalization (building spell checkers and literary evaluation benchmarks). The dataset is released under the Apache 2.0 license.

创建时间:
2026-08-19
原始信息汇总

数据集概述

蒙古文文本数据集(Mongolian Script Text Corpus)是一个精心整理的平行语料数据集,将现代西里尔蒙古文与传统蒙古文(Mongol Bicig)进行配对,旨在支持低资源脚本的NLP应用、自动转写、正字法映射和形态分析。目前收录了20世纪蒙古经典文学、诗歌和儿童歌曲,未来将持续扩充。


数据集结构

文件组织

数据集按体裁划分,存储于独立的JSONL文件中:

文件路径 内容
poems/minii_nutag.jsonl B. Rinchen的诗歌《Minii Nutag》(我的故乡)
poems/mongol_khel_poem.jsonl D. Natsagdorj的诗歌《Mongol Khel》(蒙古语)
children_songs/maamuu_naash_ir.jsonl 传统儿童歌谣与童谣

数据字段

每条样本为干净的JSON对象,包含两个主要键:

  • cyrillic(字符串):现代西里尔蒙古文正字法文本。
  • bicig(字符串):标准Unicode传统蒙古文对应文本。

示例数据

json { "cyrillic": "Хэнтий, Хангай, Соёны өндөр сайхан нуруунууд", "bicig": "ᠬᠡᠨᠲᠡᠢ᠂ ᠬᠠᠩᠭᠠᠢ᠂ ᠰᠠᠶᠠ᠎ᠤ ᠥᠨᠳᠥᠷ ᠰᠠᠢᠬᠠᠨ ᠨᠢᠷᠤᠭᠤ᠎ᠨᠤᠭᠤᠳ" }


使用方式

可通过Hugging Face datasets库直接加载:

python from datasets import load_dataset

dataset = load_dataset("suwanpan/mongolian-script-text") print(dataset["train"][0])


适用任务

  • 转写与序列映射:微调序列到序列模型(如ByT5、mT5、MarianMT)实现西里尔蒙古文与传统蒙古文之间的转换。
  • 形态对齐:学习蒙古文跨脚本中的古元音保留、后缀和谐和词根完整性。
  • 文本规范化:构建拼写检查器和文学评估基准。

许可与引用

数据集基于 Apache 2.0 许可证 发布,允许自由使用、修改和分发,适用于研究和开源开发。

搜集汇总
数据集介绍
mongolian-script-text 数据集图片
构建方式
该数据集精心构建了一个平行语料库,旨在对齐现代西里尔蒙古文与传统蒙古文(蒙古比西格)。其构建过程基于对20世纪蒙古经典文学作品、诗歌及儿童歌谣的系统性采集与整理,每一条样本均包含一对严格对齐的文本,分别以现代西里尔蒙古文正字法和标准Unicode传统蒙古文呈现。数据按文学体裁分置于独立的JSONL文件中,如诗歌、儿童歌曲等,确保了不同风格语料的清晰分类与便捷访问。每一对文本都经过人工校对,以保证语言转换的准确性与文本的纯净度。
使用方法
此数据集可便捷地通过Hugging Face的datasets库加载,用户只需调用load_dataset函数即可获取全部数据,并可轻易检查样本内容。其设计初衷服务于多项自然语言处理任务,包括但不限于训练序列到序列模型(如ByT5、mT5)进行西里尔至传统蒙古文的转写与转换,支持形态学对齐研究(如元音保留、后缀和谐),以及文本标准化和拼写检查基准的构建。得益于Apache 2.0许可,研究者可自由使用、修改与分发,以推动蒙古文信息处理领域的发展。
背景与挑战
背景概述
该数据集由研究者在2023年创建,旨在应对蒙古语西里尔文与传统蒙古文(Mongol Bicig)之间的平行语料稀缺问题。核心研究问题聚焦于低资源文字场景下的转写、形态对齐及文本规范化。数据集精选20世纪蒙古经典文学、诗歌与童谣,如B. Rinchen的《Minii Nutag》和D. Natsagdorj的《Mongol Khel》,为神经机器翻译和形态分析提供了高质量的基准。其发布填补了蒙古文数字资源空白,推动了低资源语言处理技术发展,尤其在跨文字转换领域具有开创性意义。
当前挑战
构建过程中面临多重挑战:一方面,传统蒙古文与现代西里尔蒙古文之间存在复杂的拼写差异,包括元音保留、后缀和谐及词根完整性,需要精细的语言学知识进行校对;另一方面,历史文献的数字化与统一编码(Unicode)处理极为耗时,且原始文本质量参差不齐,需人工清洗。此外,语料规模尚小(不足1000条),限制了深度学习模型的泛化能力,转写歧义和形态变化多样性进一步增加了建模难度。
常用场景
经典使用场景
该数据集作为蒙古文信息处理领域的一项基础资源,其经典的使用场景聚焦于现代西里尔蒙古文与传统回鹘式蒙古文(Mongol Bicig)之间的序列转换与对齐任务。研究者常利用其构建端到端的神经机器翻译系统或字符级转换模型,以攻克低资源文字间的自动转写难题。凭借其精良的语料配比与文体多样性,该数据集亦成为验证各类序列到序列模型在形态丰富语言上性能的基准,为蒙古文跨文字信息检索与数字人文研究奠定了基石。
解决学术问题
在学术研究层面,该数据集切实回应了蒙古文信息处理中的两大核心痛点:其一,传统蒙古文作为联合国教科文组织认定的濒危文字,其数字化语料极为匮乏,该数据集为学术界提供了稀缺的平行语料,支撑了对古老文字形态结构与音韵系统的量化分析;其二,通过呈现西里尔与传统蒙古文之间的系统性对应关系,该数据集促进了针对蒙古语元音和谐律、辅音组合规则及词干-词缀黏着特性的深度探究,为计算语言学中的形态分析与词法建模提供了宝贵的实证数据,有力推动了低资源语言自然语言处理技术的理论发展。
实际应用
在实际应用场景中,该数据集是开发众多蒙古文智能处理工具的核心基石。它可直接用于训练高精度的自动转写系统,促进西里尔蒙古文与回鹘式蒙古文之间的无缝转换,从而服务于蒙古国与中国内蒙古地区的古籍数字化、现代出版及跨文种信息交互。在文化遗产保护领域,基于该数据集的模型可辅助历史文献的自动识别与标引,构建电子化蒙古文图书馆。此外,该数据集中蕴含的儿童歌谣与诗歌语料,亦被用于开发面向蒙古语母语者的语言教育应用,以及优化输入法、拼写检查等常用软件,提升了终端用户体验。
数据集最近研究
最新研究方向
该数据集聚焦于蒙古语西里尔文与传统回鹘式蒙古文(Mongol Bicig)之间的平行语料构建,为低资源文字处理、自动转写及正字法映射提供了高质量数据基础。其前沿研究方向涵盖利用序列到序列模型(如ByT5、mT5)实现跨文字体系的高效转换,以及通过对比分析揭示蒙古语元音保留、辅音和谐等形态学规律。数据集收录的20世纪经典文学作品,不仅服务于文本规范化与拼写校正任务,更为文学计算和文化遗产数字化提供了珍贵语料,推动了蒙古语自然语言处理在文化传承与智能语言服务中的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务