pao-sentences-dataset
收藏资源简介:
Pa'O 句子数据集(Pa'O Sentences Dataset)是一个面向 Pa'O 语言(缅甸掸邦等地使用的低资源语言)的开放源代码文本语料库。该数据集包含结构化的逐行句子,专为自然语言处理、大语言模型预训练、机器翻译以及语音文本语料库开发而设计。数据集提供单一文本字段(text),每个样本为一句 Pa'O 语句,使用 Pa'O 文字书写。数据集规模介于 1,000 到 10,000 条句子之间,通过 Hugging Face datasets 库可轻松加载。主要用途包括语言建模、LLM 预训练、文本到语音语料库选用、计算语言学及单语文本研究。数据集由 Pa'O Digital Hub 组织收集和维护,采用 CC-BY-4.0 许可证。
PaO Sentences Dataset is an open-source text corpus for the PaO language (a low-resource language spoken in Shan State, Myanmar, etc.). It contains structured line-by-line sentences, designed for NLP, LLM pre-training, machine translation, and speech-text corpus development. The dataset provides a single text field, each sample is a PaO sentence written in PaO script. The dataset size ranges from 1,000 to 10,000 sentences, easily loadable via the Hugging Face datasets library. Main uses include language modeling, LLM pre-training, text-to-speech corpus selection, computational linguistics, and monolingual text research. The dataset is collected and maintained by PaO Digital Hub, licensed under CC-BY-4.0.
PaO 句子数据集(PaO Sentences Dataset)
数据集概述
PaO 句子数据集是一个为PaO 语言(ပအိုဝ်ႏဘာႏသာႏ) 构建的开源文本语料库,包含按行组织的结构化句子,适用于 NLP、LLM 预训练和机器翻译等任务。PaO 语是一种低资源语言,主要在缅甸掸邦及其他地区使用。
基本信息
| 属性 | 内容 |
|---|---|
| 许可证 | CC-BY-4.0(知识共享署名 4.0 国际) |
| 语言 | 单一语言:PaO 语(blk) |
| 语言来源 | 众包 + 专家生成 |
| 数据集规模 | 1K < n < 10K 条句子 |
| 任务类别 | 文本生成、掩码填充、句子相似度 |
| 数据来源 | 原始数据(非派生数据集) |
数据字段
数据集仅包含一个字段:
| 字段名 | 数据类型 | 描述 | 示例 |
|---|---|---|---|
text |
string |
使用 PaO 文字书写的 PaO 语句 | ဖညာꩻ တလဲဉ်းတောဝ်း |
数据配置与结构
- 配置名称:
default - 数据文件:训练集(train),路径为
data/*.txt - 文件结构:所有句子文件均存放在
data/目录下,文件命名如pao-sentences-001.txt、pao-sentences-002.txt等
预期应用场景
- 语言建模与 LLM 预训练:用于训练分词器、掩码语言模型(如 BERT、RoBERTa)以及 PaO 语的 LLM 微调
- 语音合成(TTS)语料库:为 PaO 语录音和语音合成挑选提示句子
- 计算语言学:用于单语文本语料库研究、语法分析及机器翻译模型开发
主要贡献者
数据集由以下人员收集、整理和维护:
- KhunPhanDuae(ခွန်ဖန်ဒွဲ့)
- KhunRorNa(ခွန်ရောန)
由 PaO Digital Hub 组织,并与 SuccessImprove 和 RYPAK 合作完成。
外部资源
- PaO 语言文档与资源中心:KhunPhanDuae - Pa-O-Language 网站
使用方式
可通过 Hugging Face 的 datasets 库加载,安装依赖后使用以下代码:
python from datasets import load_dataset
dataset = load_dataset("paodigitalhub/pao-sentences-dataset") print(dataset)
查看前 5 条句子
for i in range(5): print(f"[{i+1}]", dataset["train"][i]["text"])




