Pashto-Corpus-Training-Ready
收藏资源简介:
Pashto语料库是一个经过预处理和分块的普什图语文本数据集,适用于语言模型的微调训练。数据集内容来源于教育材料、文学作品和学术文本,已进行清洗和格式化处理。数据集包含约25,000个训练样本、2,800个验证样本和2,800个测试样本。每个样本包含三个字段:'text'(清洗后的普什图语文本块)、'source'(数据来源类别,包括文学作品、语法书籍、教材和学术研究)和'length'(字符计数)。数据集经过了多重预处理步骤,包括移除PDF伪影和页码、阿拉伯/普什图字符标准化、长文档分块(最大2000字符)、质量过滤(最小长度、脚本比例)以及训练/验证/测试集划分(80/10/10比例)。该数据集特别适用于低资源语言的建模任务,可用于训练或微调如GPT、Llama、mT5等语言模型。数据集采用CC-BY 4.0许可,允许商业和研究用途,但需署名。
Pashto Corpus - Training Ready 数据集概述
数据集基本信息
- 数据集名称: Pashto Corpus - Training Ready
- 发布者: Tasal
- 发布日期: 2026年
- 版本: 1.0.0
- 许可证: CC-BY 4.0
- 语言: 普什图语 (ps)
- 标签: pashto, corpus, training, fine-tuning, language-modeling, low-resource-languages
数据集描述
该数据集包含来自教育材料、文学作品和学术文本的经过预处理和分块的普什图语文本。其格式已准备就绪,可用于训练或微调语言模型,如GPT、Llama、mT5等。
数据内容与结构
数据字段
text: 清理后的普什图语文本块。source: 数据来源类别,包括:literary_works(文学作品)、grammar_books(语法书籍)、textbooks_kpk(开伯尔-普赫图赫瓦省教科书)、academic_research(学术研究)。length: 文本块的字符数。
数据划分
| 划分 | 样本数量 | 数据大小 | 用途 |
|---|---|---|---|
| 训练集 (train) | 25,000 | 45,000,000 字节 | 模型训练 |
| 验证集 (validation) | 2,800 | 5,000,000 字节 | 超参数调优 |
| 测试集 (test) | 2,800 | 5,000,000 字节 | 最终评估 |
数据预处理流程
- 移除PDF伪影和页码。
- 标准化阿拉伯语/普什图语字符。
- 将长文档分割成块(最大2000字符)。
- 质量过滤(最小长度、脚本比例)。
- 按80/10/10的比例划分训练集、验证集和测试集。
使用方式
加载数据集
使用Hugging Face datasets库加载:
python
from datasets import load_dataset
dataset = load_dataset("tasal9/Pashto-Corpus-Training-Ready")
引用信息
如需引用本数据集,请使用以下BibTeX格式: bibtex @dataset{pashto-corpus-training-2026, author = {Tasal}, title = {Pashto Corpus - Training Ready}, year = {2026}, url = {https://huggingface.co/datasets/tasal9/Pashto-Corpus-Training-Ready}, version = {1.0.0} }
联系信息
- 作者: Tasal
- 邮箱: yaqoobtasal@zamai.dev
- HuggingFace主页: https://huggingface.co/tasal9




