遇见数据集

general_english_pashto

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

General English Pashto 是一个大规模、高质量、标准化的英语到普什图语平行语料库。该数据集专门收集了通用日常英语文本的普什图语翻译,旨在为普什图语大语言模型、机器翻译系统、双语嵌入模型以及通用翻译模型的开发提供基础资源。数据集经过严格的预处理流程,包括Unicode清理、文本标准化、去重、句子对齐、质量评分和领域过滤,确保了数据的洁净度与一致性。数据以JSONL格式存储,每条记录包含一个平行的句子对,分别存储在english和pashto字段中,采用UTF-8编码。其内容覆盖广泛的通用领域,如日常对话、常识、信息性文本和解释性段落,译文风格中性。该数据集主要适用于英语→普什图语机器翻译、普什图语LLM预训练、双语词向量对齐、通用领域翻译模型构建,以及为指令微调创建平行语料。数据集采用Apache License 2.0许可协议发布。

General English Pashto is a large-scale, high-quality, standardized English-to-Pashto parallel corpus. This dataset specifically collects Pashto translations of general daily English texts, aiming to provide foundational resources for the development of Pashto large language models, machine translation systems, bilingual embedding models, and general translation models. The dataset undergoes rigorous preprocessing steps, including Unicode cleaning, text normalization, deduplication, sentence alignment, quality scoring, and domain filtering, ensuring data cleanliness and consistency. Data is stored in JSONL format, with each record containing a parallel sentence pair stored in the english and pashto fields, using UTF-8 encoding. Its content covers a wide range of general domains, such as daily conversations, common sense, informative texts, and explanatory passages, with a neutral translation style. The dataset is primarily suitable for English→Pashto machine translation, Pashto LLM pre-training, bilingual word vector alignment, general-domain translation model construction, and creating parallel corpora for instruction fine-tuning. The dataset is released under the Apache License 2.0.

创建时间:
2026-07-03
原始信息汇总

数据集概述:General English Pashto

  • 名称: General English Pashto
  • 许可证: Apache License 2.0
  • 语言: 英语 (en)、普什图语 (ps)
  • 任务: 翻译 (translation)
  • 规模: 100K < 样本数 < 500K
  • 格式: JSONL,每行包含一个平行句对,字段包括:
    • english: 原始英语文本
    • pashto: 对应的普什图语翻译
    • 编码为 UTF-8,经过清洗、规范化和去重

数据集用途

  • 英语 → 普什图语机器翻译
  • 普什图语大语言模型 (LLM) 预训练
  • 双语嵌入对齐
  • 通用领域翻译模型
  • 构建指令微调的平行语料

领域覆盖

数据集涵盖广泛的通用主题,包括:

  • 日常对话
  • 通用知识
  • 信息性文本
  • 说明性段落
  • 中性语气翻译

数据质量处理

数据集经过以下流程处理:

  • Unicode 清理
  • 文本规范化
  • 去重
  • 句子对齐
  • 质量评分
  • 领域过滤

作者与引用

  • 作者: Nassim JP(Spinzar Enterprises Inc. 创始人,日本)

  • 引用格式:

    @misc{general_english_pashto_2026, author = {Nsibullah Nassim}, title = {General English Pashto}, year = {2026}, publisher = {HuggingFace Datasets}, howpublished = {https://huggingface.co/datasets/nassimjp/general_english_pashto} }

更多详情请访问:https://huggingface.co/datasets/nassimjp/general_english_pashto

搜集汇总
数据集介绍
general_english_pashto 数据集图片
构建方式
该数据集是一个大规模、高洁净度的英-普什图语平行语料库,专为通用日常文本的翻译需求而构建。其构建流程严格遵循自然语言处理的高标准,依次执行了Unicode清洗、文本规范化、去重、句子对齐、质量评分以及领域过滤等一系列精心设计的步骤。每一步都确保了数据的一致性与可靠性,最终形成了包含超过十万条平行句对的JSONL格式文件,每条记录均包含标准的英语源文与对应的普什图语译文,编码为通用UTF-8格式。
特点
数据集的核心特点在于其广泛的领域覆盖与卓越的数据质量。它囊括了日常对话、常识性知识、信息性文本以及说明性段落等多样化的通用主题,所有译文均保持中性语气,极具代表性。经过严格的去重与对齐处理,该语料库不仅消除了冗余噪声,还极大提升了句对之间的语义匹配精度。这使得它成为训练普什图语大语言模型、机器翻译系统以及双语嵌入对齐任务中不可或缺的基石资源。
使用方法
该数据集的使用极为便捷,适合直接应用于多种自然语言处理场景。开发者可将其作为序列到序列模型的训练或评估数据,用于构建英语到普什图语的通用翻译系统;亦可利用其双语平行特性,进行双语词嵌入的联合训练,以提升跨语言语义理解。此外,得益于其干净且标注清晰的字段结构,它也适合用于构造指令微调所需的平行语料,从而推动普什图语AI研究的发展。
背景与挑战
背景概述
普什图语(Pashto)作为阿富汗和巴基斯坦部分地区的主要语言,其自然语言处理资源长期匮乏,成为机器翻译与多语言人工智能发展中的显著短板。为此,Nassim JP 及其机构 Spinzar Enterprises Inc. 于 2026 年发布了 General English Pashto 数据集,这是一个大规模、高质量、标准化的英语-普什图语平行语料库,包含日常对话、通用知识与说明性文本等广泛领域内容。该数据集经过严格的 Unicode 清洗、文本标准化、去重、句对齐及质量评分等流程,旨在为普什图语大语言模型预训练、机器翻译系统构建、双语嵌入对齐及指令微调等任务提供基础性资源。其发布填补了低资源语言在通用领域并行数据方面的空白,对推动普什图语的计算语言学研究和多语言人工智能应用具有重要里程碑意义。
当前挑战
该数据集所解决的核心领域挑战是低资源语言翻译问题:普什图语缺乏大规模、高质量、领域覆盖广的平行语料,导致现有神经机器翻译模型性能不佳且泛化能力弱。构建过程中面临多重困难,包括原始文本来源分散且质量参差不齐,需开发统一的 Unicode 编码清洗与标准化流程以消除字符不一致问题;同时,对大规模数据进行高效去重与准确句对齐,并建立合理的质量评分机制以筛选可靠翻译对,避免噪声和误匹配引入模型。此外,还需确保领域覆盖的均衡性与实用性,避免过度偏斜于特定主题,从而满足通用翻译需求。这些挑战的克服为同类低资源语言数据集构建提供了可复用的方法论。
常用场景
经典使用场景
在自然语言处理与机器翻译领域,通用英语-普什图语平行语料库(General English-Pashto)作为一座精心雕琢的桥梁,专门服务于英普双语翻译任务。研究人员可将其直接用于训练端到端的神经机器翻译模型,涵盖从日常生活对话到通用知识的多元文本范畴。该数据集经过严格的文本清洗、归一化、去重及对齐处理,确保了高质量的双语句对,成为构建普什图语大型语言模型及双语嵌入表示的不二基石。其经典应用场景在于提升普什图语这一低资源语言在机器翻译中的表现,为后续学术探索奠定了坚实的数据基础。
衍生相关工作
基于这一高质量语料库,学术界与工业界相继衍生出一系列重要工作。研究者将其作为测试基准,评估不同的机器翻译架构(如Transformer变体及多任务学习模型)在英普语言对上的表现。同时,该数据集被用于双语词典归纳与跨语言词嵌入的对比学习训练,产出了多项关于低资源语言语义空间对齐的研究成果。此外,相关的普什图语大型语言模型预训练工作也借助该语料库的平行特性来强化模型对双语指令的理解能力。这些衍生工作进一步扩大了数据集的影响力,推动了针对普什图语的系统性自然语言处理研究生态的逐步成型。
数据集最近研究
最新研究方向
在神经机器翻译(NMT)与低资源语言处理领域,普什图语作为阿富汗及巴基斯坦地区的核心语言,长期受限于高质量并行语料库的匮乏,成为NLP技术落地的瓶颈之一。general_english_pashto数据集的出现填补了这一空白,其大规模、标准化且经过严格清洗与对齐的英普平行语料,为构建鲁棒的英译普机器翻译系统提供了坚实基础。当前前沿研究聚焦于利用该数据集进行预训练语言模型(如普什图语LLM)的指令微调、跨语言语义对齐以及双语嵌入表征学习,旨在突破低资源场景下的翻译质量与泛化能力瓶颈。该数据集不仅是普什图语AI生态建设的关键基石,更与全球关注的语言技术平权与多语种信息无障碍运动紧密契合,其开源许可特性进一步推动了学术界与工业界在低资源翻译方向的协作创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务