遇见数据集

english_pashto_parallel-corpus

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

English–Pashto Parallel Corpus 是一个高质量的英语-普什图语平行语料库,专为机器翻译、监督微调、普什图语大语言模型训练以及语料库质量研究而设计。该数据集包含两个主要部分:高质量的平行数据(`translation_clean.jsonl`)和异常数据(`translation_anomalies.jsonl`)。高质量数据适用于机器翻译、监督微调、指令调优和推理对齐等任务,每条记录包含唯一ID、英语原文和普什图语译文。异常数据包含在自动检测中识别的记录,如词汇故障、重复标记、误译、英语泄露、格式错误和幻觉生成的普什图语等,对语料库调试、自动校正、质量基准测试和异常检测研究有价值。数据集总计830,879条记录,其中高质量记录713,429条(占85.86%),异常记录117,450条(占14.14%)。数据集经过了多阶段质量处理流程,包括JSON合并验证、翻译缓存合并、去重、普什图语提取、基于长度的过滤、标记重复检测、英语泄露检测、词汇异常检测、质量评分以及干净与异常数据集分割。适用于英语↔普什图语机器翻译、普什图语LLM预训练、监督微调、指令调优、推理对齐、语料库质量研究、异常检测基准测试和数据清洗管道开发等多种应用场景。

创建时间:
2026-07-12
原始信息汇总

English–Pashto Parallel Corpus 数据集概述

基本信息

  • 数据集名称: English–Pashto Parallel Corpus
  • 语言: 英语(en)、普什图语(ps)
  • 许可证: Apache-2.0
  • 标签: pashto, english, translation, parallel-corpus, machine-translation, nlp, llm-training, pashto-ai, anomalies, clean-corpus
  • 数据集规模: 100K < n < 1M

数据集结构

数据集包含两个子集文件:

1. translation_clean.jsonl

  • 高质量平行语料,适用于机器翻译、监督微调(SFT)、普什图语大语言模型训练、指令微调、推理对齐等任务。
  • 数据格式: json { "id": 12345, "source": "English sentence...", "target": "Pashto translation..." }

2. translation_anomalies.jsonl

  • 包含在自动异常检测过程中识别的记录。
  • 典型异常类别包括:词汇故障、重复标记、误译、英语泄漏、格式错误、幻觉式普什图语。
  • 适用于语料库调试、自动校正流程、质量基准测试、异常检测研究。

数据集统计

指标 数值
总记录数 830,879
干净记录数 713,429
异常记录数 117,450
干净比例 85.86%
异常比例 14.14%

用例

  • 英语 ↔ 普什图语机器翻译
  • 普什图语大语言模型预训练
  • 监督微调(SFT)
  • 指令微调
  • 推理对齐
  • 语料库质量研究
  • 异常检测基准测试
  • 数据清洗流程开发

数据清洗流程

语料库经过多阶段质量管道处理,包括:

  • JSON合并验证
  • 翻译缓存合并
  • 去重
  • 普什图语提取
  • 基于长度的过滤
  • 标记重复检测
  • 英语泄漏检测
  • 词汇异常检测
  • 质量评分
  • 干净数据集与异常数据集拆分

作者

  • 作者: Nassim Nasibullah
  • 机构: Spinzar Enterprises Inc. (Yūgen Kaisha), Japan

引用信息

bibtex @dataset{english_pashto_parallel_corpus_2026, author = {Nassim Nasibullah}, title = {English--Pashto Parallel Corpus}, year = {2026}, publisher = {Hugging Face}, journal = {Hugging Face Datasets}, url = {https://huggingface.co/datasets/nassimjp/english_pashto_parallel-corpus} }

搜集汇总
数据集介绍
english_pashto_parallel-corpus 数据集图片
构建方式
本数据集由Nassim Nasibullah创建,隶属于Spinzar Enterprises Inc.,旨在为英语与普什图语之间的机器翻译及大语言模型训练提供高质量平行语料资源。构建过程包含一套多阶段质量控制流水线:从原始语料合并与JSON校验起步,依次进行翻译缓存合并、去重处理、普什图语抽取、长度过滤、词汇异常检测、英语泄漏识别、质量评分,最终将数据划分为干净和异常两个子集。干净子集(translation_clean.jsonl)包含713,429条记录,可供监督微调、指令对齐及推理增强使用;异常子集(translation_anomalies.jsonl)包含117,450条记录,涵盖词汇错误、重复标记、误译、英语泄漏、格式异常及幻觉翻译等类别,为语料质量研究与自动校正管线开发提供了独特价值。
特点
该数据集的突出特点在于其明确的干净与异常拆分设计。整体规模达830,879条记录,干净比例高达85.86%,异常比例为14.14%,为不同研究目标提供了精准选择。干净子集专为机器翻译、普什图语大语言模型预训练、监督微调及推理对齐等核心任务优化,每条记录均包含唯一ID、源语言与目标语言字段。异常子集则系统记录了自动检测过程中识别出的七类典型问题,支持语料调试、自动校正流程开发、质量基准测试以及异常检测方法研究。这种双轨制结构不仅提升了语料使用的透明度,也为普什图语自然语言处理的可复现性研究奠定了基础。
使用方法
用户可通过Hugging Face Datasets库便捷加载该数据集。对于默认的干净子集,使用load_dataset('nassimjp/english_pashto_parallel-corpus', split='clean')命令即可获取713,429条高质量平行句对,每条数据以JSON格式包含id、source(英语)及target(普什图语)字段,可直接用于训练机器翻译模型、进行监督微调或指令调优。若需分析语料质量或开发自动校正算法,可加载异常子集:load_dataset('nassimjp/english_pashto_parallel-corpus', split='anomalies'),获取117,450条带有标记问题的记录。数据集采用Apache-2.0许可证开源,支持研究者自由用于学术与商业项目,并建议引用原论文以促进该领域基础设施的持续建设。
背景与挑战
背景概述
英语-普什图语平行语料库由Nassim Nasibullah及其团队于2026年创建,旨在填补低资源语言普什图语在机器翻译与自然语言处理领域的空白。该数据集由Spinzar Enterprises Inc.(日本)主导开发,聚焦于构建高质量、可复现的普什图语NLP基础设施,包含约83万条记录,其中干净语料占比85.86%。作为普什图语AI研究的里程碑式资源,它不仅服务于英-普机器翻译任务,还支持大语言模型预训练、监督微调及语料质量研究,显著推动了低资源语言处理技术的发展。
当前挑战
该数据集面临的核心挑战包括两大方面:首先,领域问题层面,普什图语作为低资源语言,缺乏大规模高质量平行语料,且语言形态复杂、方言众多,导致机器翻译模型易出现词汇错误、重复标记、英语泄露及幻觉翻译等质量问题;其次,构建过程中,团队需应对多阶段清洗管线的技术难题,包括JSON合并验证、去重、长度过滤、异常检测及质量评分等环节,并成功识别出约11.7万条异常记录(占比14.14%),对自动校正流程与基准测试提出了严格要求。
常用场景
经典使用场景
English–Pashto平行语料库作为神经机器翻译的核心资源,为英语与普什图语之间的自动翻译模型提供了高质量的监督训练数据。其清洗后的‘translation_clean.jsonl’包含超过71万条对齐句对,可直接用于Transformer系列模型的微调与评估,是构建普什图语翻译系统的基石。此外,该语料库还服务于普什图语大语言模型的指令微调与推理对齐,助力低资源语言的LLM能力提升。
实际应用
在实际应用中,该语料库赋能了跨境信息交流的翻译工具开发,如普什图语地区的政务交互、新闻翻译与人道主义援助场景。其异常子集‘translation_anomalies.jsonl’可助力企业构建自动化语料审核与修复管线,降低人工校验成本。同时,清洗后的数据为普什图语语音助手、教育平台的多语言支持提供了可靠的训练基石,加速了语言技术的普惠化落地。
衍生相关工作
该数据集衍生出一系列关于低资源语言数据质量控制的开创性工作。其公开的自动异常检测方法启发了针对普什图语的词项重复、幻觉翻译等伪影的分类研究,推动了清洗管线的标准化进程。此外,基于该语料库的翻译模型微调实验催生了专门面向普什图语大语言模型的指令数据集构建框架,并为多阶段语料质量评分算法提供了对比基准,奠定了普什图语NLP基础设施的开放生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务