遇见数据集

instruct_pashto

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Instruct Pashto 数据集是一个专门为普什图语指令遵循任务设计的对话数据集。该数据集包含多个知名指令对话数据集(如Wikipedia、Databricks的Dolly和MosaicML Instruct-v3)的普什图语翻译内容,这些原始数据均基于CC BY-SA 3.0许可证发布。数据集规模小于1万样本,适用于文本生成任务,特别关注医疗、指令和聊天等应用场景。数据采用标准的jsonl格式存储,每条记录包含一个消息列表,其中明确区分用户角色和助理角色的对话内容,格式化为适合微调对话式大语言模型(LLMs)的结构。数据集的主要目的是支持在普什图语环境下开发能够理解和遵循指令的对话AI模型,填补了低资源语言在指令微调数据方面的空白。所有翻译和重新格式化的普什图语内容由Nsibullah Nassim于2026年整理并发布。

The Instruct Pashto dataset is a conversational dataset specifically designed for Pashto language instruction following tasks. It contains Pashto translations of several well-known instruction conversational datasets, including Wikipedia, Databricks' Dolly, and MosaicML Instruct-v3. All original datasets are released under the CC BY-SA 3.0 license. The dataset has fewer than 10,000 samples, is suitable for text generation tasks, and focuses specifically on application scenarios such as healthcare, instruction following, and chat. The data is stored in the standard JSONL format. Each record includes a list of messages that clearly distinguish between user and assistant roles, formatted to be compatible with fine-tuning conversational large language models (LLMs). The primary purpose of this dataset is to support the development of conversational AI models that can understand and follow instructions in Pashto environments, filling the gap in instruction fine-tuning data for low-resource languages. All translated and reformatted Pashto content was compiled and released by Nsibullah Nassim in 2026.

创建时间:
2026-06-24
原始信息汇总

数据集卡片:Instruct Pashto

  • 语言:普什图语(ps)
  • 任务类别:文本生成
  • 标签:医学、指令、聊天
  • 数据集规模:少于10,000条样本(n<10K)

数据集描述

该数据集包含指令式对话数据集的普什图语翻译版本,专门用于微调面向普什图语指令遵循任务的对话式大型语言模型(LLMs)。数据以标准 jsonl 格式存储,每条记录包含一个 messages 列表,列表中的消息依次标注为 userassistant 角色。

数据格式示例

json {"messages": [ {"role": "user", "content": "دې پوښتنې ته ځواب ورکړئ: ..."}, {"role": "assistant", "content": "ځواب 50 دی."} ]}

许可与归属

该数据集源自原始采用 CC BY-SA 3.0 许可的指令数据集。原始来源包括:

  • Wikipedia — CC BY-SA 3.0
  • Dolly (Databricks) — CC BY-SA 3.0
  • MosaicML Instruct-v3 — CC BY-SA 3.0

所有翻译并重新格式化的普什图语内容 © 2026 Nsibullah Nassim

引用

如使用该数据集,请引用:

@misc{instruct_pashto, author = {Nsibullah Nassim}, title = {Instruct Pashto Dataset}, year = {2026}, publisher = {HuggingFace Datasets}, howpublished = {https://huggingface.co/datasets/nassimjp/instruct_pashto}, }

基于:

@misc{mosaicml2023instruct-v3, author = {MosaicML}, title = {MosaicML Instruct-v3 Dataset}, year = {2023}, publisher = {HuggingFace Datasets}, howpublished = {https://huggingface.co/datasets/mosaicml/instruct-v3}, }

搜集汇总
数据集介绍
instruct_pashto 数据集图片
构建方式
Instruct Pashto数据集旨在填补普什图语在指令微调领域的空白,通过将多个优质英文指令对话数据集翻译并重构为普什图语。其构建源自CC BY-SA 3.0许可下的Wikipedia、Databricks Dolly及MosaicML Instruct-v3等资源,由Nsibullah Nassim完成翻译与格式化。数据以标准jsonl格式存储,每条记录包含一个messages列表,严格按照“用户”与“助手”角色交替编排,确保符合大语言模型对话微调的输入规范,从而为普什图语的自然语言理解与生成提供高质量的监督信号。
特点
该数据集聚焦于普什图语这一低资源语言,样本数量小于10K,专为文本生成任务设计,兼顾医疗、指令遵循与通用对话场景。其突出特点在于保留了原始指令数据的对话结构与语义完整性,同时通过专业翻译实现了语言的本土化适配。数据集规模虽小,但来源多样且经过精心筛选,覆盖多领域知识,为训练普什图语大模型提供了稀缺的、结构化对齐的指令数据,显著提升了模型在该语言上的指令执行能力与生成流畅度。
使用方法
使用方法极为简洁,适合直接用于普什图语大语言模型的监督微调。用户可通过Hugging Face Datasets库加载数据,每条样本包含的messages字段可直接作为训练输入,无需额外处理。模型需学习根据用户角色的普什图语指令生成对应的助手回应。建议将数据划分为训练集与验证集,采用标准的因果语言建模损失函数进行优化。由于数据格式与主流对话类数据集一致,亦可轻松集成至如transformers库的Trainer接口中,实现高效微调流程。
背景与挑战
背景概述
Instruct Pashto数据集由Nsibullah Nassim于2026年创建,旨在填补普什图语在指令微调对话数据集领域的空白。随着大语言模型在多语言场景中的广泛应用,低资源语言如普什图语因缺乏高质量的指令数据而难以充分受益于模型微调技术。该数据集通过对Dolly、MosaicML Instruct-v3等公开指令数据集进行普什图语翻译与格式化整理,为普什图语对话式大语言模型的训练提供了标准化资源。其发布不仅推动了普什图语自然语言处理研究,还为低资源语言的模型适配与跨语言迁移学习树立了范例,对促进语言平等与包容性人工智能具有重要价值。
当前挑战
该数据集面临的核心挑战包括:第一,低资源语言的领域适配难题,普什图语在医疗、教育等专业场景中缺乏大规模平行语料,导致指令数据的覆盖范围与深度受限;第二,翻译与对齐质量控制挑战,从英文源数据到普什图语的翻译需兼顾语义准确性与文化适应性,多源性数据格式的统一更增加了预处理复杂度;第三,数据集规模极小(不足万条),在维持对话自然度的同时避免过拟合与泛化能力不足,成为后续模型训练必须突破的瓶颈。
常用场景
经典使用场景
在自然语言处理与低资源语言智能理解领域,Instruct Pashto数据集被广泛用于面向普什图语的指令遵循型对话系统的微调。该数据集以标准化JSONL格式存储,每条样本均由用户与助手的多轮对话构成,专门适配了大规模语言模型在聊天场景下的训练范式。通过对源自Wikipedia、Dolly及MosaicML Instruct-v3等高质量数据源的内容进行普什图语翻译与格式化重构,该数据集为构建能准确理解并回应普什图语用户指令的对话代理提供了珍贵的训练材料,成为低资源语言指令微调研究的代表性基准之一。
衍生相关工作
Instruct Pashto的发布催生了一系列围绕低资源语言指令微调的延伸研究工作。后续工作包括基于该数据集评估与改进多语言大模型(如Llama、BLOOM)在普什图语上的表现,探索数据增强与回译技术对对话质量的影响,以及构建融合医疗领域知识的普什图语专用对话模型。此外,该数据集还被用作对抗性测试集,用于分析模型在多语言混合指令下的稳定性。这些衍生工作不仅深化了对低资源语言指令微调的理解,也为构建更公平、更具包容性的多语言AI系统奠定了数据与实验基础。
数据集最近研究
最新研究方向
当前,低资源语言的大模型指令微调已成为自然语言处理领域的前沿焦点。instruct_pashto数据集的出现,精准契合了普什图语在生成式AI生态中近乎空白的现实,为弥合语言鸿沟提供了关键数据基石。该数据集通过对Dolly、MosaicML Instruct‑v3等高质量英文指令语料的系统化翻译与格式化重构,构建了适配对话式LLM的普什图语指令样本库,有力推动了多语言对齐研究向小语种的纵深拓展。结合全球对语言技术包容性的日益关注——如联合国“国际土著语言十年”倡议——这一资源不仅服务于医疗对话等垂直场景的模型精调,更在技术层面验证了跨语言知识迁移的可行性,其开源共享模式为其他低资源语言社区树立了可复制的范式,具有深远的文化与技术双重意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务