Pashto_OrcaCoT
收藏资源简介:
Pashto_OrcaCoT是一个专为普什图语设计的高质量链式思维推理数据集,基于OpenOrca数据集的CoT指令进行普什图语翻译,旨在为低资源语言普什图语提供干净、手工制作且机器优化的监督微调环境,以弥补国际大语言模型基准与普什图语原生人工智能对齐之间的差距。数据集采用严格的零抓取策略精心策划,确保逻辑一致性和深度推理,减少幻觉,数据规模在1万到10万条之间。每条数据记录包含三个字段:instruction(定义行为边界的系统提示或代理角色)、input(普什图语的用户查询、任务陈述或推理谜题)和output(包含逐步推理逻辑和最终答案的黄金标准响应)。该数据集适用于文本生成、指令微调和复杂推理任务,是iPashto.ai引擎的基础推理层,并为高级模型(如即将推出的Qwen3-1.7B-Pashto-Gold管道)提供关键的对齐资产。
Pashto_OrcaCoT is a high-quality chain-of-thought reasoning dataset specifically designed for the Pashto language. It is based on the translation of CoT instructions from the OpenOrca dataset into Pashto, aiming to provide a clean, manually curated, and machine-optimized supervised fine-tuning environment for the low-resource Pashto language, bridging the gap between international large language model benchmarks and native Pashto artificial intelligence alignment. The dataset is meticulously curated with a strict zero-scraping policy to ensure logical consistency and deep reasoning while reducing hallucinations, with a scale between 10,000 and 100,000 entries. Each data record includes three fields: `instruction` (a system prompt or agent role defining behavioral boundaries), `input` (user queries, task statements, or reasoning puzzles in Pashto), and `output` (a gold-standard response containing step-by-step reasoning logic and the final answer). It is suitable for text generation, instruction fine-tuning, and complex reasoning tasks, serving as the foundational reasoning layer for the `iPashto.ai` engine and providing a critical alignment asset for advanced models (such as the upcoming *Qwen3-1.7B-Pashto-Gold* pipeline).
数据集概览:Pashto_OrcaCoT
基本信息
- 数据集名称: Pashto_OrcaCoT
- 许可证: MIT
- 任务类别: 文本生成
- 语言: 普什图语(Pashto,
ps) - 标签: chain-of-thought, reasoning, orca, pashto-ai, instruction-tuning
- 规模: 10K < n < 100K 条样本
数据集描述
Pashto_OrcaCoT 是一个专为普什图语推理优化的高质量链式思维(Chain-of-Thought, CoT)数据集。它是 OpenOrca 数据集中 CoT 指令的普什图语翻译版本,旨在弥合国际大语言模型基准与普什图语原生人工智能对齐之间的差距。该数据集是 iPashto.ai 引擎的基础推理层,也是包括即将推出的 Qwen3-1.7B-Pashto-Gold 管道在内的先进模型的关键对齐资产。
主要特点
- 结构化 CoT: 包含多步骤逻辑显式流程、逐步推理和严格、可验证的格式。
- 普什图语原生对齐: 系统提示和指令完美适配普什图语的细微差别、文化背景和风格准确性。
- 高质量完整性: 经过优化以对抗幻觉、最大化逻辑一致性,并确保在数学、逻辑和常识问答中的深度推理能力。
- 零爬取策略: 通过精确策划,绕过嘈杂的网络爬取,提供黄金标准、可投入生产的指令微调数据。
数据模式
每条记录遵循严格的三字段结构:
| 字段 | 类型 | 描述 |
|---|---|---|
instruction |
string |
定义行为边界的系统提示或代理角色设定。 |
input |
string |
普什图语形式的用户查询、任务陈述或推理难题。 |
output |
string |
包含逐步推理逻辑和最终答案的黄金标准响应。 |
数据示例
json { "instruction": "تاسو د مصنوعي ځیرکتیا (AI) یو مرستیال یاست چې له خلکو سره د معلوماتو په موندلو کې مرسته کوي. کاروونکی له تاسو څخه پوښتنه کوي. ستاسو دنده دا ده چې تر خپله وسه په پوره صداقت ځواب ورکړئ. د ځواب ورکولو پر مهال ګام په ګام فکر وکړئ او د خپل ځواب لپاره منطقي دلایل وړاندې کړئ.", "input": "جیمز د 5 اصلي کرکټرونو او 4 ملاتړي کرکټرونو سره د تلویزیون خپرونه پرمخ وړي. هغه په هر قسط کې د ملاتړي کرکټرونو $ 15,000 تادیه کوي. هغه اصلي کرکټرونه درې چنده ډیر ورکړي. هغه په هره برخه کې څومره پیسې ورکوي؟ راځئ چې د امکان تر حده مشخص وي.", "output": "جیمز د ملاتړ کونکي کرکټرونو په هره برخه کې $15,000 تادیه کوي. له هغه ځایه چې 4 ملاتړي کرکټرونه شتون لري، دا دوی ته په ټوله برخه کې 4 *$ 15,000 = $60,000 ورکوي.
اصلي کرکټرونه درې ځله ډیر تادیه کیږي. نو، هر اصلي کرکټر په هره برخه کې$ 3 * $15,000 =$ 45,000 ترلاسه کوي.
دلته 5 اصلي کرکټرونه دي، نو هغه دوی ته په هر قسط کې 5 * $45,000 =$ 225,000 تادیه کوي.
په مجموع کې، جیمز ته $225,000 (اصلي کرکټرونه) +$ 60,000 (ملاتړي کرکټرونه) = $ 285,000 په هره قسط ورکول کیږي." }
动机与愿景
历史上,像普什图语这样的低资源语言饱受嘈杂、翻译质量低下的数据集之苦,这类数据会削弱大语言模型进行连贯推理的能力。Pashto_OrcaCoT 标志着普什图语 AI 零爬取时代的终结,为监督微调(SFT)提供了一个干净、手工策划且机器优化的环境,目标是让普什图语模型能够执行与英语及其他丰富资源环境相媲美的复杂链式思维推理。
引用与归属
若在研究、模型微调管道或评估基准中使用该数据集,请按以下格式引用:
bibtex @dataset{nassimjp_pashto_orcacot_2026, author = {Nassim}, title = {Pashto_OrcaCoT: A High-Quality Chain-of-Thought Dataset for Pashto Reasoning}, year = {2026}, publisher = {Hugging Face}, journal = {Hugging Face Datasets}, howpublished = {url{https://huggingface.co/datasets/nassimjp/Pashto_OrcaCoT}} }
反馈与协作
如有关于普什图语推理工具和原生大语言模型开发的问题、贡献或合作意向,请在仓库中提交 issue 或通过 iPashto.ai 联系。




