遇见数据集

Gurpreet-Singh-Punjabi-Gurmukhi-Instruction-Corpus

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

旁遮普语(古木基文)指令数据集是一个真实、基于来源的问答指令数据集,旨在帮助缩小人工智能领域的旁遮普语差距。该数据集由Gurpreet Singh创建,以支持构建旁遮普语工具、教程或应用程序的开发人员。数据集包含3,874个高质量样本,每个样本都基于一个真实的来源段落:这些段落随机选自旁遮普语维基百科(pa.wikipedia.org)文章,或从真实的STEM类别(如计算机科学、量子力学、神经科学、数学、物理学、天文学等)的英语维基百科文章翻译并流畅地转述为古木基文旁遮普语。数据集的构建确保了模型的任务是基于给定事实进行表述/翻译,而非依赖记忆回忆,从而减少了幻觉。数据构成包括约1,307行STEM类别和约2,567行通用知识类别(如历史、地理、文化、传记、时事等),混合类别旨在避免数据偏向于传记或琐事。每个数据行包含以下字段:唯一标识符(id)、类别标签(STEM、general或早期试点特定标签)、来源文章标题(source_title)、用作事实依据的真实来源段落(source_extract)、古木基文问题(instruction)、古木基文答案(output)以及生成该行所使用的模型(model)。生成模型包括gpt-oss-120b-medium、gemini-3.6-flash-high、claude-sonnet-4-6以及早期试点批次。数据集经过严格的质量控制:包括古木基文有效性验证(使用Unicode范围验证器检查是否为真正的古木基文字符)、基于嵌入余弦相似度(阈值0.92)的真实语义去重(捕获近重复内容而非仅字符串重复)、语法/拼写校正处理,以及人工随机抽查以确保流畅性、事实依据和避免幻觉。已确认数据集中不存在完全相同的字符串重复行。已知局限性包括:并非每一行都经过单独人工审核(进行了抽查但非穷举)、类别标签为近似值、来源文本基于维基百科(适用于通用知识,不能替代领域特定或经过安全审查的语料库)。该数据集基于CC BY-SA 4.0许可证发布,因为其依据的事实来源于维基百科(CC BY-SA)。适用任务包括文本生成和问答,特别适用于低资源语言(旁遮普语)的指令微调、AI助手开发和教育应用。

The Punjabi (Gurmukhi) Instruction Dataset is a real, source-grounded question-answering instruction dataset designed to help narrow the Punjabi language gap in the field of artificial intelligence. Created by Gurpreet Singh, this dataset supports developers building Punjabi-language tools, tutorials, or applications. It contains 3,874 high-quality samples, each based on a real source passage: these passages are randomly selected from Punjabi Wikipedia (pa.wikipedia.org) articles, or translated and fluently paraphrased into Gurmukhi Punjabi from English Wikipedia articles belonging to real STEM categories including Computer Science, Quantum Mechanics, Neuroscience, Mathematics, Physics, Astronomy, etc. The dataset is constructed to ensure that the model’s task is to formulate or translate based on given facts rather than relying on memorized recall, thereby reducing hallucinations. The dataset consists of approximately 1,307 entries in STEM categories including Computer Science, Physics, Quantum Mechanics, etc., and about 2,567 entries in general knowledge categories including History, Geography, Culture, Biography, Current Affairs, etc.; the mixed categories are designed to avoid data bias towards biography or trivial facts. Each data entry includes the following fields: unique identifier (id), category label (STEM, general, or early pilot-specific labels), source article title (source_title), real source passage used as factual basis (source_extract), Gurmukhi script question (instruction), Gurmukhi script answer (output), and the model used to generate this entry (model). The generation models include gpt-oss-120b-medium, gemini-3.6-flash-high, claude-sonnet-4-6, and early pilot batches. The dataset has undergone strict quality control, including Gurmukhi validity verification (using a Unicode range validator to check for genuine Gurmukhi characters), true semantic deduplication based on embedding cosine similarity with a threshold of 0.92 (which captures near-duplicate content rather than just string duplicates), grammar and spelling correction processing, and manual random spot checks to ensure fluency, factual grounding, and avoidance of hallucinations. No identical string duplicate entries have been confirmed in the dataset. Known limitations include: not every entry has undergone separate manual review (spot checks were conducted but not exhaustive), category labels are approximate, and source text is based on Wikipedia, which is suitable for general knowledge but cannot replace domain-specific or safety-reviewed corpora. This dataset is released under the CC BY-SA 4.0 license, as its factual sources originate from Wikipedia which uses the CC BY-SA license. Applicable tasks include text generation and question answering, and it is particularly suitable for instruction fine-tuning of low-resource languages (Punjabi), AI assistant development, and educational applications.

创建时间:
2026-07-25
原始信息汇总

数据集概述:Punjabi (Gurmukhi) Instruction Dataset

基本信息

  • 数据集名称:Punjabi (Gurmukhi) Instruction Dataset — Real, Source-Grounded
  • 许可证:CC BY-SA 4.0
  • 语言:旁遮普语(Gurmukhi 文字)
  • 语言种类:单语
  • 任务类型:文本生成、问答
  • 数据格式:JSON
  • 数据规模:1,000 < 样本数 < 10,000(实际为 3,874 行
  • 标签:旁遮普语、Gurmukhi、指令、问答、低资源语言

数据集内容

  • 每个问答对都基于真实来源段落,来源包括:
    • 旁遮普语维基百科(pa.wikipedia.org)文章
    • 英语维基百科文章(计算机科学、量子力学、神经科学、数学、物理学、天文学等 STEM 领域),经翻译并用流利的古木基文表达
  • 每一行均包含 source_titlesource_extract 字段,可自行验证答案与来源的一致性

数据构成

  • STEM 行:约 1,307 行(计算机科学、物理学、量子力学、神经科学、数学、天文学、化学、工程学等)
  • 一般知识行:约 2,567 行(历史、地理、文化、人物传记、时事等),与 STEM 行有意混合,避免数据集偏向纯传记/琐事类内容
  • 生成模型(每行记录在 model 字段中):
    • gpt-oss-120b-medium:2,824 行
    • gemini-3.6-flash-high:685 行
    • claude-sonnet-4-6:2 行
    • 早期试点批次(未记录模型):363 行

数据质量检查

  1. 古木基文字有效性:使用 Unicode 范围验证器检查每个问答是否包含真正的古木基文字内容,拒绝乱码/非文字输出
  2. 语义去重:使用 nomic-embed-text 嵌入向量进行余弦相似度检查(阈值 0.92),检测近重复内容而非仅精确字符串重复
  3. 语法纠正:答案在保存前经过旁遮普语语法/拼写纠正
  4. 人工抽查:在扩展的每个阶段,由人工完整阅读多个随机样本(非仅前 N 行),检查流畅性、事实基础性和幻觉缺失
  5. 确认:整个数据集中零个精确字符串重复行

已知局限性

  • 并非每一行都经过单独人工审查(3,874 行规模下抽查全面但未穷尽)
  • 类别标签为近似值(STEM 与 general 分类);少量早期试点行保留更具体的旁遮普语类别标签
  • 来源文本源自维基百科,适合一般知识,不能替代特定领域或安全性审查的语料库
  • 此为 v1 版本,如有更多真实生成能力,后续可能推出更大、进一步验证的版本

数据集字段说明

字段 描述
id 行标识符
category STEMgeneral 或早期试点特定标签
source_title 该行所依据的维基百科文章标题
source_extract 用作事实依据的真实来源段落
instruction 问题(使用古木基文)
output 答案(使用古木基文)
model 生成该行的模型名称

使用方式

python from datasets import load_dataset ds = load_dataset("Nam-toon-studio/Gurpreet-Singh-Punjabi-Gurmukhi-Instruction-Corpus")

搜集汇总
数据集介绍
Gurpreet-Singh-Punjabi-Gurmukhi-Instruction-Corpus 数据集图片
构建方式
该数据集由Gurpreet Singh构建,旨在弥补旁遮普语在主流AI助手(如Claude、Gemini、GPT)中支持不足的空白。与先前声称包含10万行但实则内容空洞的版本不同,新版本以真实信息为核心,共包含3,874条问答对。每条指令均基于来源段落,随机选自旁遮普语维基百科文章或英语STEM领域文章,经翻译和改写为流利的古木基文。为确保准确性,生成过程依赖源文本而非模型记忆,并明确记录每条数据使用的模型(如gpt-oss-120b-medium、gemini-3.6-flash-high等)。每个样本均提供source_title和source_extract字段,便于用户核实信息。
特点
数据集具有多项质量控制特点:首先,通过Unicode范围校验器确保所有问题和答案均为真实的古木基文字符。其次,利用nomic-embed-text嵌入向量进行语义去重,以余弦相似度阈值0.92排除内容近似的重复行,而非仅检测字符串完全相同。此外,答案在保存前经历旁遮普语语法拼写校正,并经过人工抽样检查以评估流畅度、事实依据及幻觉现象。最终确认全数据集中无完全相同的字符串重复行。分类上,约1,307条STEM领域数据与2,567条常识类数据混合,避免偏重传记或琐事。
使用方法
使用该数据集需通过HuggingFace的datasets库加载:`from datasets import load_dataset; ds = load_dataset('Nam-toon-studio/Gurpreet-Singh-Punjabi-Gurmukhi-Instruction-Corpus')`。数据以JSON格式存储,包含id、category、source_title、source_extract、instruction、output和model共七个字段。用户可选取instruction和output字段用于文本生成或问答微调任务,亦可结合source_title和source_extract验证答案的真实来源。数据集采用CC BY-SA 4.0许可协议,归因于维基百科贡献者及编译者。需注意,该版本为v1,尚未逐行人工审核,且源文本源自维基百科,不适用于专业领域或安全审查场景。
背景与挑战
背景概述
该数据集名为Gurpreet-Singh-Punjabi-Gurmukhi-Instruction-Corpus,由Gurpreet Singh于近期创建,旨在弥合旁遮普语在人工智能领域的空白。鉴于主流AI助手(如Claude、Gemini、GPT)对旁遮普语支持不足,该数据集专注于旁遮普语(古穆基文)的指令微调与问答任务。核心研究问题在于为低资源语言构建高质量、真实来源的语料库,以推动旁遮普语AI工具的发展。通过整合维基百科文章(涵盖STEM与常识知识)作为事实基础,并经过严格的脚本验证、语义去重与语法校正,该数据集提供了3,874条真实、可追溯的问答对。其影响力在于为旁遮普语的自然语言处理研究提供了可靠的基准数据,促进了低资源语言在人工智能领域的公平性与可及性。
当前挑战
该数据集所面临的挑战主要体现在领域问题与构建过程两方面。领域问题方面,旁遮普语作为低资源语言,面临模型记忆不足、生成内容易出现幻觉(如自创词汇)等核心困境。数据集通过源文本接地策略,将问答锚定于真实维基百科段落,有效缓解了此问题。构建过程方面,挑战包括:1)数据质量的把控——需在有限资源下确保古穆克文字符的有效性,通过Unicode范围验证器过滤乱码输出;2)语义去重的实现——采用嵌入向量余弦相似度阈值(0.92)检测近重复内容,而非仅依赖精确字符串匹配,以防止模板化数据泛滥;3)人工审核的局限性——虽进行多次随机抽检,但3,874条数据未能完全实现逐条人工复核,需依赖自动化流程与抽样结合的策略。这些挑战共同塑造了该数据集的独特优化方向。
常用场景
经典使用场景
在低资源语言自然语言处理领域,Gurpreet-Singh-Punjabi-Gurmukhi-Instruction-Corpus 提供了一个珍贵的真实、来源可溯的旁遮普语(古木基文)指令数据集。其经典使用场景集中于构建与微调面向旁遮普语的大语言模型,特别是在文本生成与问答任务中。研究者可借助该数据集的3,874条高质量问答对,对通用多语言模型进行指令微调,使其掌握旁遮普语的句法结构与语义表达,从而弥合主流AI系统对旁遮普语支持的空白。该数据集特别强调每条指令均锚定于维基百科的真实文本段落,有效防止了模型在低资源环境下常见的幻觉问题。
解决学术问题
该数据集直面低资源语言在学术研究中的核心困境:训练数据稀缺、质量参差不齐以及模型幻觉频发。它通过严格的数据清洗流程——包括古木基文字符有效性校验、基于嵌入向量的语义去重(余弦相似度阈值0.92)、语法纠正以及人工抽检——为研究者提供了一个可信任的基准。这解决了以往旁遮普语数据集因大量模板化填充导致的语义空洞问题,使得学术探索能够聚焦于真正的语言理解与生成能力。其意义在于为低资源语言NLP研究树立了质量优先的范式,证明了在数据量有限的情况下,通过来源锚定与严谨质控仍可支撑有效的模型训练,从而推动多语言AI公平性的理论发展。
衍生相关工作
该数据集衍生出的相关工作主要体现在低资源语言数据构建方法论与模型评估基准的开拓上。其强调的‘来源锚定’(source-grounded)策略激励了后续研究探索如何利用维基百科等开放知识库为小语种生成高保真指令数据。此外,数据集嵌入去重与脚本验证的质控流程已成为构建庞大小语种语料库时的参考范例。在此基础上,已有工作尝试迁移其方法至其他旁遮普语方言或其他印度-雅利安低资源语言,验证了该范式在跨语言场景下的可推广性,并推动了关于如何平衡数据量、质量与来源可靠性的学术讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务