遇见数据集

khmer-qa

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

Khmer Q&A — context-grounded 是一个开源的高棉语问答/指令微调数据集,专门用于微调高棉语问答大语言模型。该数据集由 iAny(离线高棉语AI平台)构建并开源发布,用于监督微调iAny的本地高棉语LLM,也可用于训练更大模型。数据集包含约2,500个样本,每个样本是一个四元组,包含context(事实性高棉语段落,作为基础来源)、question(关于上下文的高棉语问题)、answer(高棉语答案,可能是简短片段或1-3句解释/摘要)以及type(任务类型:extract、explain或summarize)。数据集中混合了不同类型的任务,旨在解决早期仅抽取式数据集导致模型回答过于简略的问题,通过添加完整的explain和summarize答案,教导模型给出完整回答而非仅提取单词。数据构建过程包括:上下文段落来自高棉语维基百科的干净事实性段落;问答对由Qwen2.5-Instruct模型使用少量高棉语提示生成;通过字符5-gram重叠阈值进行接地过滤,确保答案基于上下文(extract类型要求严格,explain和summarize类型要求较宽松),防止虚构事实同时允许释义。该数据集适用于高棉语LLM的监督微调/指令微调,训练模型基于提供的上下文回答问题(RAG风格)。使用时,可从context和question构建训练提示,以answer为目标;type字段可用于分析/平衡,训练器可忽略。数据集为合成生成,答案由模型生成(基于维基百科,未经过人工验证),尽管有接地过滤,仍可能存在噪声;领域为通用/百科全书式(高棉语维基百科)。数据集采用CC-BY-SA-4.0许可证,上下文段落源自高棉语维基百科(CC-BY-SA-4.0),因此数据集继承该许可证并需遵守相同方式共享要求,需注明维基百科来源。

Khmer Q&A — context-grounded is an open-source Khmer question-answering/instruction fine-tuning dataset, specifically designed for fine-tuning Khmer question-answering large language models. The dataset is constructed and open-sourced by iAny (an offline Khmer AI platform) for supervised fine-tuning of iAnys local Khmer LLMs and can also be used to train larger models. It contains approximately 2,500 samples, each consisting of a quadruple with fields: context (factual Khmer paragraphs serving as the source), question (Khmer questions about the context), answer (Khmer answers, which may be short snippets or 1-3 sentence explanations/summaries), and type (task types: extract, explain, or summarize). The dataset mixes different task types to address the issue of overly brief model responses caused by earlier extractive-only datasets, by incorporating complete explain and summarize answers to teach models to provide full responses rather than just extracting words. The data construction process includes: context paragraphs sourced from clean factual passages of Khmer Wikipedia; question-answer pairs generated by the Qwen2.5-Instruct model using few-shot Khmer prompts; and grounding filtering via character 5-gram overlap thresholds to ensure answers are based on the context (strict for extract types, more lenient for explain and summarize types), preventing factual fabrication while allowing paraphrasing. This dataset is suitable for supervised fine-tuning/instruction fine-tuning of Khmer LLMs, training models to answer questions based on provided context (RAG-style). In use, training prompts can be constructed from context and question, with answer as the target; the type field can be used for analysis/balancing and may be ignored by trainers. The dataset is synthetically generated, with answers produced by models (based on Wikipedia, without human verification), and may contain noise despite grounding filtering; the domain is general/encyclopedic (Khmer Wikipedia). It is licensed under CC-BY-SA-4.0, with context paragraphs derived from Khmer Wikipedia (CC-BY-SA-4.0), so the dataset inherits this license and requires compliance with share-alike terms, with attribution to Wikipedia sources.

创建时间:
2026-07-14
原始信息汇总

数据集概述:Khmer Q&A (context-grounded)

  • 数据集名称: Khmer Q&A (context-grounded)
  • 许可证: CC-BY-SA-4.0
  • 语言: 高棉语 (km)
  • 任务类型: 问答 (question-answering)、文本生成 (text-generation)
  • 规模: 约 2,500 条样本 (1K < n < 10K)
  • 标签: khmer, question-answering, instruction-tuning, sft, synthetic, rag, iany

数据集内容

数据集包含单个 JSON 文件 data.json,每条记录是一个 (context, question, answer) 三元组,答案基于上下文生成。每条记录包含以下字段:

字段 类型 描述
context 字符串 高棉语事实性段落(作为答案的依据)
question 字符串 关于上下文的提问(高棉语)
answer 字符串 答案:短片段或 1–3 句解释/总结(高棉语)
type 字符串 任务类型:extract(提取)、explain(解释)、summarize(总结)

示例: json { "context": "ភ្នំពេញ គឺជារាជធានីរបស់ប្រទេសកម្ពុជា。", "question": "តើរាជធានីរបស់កម្ពុជាឈ្មោះអ្វី?", "answer": "ភ្នំពេញ", "type": "extract" }

构建方式

  • 来源: 高棉语维基百科的干净事实性段落(wikimedia/wikipedia20231101.km 版本)。
  • 生成方法: 使用 Qwen2.5-Instruct(7B / 14B)模型,配合少样本高棉语提示,按任务类型分别生成问答对。
  • 过滤机制: 每个答案必须与上下文有足够的字符 5-gram 重叠(extract 严格,explain/summarize 宽松),以排除编造内容,同时允许改写。

完整构建流程见:github.com/sengtha/iAny · docs/BUILD-KHMER-QA-DATASET.md

加载方式

python from datasets import load_dataset ds = load_dataset( "json", data_files="https://huggingface.co/datasets/sengtha/khmer-qa/resolve/main/data.json", split="train", ) print(ds[0])

预期用途

  • 用于高棉语大语言模型的监督微调(SFT) / 指令微调,使模型能在给定上下文中进行基于依据的问答。
  • 训练时可将 context + question 组成提示,answer 作为目标;type 字段可用于分析或平衡,训练时可忽略。

局限性与负责任使用

  • 合成数据:答案由模型生成(基于维基百科,未经人工验证),尽管有过滤机制,仍可能存在噪音。使用前建议抽样检查。
  • 领域限制:内容为通用/百科全书性质(高棉语维基百科)。如需特定领域问答,建议自行补充领域段落。
  • 非基准/事实真理来源:本数据集仅用于 SFT 训练,不适用于评估或作为真实事实来源。

许可与归属

  • 采用 CC-BY-SA-4.0 许可证:上下文段落源自高棉语维基百科(同样为 CC-BY-SA-4.0),因此数据集继承该许可证,使用时需注明维基百科并共享衍生作品。
  • Q&A 使用 Qwen2.5(Apache-2.0)生成。
  • iAny(E-KHMER Technology)构建并开源发布。
搜集汇总
数据集介绍
khmer-qa 数据集图片
构建方式
在自然语言处理与高棉语人工智能的交汇处,面向特定语种的指令微调数据集显得弥足珍贵。khmer-qa数据集正是为此而生,其构建过程严谨且富有匠心。首先,数据源选自2023年11月1日版本的Khmer Wikipedia,提取其中干净且事实性的段落作为上下文。随后,利用Qwen2.5-Instruct模型(7B或14B参数规模)结合少样本高棉语提示,针对三种任务类型——提取、解释与总结——分别生成问答对。为保障答案的忠实性,研究团队引入基于字符5-gram的覆盖度过滤器,对提取型任务执行严格阈值,对解释与总结型任务适当放宽,从而在允许释义的同时有效抑制模型杜撰,最终形成约2500条高质量三元组。
特点
该数据集的核心特色在于其刻意设计的任务类型混合策略,这源自对早期仅含提取型问答模型倾向于输出单词语符之弊病的反思。通过融合提取、解释与总结三类任务,数据集旨在教导模型在检索增强生成(RAG)场景中给出完整且语义丰富的答案,而非机械地抓取片段。每个样本均以上下文、问题与答案的三元组形式呈现,答案严格锚定于上下文,确保了事实基础。此外,数据集包含一个类型字段,便于对训练样本进行细致分析与类别平衡,从而在高棉语指令微调中实现更全面的语言理解与生成能力。
使用方法
使用该数据集进行高棉语大语言模型的监督式微调(SFT)或指令微调极为便捷。用户可通过HuggingFace的datasets库加载单个JSON文件,利用load_dataset函数指定训练集即可获得约2500条样本。在训练过程中,建议将上下文与问题拼接为提示,以答案为监督目标;而类型字段主要用于数据分析和类别均衡,训练时可忽略。该数据集特别适合用于构建面向设备的离线高棉语问答系统,亦可作为RAG管线中检索后理解环节的训练基石,研究者还可根据自身领域需求,混入特定领域的语料以拓展数据集的适用范围。
背景与挑战
背景概述
khmer-qa数据集由柬埔寨人工智能平台iAny于2024年创建,旨在为高棉语大语言模型提供监督式微调训练数据。该数据集围绕上下文锚定的问答任务构建,包含约2500条由高棉语维基百科段落生成的(上下文、问题、答案)三元组,涵盖提取、解释与摘要三类任务。其研发核心在于解决低资源语言高棉语在人工智能领域的数据匮乏问题,通过合成数据策略推动本地化大语言模型的落地应用。作为首批开源的高棉语文档问答指令数据集,khmer-qa对促进东南亚语言自然语言处理研究、降低非英语语言模型部署门槛具有重要意义。
当前挑战
该数据集面临的核心领域挑战在于低资源语言高棉语的模型训练困境:一方面,高棉语缺乏大规模高质量标注数据,传统人工构建方式成本高昂且难以扩展;另一方面,现有自然语言处理模型多基于资源丰富语言开发,直接迁移至高棉语时存在语法结构差异与词汇稀疏性问题。在构建过程中,数据集采用Qwen2.5模型合成问答对,并设计字符级5-gram重叠过滤机制以抑制幻觉,但合成数据因缺乏人工验证仍存在噪音与事实错误风险,且维基百科语料覆盖范围有限,难以支撑特定领域(如法律、医疗)的问答任务,需要进一步扩展领域知识来源以确保模型泛化能力。
常用场景
经典使用场景
在低资源语言自然语言处理领域,khmer-qa数据集为高棉语问答系统与指令微调提供了宝贵资源。该数据集包含约2500条由上下文、问题和答案构成的三元组,其中答案严格基于上下文生成,涵盖了抽取式、解释式和摘要式三种任务类型。研究者可将其用于监督式微调高棉语大语言模型,使模型学会从给定段落中精准提取或生成答案,特别适用于检索增强生成(RAG)场景下的模型训练,有效提升模型在高棉语环境下的上下文理解与回答能力。
衍生相关工作
khmer-qa数据集的发布催生了一系列相关研究工作。其构建技术路线——基于Wikipedia段落、利用大语言模型(Qwen2.5-Instruct)通过少样本提示生成问答对、并辅以字符级重叠过滤——为其他低资源语言的问答数据集构建提供了可复现的范本。研究社区可借鉴其混合任务类型的设计理念,开发更全面的指令微调数据。此外,围绕该数据集衍生了针对高棉语RAG系统的评估基准研究,以及探索模型在合成数据上的泛化能力与迁移学习的相关工作,进一步推动了高棉语自然语言处理技术的进步。
数据集最近研究
最新研究方向
在高棉语自然语言处理领域,khmer-qa数据集的出现标志着低资源语言中检索增强生成(RAG)与指令微调技术的深度融合。当前研究前沿聚焦于如何利用该合成数据集训练高棉语大语言模型,使其在离线设备上实现基于上下文的精准问答。尤其值得关注的是,该数据集通过混合抽取型、解释型和摘要型任务,解决了纯抽取模型回答过于简短的固有问题,为开发高棉语智能助手IAny提供了关键训练资源。随着东南亚数字主权议题升温,该工作不仅推动了高棉语AI的自主可控,也印证了合成数据在填补低资源语言训练空白中的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务