遇见数据集

agriculture-instructions-dataset

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Nepali Source-Grounded Instruction Dataset 是一个基于源文档的合成尼泊尔语指令微调数据集。该数据集由 NVIDIA NeMo Data Designer 工具从权威的尼泊尔语文档(包括农业手册和法律文本)生成,旨在为尼泊尔语的指令微调任务提供高质量、可追溯的训练数据。每条记录均采用聊天格式(messages),包含角色(user/assistant)和内容,并附有元数据(metadata)以及每条记录的质量评分(quality_scores),包括事实依据性(grounding)、正确性(correctness)和自然度(naturalness),评分范围为1-5,由LLM作为评判者自动评定。对于无法回答的问题,模型会明确给出拒绝回答。数据按源文档划分为多个分片文件(data/train-<shard>.jsonl),每次重新运行时会幂等地覆盖原有分片。本仓库仅包含通过质量门控(grounding>=4, correctness>=3, naturalness>=3)的优质训练样本,而被拒绝的样本和评判失败的样本分别存放在 companion 仓库中。该数据集适用于尼泊尔语的自然语言处理研究,特别是基于事实的问答、指令遵循和文本生成等任务。

The Nepali Source-Grounded Instruction Dataset is a synthetic Nepali instruction fine-tuning dataset grounded in source documents. It was generated using the NVIDIA NeMo Data Designer tool from authoritative Nepali language documents, including agricultural manuals and legal texts, to provide high-quality, traceable training data for instruction fine-tuning tasks in Nepali. Each record is in a chat format (messages) with roles (user/assistant) and content, accompanied by metadata and quality scores (grounding, correctness, naturalness) rated 1-5 by an LLM judge. The dataset only includes high-quality samples that pass quality gates (grounding>=4, correctness>=3, naturalness>=3), and is suitable for NLU tasks such as fact-based QA, instruction following, and text generation in Nepali.

创建时间:
2026-09-07
原始信息汇总

数据集概述

该数据集是一个尼泊尔语指令微调数据集,名为 Nepali Source-Grounded Instruction Dataset。它基于权威的尼泊尔语农业手册和法律文本合成生成,用于训练模型遵循指令并基于给定源文档作答。

数据特点

  • 语言:尼泊尔语(ne
  • 任务类型:文本生成(主要用于指令微调)
  • 生成方式:使用 NVIDIA NeMo Data Designer 工具合成生成
  • 数据来源:权威尼泊尔语农业手册和法律文本
  • 数据标注
    • 答案严格基于源文档,若无法从源文档回答则明确拒绝
    • 每条记录包含对话 messages 格式、metadata 元数据,以及基于 LLM-as-judge 的逐条质量评分(quality_scores),涵盖:
      • grounding(基于源文档的程度)
      • correctness(正确性)
      • naturalness(自然度)
    • 各项评分为 1-5 分制

数据结构与文件划分

  • 每个源文档对应一个数据文件:data/train-<shard>.jsonl
  • 文件采用 JSONL 格式
  • 每次重新生成时,分片会被幂等地覆盖(即更换源文档后旧数据可被整体替换)

其他说明

  • 该仓库为 TRAINING(训练)版本,仅保留通过质量筛选的记录,筛选标准为:
    • grounding >= 4
    • correctness >= 3
    • naturalness >= 3
  • 另设有配套仓库,分别存放:
    • 未通过质量筛选的记录(rejected-*
    • 评审调用失败的记录(unjudged-*
搜集汇总
数据集介绍
agriculture-instructions-dataset 数据集图片
构建方式
农业指令数据集(agriculture-instructions-dataset)的构建源自于对权威尼泊尔语文献的系统性挖掘与转化,涵盖农业手册与法律文本,借助NVIDIA NeMo Data Designer这一先进工具,生成了高质量的合成指令数据。每一份源文档均被细致地切分,转化为遵循聊天消息格式的独立记录,并附加丰富的元数据。尤为关键的是,其答案严格扎根于源文档,对于无法回答的问题则明确拒绝,确保了数据的可靠性与严谨性。数据集采用分片存储,每一分片对应一个源文档,且具备幂等覆盖的特性,便于迭代更新。构建过程中,引入了多维度质量评估机制(包括接地性、正确性与自然性),唯有通过预设质量门槛的记录方能被纳入训练集,从而保障了整体数据质量的上乘与均衡。
特点
该数据集的核心特征在于其独特的源文档锚定式生成范式,这确保了每一条指令的回答均具备可追溯的权威依据,极大地提升了数据的可信度。尼泊尔语作为生成语言,填补了非英语指令数据集的空白,为低资源语言的农业及法律领域提供了宝贵的NLP资源。每条记录均携带质量评分,这些评分由LLM-as-a-judge机制产生,涵盖接地性、正确性与自然性三个维度,便于用户按需筛选或加权使用。拒绝应答机制的设计妥善处理了不可回答的查询,增强了模型的鲁棒性。数据集的模块化分片结构,不仅促进了定向任务的应用,也便利了多源文档的组合实验。其分片幂等性设计,确保了数据重现与可比较的评估流程,这对于科研环境的可复现性至关重要。
使用方法
该数据集旨在服务于指令微调任务,用户可直接加载训练分片,利用其丰富的聊天格式记录对语言模型进行精细调优。每条记录的结构化字段,包括‘messages’与‘metadata’,便于集成至诸如HuggingFace Trainer等标准训练流程。质量分数的存在使得研究人员能够依据任务偏好,定制子集划分或实施加权损失函数,以强化特定维度(如自然性)的性能。对于拒绝应答示例,研究者亦可将其纳入对比实验,以评估模型对边界认知的把握。此外,该数据集常作为训练语料,辅以对应的‘rejected’与‘unjudged’分片进行对比分析,从而深化对模型行为与数据质量交互的理解。在使用时,可依据分片文件名映射至具体源文档,为领域知识的迁移应用提供了明确的索引参考。
背景与挑战
背景概述
该数据集由NVIDIA研究团队于近期开发,利用NeMo Data Designer工具,从尼泊尔权威农业手册和法律文本中自动生成合成指令微调数据。数据集针对尼泊尔语农业领域,创建了基于证据的回答机制,确保模型生成内容严格锚定于源文档,对无法回答的问题明确拒绝。其核心研究问题在于缓解低资源语言中领域专用指令数据的稀缺性,推动多语言农业智能系统的发展。该数据集的发布为尼泊尔语自然语言处理提供了高质量基准,促进了低资源语言在实际应用中的进步。
当前挑战
低资源语言尼泊尔语的农业法律交叉领域数据极度匮乏,传统人工构建成本高昂,数据集面临领域问题复杂性及构建挑战。具体而言,源文档涵盖大量专业术语与法律条文,合成数据需精确提取并确保多轮生成中的语义一致性;同时,LLM-as-judge评分机制需平衡主观性与客观性,过滤不合格记录时可能出现误判,影响数据质量。此外,严格拒绝未覆盖问题可能导致模型泛化受限,且数据集规模受限于源文档范围,难以全面覆盖农业领域的动态变化。
常用场景
经典使用场景
该数据集作为尼泊尔语指令微调的核心资源,专为构建农业与法律领域的对话式语言模型而设计。其独特的源文档锚定机制(Source-Grounded)确保了模型生成答案时严格依赖权威资料,有效规避了幻觉现象。研究人员常利用其丰富的指令-响应对,结合质量评分标签,训练模型在多轮对话中保持事实一致性。该数据集的经典使用方式包括:微调预训练语言模型以精准理解尼泊尔语指令,评估模型在低资源语言上的生成鲁棒性,以及作为基准测试集验证检索增强生成(RAG)框架的有效性,尤其在资源匮乏的农业和法律场景下,其价值尤为显著。
解决学术问题
该数据集直面低资源语言(尼泊尔语)在垂直领域(农业和法律)中指令微调数据稀缺的关键难题。通过学术化的构建流程,它解决了模型输出缺乏领域事实依据、幻觉频发以及可解释性不足等长期痛点。数据中的显式拒答机制(unanswerable questions获得拒答)为研究模型不确定性估计和知识边界提供了天然语料。质量评分体系(grounding/correctness/naturalness)支持对生成结果进行多维度量化分析,推动了在低资源场景下关于指令遵循、知识密集型问答以及跨语言泛化的理论探索,其严谨的构建范式也为学术社区的基准测试(benchmarking)提供了可靠基石。
衍生相关工作
该数据集的发布衍生了一系列前沿研究方向,主要包括基于质量门控策略的自动化数据过滤算法,该算法可能进一步发展为通用数据筛选框架。另一个衍生方向是源文档锚定的知识编辑(Knowledge Editing)研究,即利用其grounding标签探究如何在不污染原模型能力的前提下更新或修正语言模型的领域知识。在模型评估层面,受其质量评分启发,研究者可能设计出更细粒度的低资源语言生成评价指标。此外,该数据集还有望促进参数高效微调(如LoRA)在资源受限环境下的效果对比研究,以及多语种指令微调中跨语言迁移能力的分析,这些工作在后续文献中或有着诸多拓展和应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务