遇见数据集

unjudged-agriculture-instructions-dataset

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是一个面向尼泊尔语的、基于权威文档的合成指令微调数据集,名为“Nepali Source-Grounded Instruction Dataset — UNJUDGED”。数据集由 NVIDIA NeMo Data Designer 从尼泊尔农业手册和法律文本等权威文档中自动生成,旨在提供严格基于源文档的问答对。对于无法回答的问题,模型会明确拒绝回答,确保答案的可靠性。每条记录采用聊天消息格式(messages),并附带元数据(metadata)和每条记录的质量评分(quality_scores),评分维度包括 grounded(基于来源的程度)、correctness(正确性)和 naturalness(自然度),评分范围为1-5,由 LLM 作为评判者自动生成。数据以 JSONL 格式存储,每个源文档对应一个 shard 文件(data/train-<shard>.jsonl),重新运行时幂等地覆盖。注意:当前数据集中所有对话的 quality_scores 均为 null,这是因为 LLM 评判调用失败。在使用前必须重新进行评判,切勿直接用于指令微调。

This dataset is a Nepali-language synthetic instruction-tuning dataset, named Nepali Source-Grounded Instruction Dataset — UNJUDGED. It is automatically generated by NVIDIA NeMo Data Designer from authoritative documents such as Nepali agricultural manuals and legal texts, aiming to provide question-answer pairs strictly grounded in the source documents. For unanswerable questions, the model explicitly refuses to answer, ensuring answer reliability. Each record is in chat message format (messages) with metadata and per-record quality scores (quality_scores). The quality scores include dimensions of groundedness, correctness, and naturalness, each rated from 1 to 5, automatically generated by an LLM as a judge. The data is stored in JSONL format, with one shard file per source document (data/train-<shard>.jsonl), and is overwritten idempotently upon re-run. Note: Currently, all quality_scores in the dataset are null due to a failure in the LLM judge invocation. Re-evaluation must be performed before use; do not directly use this dataset for instruction tuning.

创建时间:
2026-09-07
原始信息汇总

数据集概述

该数据集是一个尼泊尔语(Nepali)源文本接地指令数据集(UNJUDGED),由 NVIDIA NeMo Data Designer 工具根据权威尼泊尔文档(包括农业手册和法律文本)合成生成。

核心特性

  • 语言:尼泊尔语(ne
  • 任务类型:文本生成(text-generation
  • 数据格式
    • 采用聊天式 messages 结构
    • 每条记录包含 metadata 元数据
    • 记录附带 quality_scores 质量评分(涵盖接地性、正确性和自然度,评分为1-5,由 LLM 作为裁判生成)

数据内容与生成方式

  • 来源文档:权威的农业与法律领域尼泊尔文档
  • 答案生成规则
    • 回答严格基于来源文本(接地式生成)
    • 对于无法回答的问题,会明确给出拒绝回答的表述
  • 文件组织:每个来源文档对应一个数据分片文件 data/train-<shard>.jsonl,重新运行时分片会以幂等方式覆盖

重要使用警告

  • 部分生成对话因 LLM 裁判调用失败而导致 quality_scoresnull
  • 使用前必须重新进行质量审查(re-judge)
  • 不建议直接用于指令微调,需先行处理后再使用
搜集汇总
数据集介绍
unjudged-agriculture-instructions-dataset 数据集图片
构建方式
在自然语言处理与农业法律交叉领域,构建高质量指令数据集是提升模型专业能力的关键。此数据集源自尼泊尔权威文件,涵盖农业手册与法律文本,通过NVIDIA NeMo Data Designer工具合成生成。构建过程严格确保答案仅基于源文档内容,对于无法回答的问题则明确予以拒绝,以此保障数据的可靠性与专业性。数据以对话messages格式存储,并附有元数据及每条记录的质量评分,评分由LLM-as-judge模型从接地性、正确性与自然性三个维度给出(1-5分)。每个源文件对应一个独立数据分片,且重新运行时分片会被幂等地覆盖,保证了数据生成的可复现性。
特点
该数据集的核心特质在于其源接地性与严谨的质量控制机制。每一条指令的回答均严格锁定在原始文档语义范围内,杜绝生成无据内容,显著降低了模型产生幻觉输出的风险。同时,LLM-as-judge评分机制从多维度量化了数据质量,为用户筛选高质量样本提供了客观依据。数据按文档分片组织,便于按领域关联性进行训练或评估,且采用聊天格式与元数据结构,兼具现代指令微调框架的兼容性与法律农业领域知识的权威性,整体设计体现了科学性与实用性的高度统一。
使用方法
使用此数据集前,务必注意其特殊状态:部分对话因LLM评判调用失败而缺失质量评分,需先进行重新评判后方可启用,严禁直接用于指令微调。经过完整质量评估后,该数据可应用于对尼泊尔语农业或法律领域的模型训练,以增强模型对专业术语的理解与源引用能力。推荐按照每个源文档对应的独立分片进行任务划分,以支持领域聚焦的增量训练或基准测试。数据格式与主流指令微调框架兼容,可便捷地转换为所需模板,同时保留元数据与质量评分以支持动态样本筛选,从而实现高效、可靠的下游应用。
背景与挑战
背景概述
该数据集名为'unjudged-agriculture-instructions-dataset',由NVIDIA NeMo Data Designer工具生成,旨在构建尼泊尔语指令调优数据。其核心研究问题在于利用权威尼泊尔语文档(农业手册、法律文本)生成有据可依的合成指令数据,以支持低资源语言(尼泊尔语)的自然语言处理研究。该数据集创建于近期,主要研究人员或机构为NVIDIA及相关合作方,其影响力体现在为农业和法律领域的尼泊尔语指令调优提供了高质量数据基础,填补了该语言资源匮乏的空白。数据集的构建依托权威来源,确保答案严格基于原文,并包含质量评分机制,体现了对数据可靠性和可复现性的重视,对多语言指令调优研究具有潜在推动价值。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:农业和法律领域的尼泊尔语指令调优需要模型准确理解专业术语和上下文,而低资源语言的语料稀缺加剧了训练难度。其次,构建过程中面临多重挑战:合成数据生成需严密确保答案与源文档的严格对齐,防止信息偏差;LLM-as-judge的质量评估流程可能因调用失败导致部分记录缺乏有效的质量评分,即数据集中存在'quality_scores'为null的记录,这要求用户在使用前必须重新进行评判,否则无法直接用于指令调优,增加了数据预处理和验证的负担。此外,分片重写的幂等性设计虽利于更新,但原始文档多样性与对话自然度的平衡仍是一大难点。
常用场景
经典使用场景
该数据集为尼泊尔语指令微调研究提供了珍贵的资源,其核心场景在于构建和评估低资源语言下的农业与法律领域问答系统。研究者可基于其源文档锚定的对话结构,开发能够严格引用权威资料生成回答的模型,同时验证模型对无法回答问题进行明确拒绝的能力,从而推动多语言、领域专属指令数据的构建与评测方法论发展。
衍生相关工作
围绕此数据集,可衍生多项经典工作:包括基于其元数据与质量分数开展多任务学习优化,以增强模型对答案的置信度估计;利用其源文档锚定特性,研究检索增强生成中的证据对齐技术;以及针对其尼泊尔语特性,探索跨语言指令跟随与代码混合的迁移学习策略。此外,其可复现的合成管道也为构建其他低资源领域指令集树立了范例,催生一系列关于高质量数据生成与质量评估方法的研究。
数据集最近研究
最新研究方向
该数据集聚焦于尼泊尔语农业与法律领域的大语言模型指令微调,采用基于权威文献的合成数据和严格源文本锚定的回答生成策略。当前前沿研究方向包括低资源语言指令数据的高质量构建、无依据查询的拒答机制设计,以及通过LLM-as-judge对生成样本进行多维度质量评估(涵盖grounding、正确性与自然度)。值得注意的是,该数据集的‘未判定’状态(缺失质量评分)提示了合成数据管线中评估环节的不确定性,驱动了关于数据质量控制、可复现性及模型训练前再判定流程的深入探讨。此类源基数据集的涌现,对推动尼泊尔语AI助手在农业知识普及和法律文本理解中的应用具有重要意义,同时为跨语言、跨领域的可信指令数据集建设提供了范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务