遇见数据集

unjudged-nepali-law-v2

收藏
Hugging Face2026-09-14 更新2026-09-15 收录
官方服务:

资源简介:

该数据集是一个基于尼泊尔语、以权威文档为来源的合成指令数据集,名称为“Nepali Source-Grounded Instruction Dataset — UNJUDGED”。它由 NVIDIA NeMo Data Designer 工具生成,源文档涵盖农业手册和法律文本。数据集中每条记录包含对话消息(messages 格式)、元数据(metadata)以及每个记录的质量评分(quality_scores),评分包括 grounding(遵循源文档程度)、correctness(正确性)、naturalness(自然度),均为 1-5 分,由 LLM 作为评判者自动生成。答案严格基于提供的源文档内容;对于无法从源文档中回答的问题,模型会给出明确的拒绝回答。数据以 JSONL 格式按源文档分片存储(data/train-<shard>.jsonl),每次重新生成时会幂等地覆盖原有分片。需要注意的是,如果 LLM 评判调用失败,对应记录的 quality_scores 字段为 null。因此,该数据集在用于指令微调之前,必须重新进行质量评判,不能直接原样使用。

This dataset is a synthetic instruction dataset grounded in authoritative documents in Nepali, named "Nepali Source-Grounded Instruction Dataset — UNJUDGED". It is generated by the NVIDIA NeMo Data Designer tool, with source documents covering agricultural manuals and legal texts. Each record in the dataset contains conversational messages (in the messages format), metadata, and quality scores (grounding, correctness, naturalness) on a 1-5 scale, automatically generated by an LLM as a judge. Answers are strictly based on the provided source documents; for questions that cannot be answered from the source, the model gives a clear refusal. Data is stored in JSONL format sharded by source (data/train-<shard>.jsonl), and regeneration idempotently overwrites existing shards. Note that if the LLM judge call fails, the quality_scores field will be null. Therefore, before using this dataset for instruction fine-tuning, it must be re-evaluated for quality and cannot be used as-is.

创建时间:
2026-09-13
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Nepali Source-Grounded Instruction Dataset — UNJUDGED
  • 数据集地址:https://huggingface.co/datasets/aarajbhattarai/unjudged-nepali-law-v2
  • 语言:尼泊尔语(ne)

任务类别

  • 文本生成(text-generation)

标签

  • nepali
  • instruction-tuning
  • agriculture
  • legal
  • synthetic
  • grounded

数据集内容

  • 使用 NVIDIA NeMo Data Designer 生成的合成尼泊尔语指令微调数据。
  • 数据源自权威尼泊尔语文档,包括农业手册和法律文本。
  • 答案严格基于源文档,无法回答的问题会给出明确的拒绝回复。
  • 记录采用聊天 messages 格式,并附带 metadata 以及每条记录的 quality_scores(基于 grounding / correctness / naturalness 三个维度,评分范围 1-5,由 LLM-as-judge 评判)。
  • 每个源文档对应一个 data/train-<shard>.jsonl 文件;在重新运行时,分片会被幂等地覆盖。

注意事项

  • 数据集中包含 LLM-judge 调用失败的生成对话,其 quality_scores 为 null。
  • 在任何使用前必须重新进行评判(Re-judge)。
  • 请勿直接用于指令微调(instruction tuning)。
搜集汇总
数据集介绍
unjudged-nepali-law-v2 数据集图片
构建方式
在尼泊尔语自然语言处理资源匮乏的背景下,该数据集借助NVIDIA NeMo Data Designer工具,从农业手册与法律文本等权威尼泊尔语文档中合成指令微调数据。构建过程严格遵循来源锚定原则,以源文档为唯一依据生成问答对,对无法从源文档中找到答案的问题则输出明确的拒答响应。数据以聊天消息格式记录,并附带元数据及逐条质量评分,评分涵盖锚定度、正确性与自然度三个维度,由LLM作为评判者进行1至5分评定。每条源文档对应一个训练分片文件,分片在重复运行时以幂等方式覆盖。
特点
该数据集聚焦尼泊尔语指令微调场景,覆盖农业与法律两大垂直领域,具有鲜明的来源锚定与合成生成属性。记录采用聊天消息格式,便于直接适配对话式模型训练流程,同时附带元数据和逐条质量评分,为数据筛选与质量分析提供细粒度依据。其显著特点在于对不可回答问题施加显式拒答机制,有效抑制模型幻觉。需特别注意的是,部分生成对话的LLM评判调用失败,导致质量评分为空值,因此数据在使用前须重新进行质量评判。
使用方法
该数据集面向尼泊尔语文本生成与指令微调任务,使用时需先对质量评分为空值的记录重新执行LLM评判,确认评分有效后方可纳入训练流程。数据按源文档分片存储于data目录下,每分片对应一个JSONL文件,加载后可依据质量评分设定阈值筛选高质量样本。鉴于数据集明确声明不可直接用于指令微调,建议在完成重新评判与必要清洗后,将其作为尼泊尔语领域适配的辅助训练资源,并结合人工审核以保障下游应用效果。
背景与挑战
背景概述
尼泊尔语作为低资源语言,长期缺乏高质量指令微调数据,制约了本地化大语言模型的发展。为弥补这一缺口,研究人员基于NVIDIA NeMo Data Designer框架,从农业手册与法律文本等权威尼泊尔语文档中合成指令数据,构建了unjudged-nepali-law-v2数据集。该数据集采用聊天消息格式,附带元数据及由LLM裁判生成的接地性、正确性与自然度质量评分(1-5分),旨在推动尼泊尔语指令遵循与生成任务的研究,并为低资源语言的数据构建提供可复用的方法学参考。
当前挑战
该数据集所应对的领域问题在于低资源语言指令数据的稀缺与质量参差,需在缺乏大规模原生标注语料的条件下生成可信且与源文档严格接地的尼泊尔语指令对。构建过程中的挑战包括:确保合成答案严格依据权威源文档而不引入幻觉,对超出源文档范围的问题实现显式拒答,以及处理LLM裁判调用失败导致质量评分为空的记录。此外,各分片需在重复运行时保持幂等覆盖,避免数据污染,且当前版本明确不可直接用于指令微调,需重新评判后方可使用。
常用场景
经典使用场景
在尼泊尔语自然语言处理领域,低资源语言的指令微调数据长期匮乏,该数据集以权威农业手册与法律文本为根基,借助NVIDIA NeMo Data Designer合成严格溯源的双语对话样本,其最经典的使用场景在于为尼泊尔语大语言模型提供可追溯的指令微调语料,模型须依据给定源文档作答、对不可答问题明确拒答,从而训练出具备事实依据的尼泊尔语对话系统。
衍生相关工作
该数据集衍生了多项围绕低资源溯源指令微调的研究工作,包括基于NeMo Data Designer的合成数据流水线优化、尼泊尔语检索增强生成系统的构建、LLM-as-judge质量评估方法的跨语言迁移,以及农业与法律垂直领域尼泊尔语对话模型的开发,为后续尼泊尔语基准测试与开源模型微调奠定了数据基础。
数据集最近研究
最新研究方向
尼泊尔语作为低资源语言,其法律与农业领域的指令微调数据长期匮乏,严重制约了该语种在生成式人工智能中的表现。unjudged-nepali-law-v2数据集以权威尼泊尔语法律文本和农业手册为源,采用NVIDIA NeMo Data Designer合成严格基于来源的对话指令数据,并引入不可回答问题的显式拒答机制,这一设计契合了当前低资源语言研究中“源接地生成”与“安全对齐”并重的趋势。近期,围绕该数据集的探索聚焦于利用LLM-as-judge质量评分(接地性、正确性、自然性)进行数据筛选与重评判,以修复因评分缺失而不可直接用于指令微调的缺陷。该工作对推动尼泊尔语法律与农业领域的可信对话系统构建具有关键意义,也为其他低资源语言的合成数据治理提供了可复用的质量评估范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务