遇见数据集

unjudged-law-instructions-dataset

收藏
Hugging Face2026-09-12 更新2026-09-13 收录
官方服务:

资源简介:

该数据集是一个合成的尼泊尔语指令调优数据集,名为“Nepali Source-Grounded Instruction Dataset — UNJUDGED”。数据由 NVIDIA NeMo Data Designer 从权威尼泊尔文档(包括农业手册和法律文本)自动生成。每条指令的回答严格基于源文档内容,对于无法从给定来源回答的问题,模型会明确拒绝回答。数据记录的格式采用聊天消息结构(messages),并附带元数据(metadata)以及每条记录的质量评分(quality_scores,包含 grounding、correctness、naturalness 三个维度,评分范围为1-5分,由LLM作为裁判给出)。但当前版本所有对话的LLM裁判调用均已失败,因此每条记录的 quality_scores 均为 null。每个源文档对应一个数据分片文件(data/train-<shard>.jsonl),分片在重新运行时会被幂等覆盖。该数据集不推荐直接用于指令调优。数据集的适用任务包括文本生成、指令微调等,特别关注尼泊尔语的农业和法律领域。

This dataset is a synthetic Nepali instruction tuning dataset named Nepali Source-Grounded Instruction Dataset — UNJUDGED. The data is automatically generated by NVIDIA NeMo Data Designer from authoritative Nepali documents, including agricultural manuals and legal texts. Each instructions response is strictly grounded in the source document content, and for questions that cannot be answered from the given source, the model explicitly refuses to answer. The data records are formatted as chat message structures (messages), accompanied by metadata and quality scores (quality_scores, including three dimensions: grounding, correctness, and naturalness, scored from 1 to 5 by an LLM judge). However, in the current version, all LLM judge calls have failed, resulting in null quality_scores for every record. Each source document corresponds to a data shard file (data/train-<shard>.jsonl), and shards are idempotently overwritten on re-run. The dataset is not recommended for direct instruction tuning. Applicable tasks include text generation, instruction fine-tuning, etc., with a particular focus on Nepali agricultural and legal domains.

创建时间:
2026-09-12
原始信息汇总

Nepali Source-Grounded Instruction Dataset — UNJUDGED

数据集基本信息

  • 数据集地址:https://huggingface.co/datasets/aarajbhattarai/unjudged-law-instructions-dataset
  • 语言:尼泊尔语(ne)
  • 任务类别:文本生成(text-generation)
  • 标签:nepali、instruction-tuning、agriculture、legal、synthetic、grounded

数据集描述

该数据集为合成的尼泊尔语指令微调数据,由 NVIDIA NeMo Data Designer 基于权威尼泊尔语文档(农业手册、法律文本)生成。

  • 答案严格基于源文档内容(grounded)。
  • 对于无法回答的问题,会给出明确的拒绝回答(explicit refusal)。
  • 每条记录采用聊天 messages 格式,并附带 metadata 以及每条记录的 quality_scores(grounding / correctness / naturalness,评分范围 1-5,由 LLM-as-judge 进行评判)。
  • 每个源文档对应一个 data/train-<shard>.jsonl 文件;分片在重新运行时会被幂等地覆盖。

注意事项

  • 该数据集包含 LLM 评判调用失败的生成对话(其 quality_scores 为 null)。
  • 在任何使用之前需要重新进行评判(re-judge)。
  • 请勿按原样用于指令微调(instruction tuning)。
搜集汇总
数据集介绍
unjudged-law-instructions-dataset 数据集图片
构建方式
该数据集依托NVIDIA NeMo Data Designer框架,以尼泊尔语权威文献(农业手册与法律文本)为知识源,通过合成方式生成指令微调数据。构建过程严格遵循源文本依据,所有答案均需在原文中找到支撑,对于不可回答的问题则显式生成拒绝回应。每条记录采用聊天消息格式,并附有元数据与逐条质量评分(依据性、正确性、自然性,1-5分,由LLM作为评判者)。数据按源文档分片存储为data/train-<shard>.jsonl,重复运行时可幂等地覆盖分片。
使用方法
使用该数据集时,需先检查每条记录的quality_scores字段,对评分为null的样本重新进行LLM评判,确保质量分数完整有效。随后可依据评分阈值筛选高依据性、高正确性的样本,用于尼泊尔语指令微调或对话生成任务。加载时按data/train-<shard>.jsonl分片读取,并利用messages字段直接构建训练实例。鉴于数据集明确不推荐直接使用,建议在重新评判与筛选后,结合具体任务需求进行针对性微调或评估,同时注意遵守源文献的版权与使用限制。
背景与挑战
背景概述
尼泊尔语作为低资源语言,长期面临指令微调数据匮乏的困境,制约了当地语言模型在农业、法律等专业领域的应用。在此背景下,研究者依托NVIDIA NeMo Data Designer框架,从尼泊尔语权威农业手册与法律文本中自动生成合成指令数据,构建了unjudged-law-instructions-dataset。该数据集采用聊天消息格式,并附带元数据与基于LLM评判的质量分数,旨在为尼泊尔语指令调优提供来源可溯、答案有据的语料,推动低资源语言在专业场景下的自然语言处理研究。
当前挑战
该数据集所应对的领域问题在于:低资源语言缺乏高质量指令数据,且专业领域问答要求答案严格锚定权威来源。构建过程中的挑战则包括:合成对话的质量评判可能失败,导致质量分数缺失,需重新评判后方可使用;数据按源文档分片存储,重复运行时须保证幂等覆盖;此外,严格基于来源的生成方式使得无法回答的问题必须显式拒绝,这对模型的忠实性与鲁棒性提出了更高要求。
常用场景
经典使用场景
在尼泊尔语低资源语言模型的研究与开发中,该数据集最经典的用途在于为指令微调提供源文档约束下的问答对生成范式。研究者以农业手册与法律文本为知识源,借助NVIDIA NeMo Data Designer合成带有元数据与质量评分的尼泊尔语对话样本,并通过LLM-as-judge对grounding、correctness与naturalness三个维度进行量化评估,从而支撑检索增强生成、忠实性对齐以及拒绝回答机制的实验验证。
解决学术问题
该数据集直面低资源语言指令数据匮乏、合成数据易脱离事实依据以及模型难以识别不可回答问题等学术难题。通过将答案严格锚定于权威源文档,并为无法回答的提问设置显式拒答,它为研究幻觉抑制、源归因评估与跨语言知识迁移提供了可复现的实验基准,推动了尼泊尔语乃至南亚语言自然语言处理资源建设的方法论进步。
实际应用
在实际场景中,该数据集可服务于尼泊尔语农业咨询与法律问答系统的原型开发,帮助农户与公众获取基于官方手册与法规的可靠答复。其分片存储结构与质量评分字段便于工程团队按文档粒度管理数据、迭代更新合成流程,并为构建具备拒答能力的对话助手提供训练与评估素材,尤其在网络覆盖有限、专业服务稀缺的地区具有应用潜力。
数据集最近研究
最新研究方向
在尼泊尔语低资源语言处理与法律、农业垂直领域交汇的背景下,该数据集的前沿研究方向聚焦于源锚定指令微调与忠实性评估。当前研究利用LLM-as-judge对合成对话进行 grounding、正确性与自然度的多维打分,探索可回答与不可回答问题的显式拒答机制,以抑制幻觉并提升领域问答的可靠性。与之相关,低资源语言指令数据的质量过滤与再评判成为热点,研究者强调在训练前剔除评分缺失样本并构建可复现的幂等数据管线。该数据集为尼泊尔语法律与农业智能助手提供了可审计的合成监督信号,推动了垂直领域可信生成与跨语言指令泛化的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务