遇见数据集

rejected-agriculture-instructions-dataset

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

这是一个尼泊尔语源基指令数据集(被拒绝版本),由NVIDIA NeMo Data Designer从权威尼泊尔语文档(包括农业手册和法律文本)自动生成。数据集中的每条指令调优样本均严格基于源文本,答案完全来自源文档;对于无法回答的问题,模型会明确给出拒绝回答。每条记录采用聊天消息格式(messages),并附带元数据(metadata)以及每条记录的质量评分(quality_scores),评分维度包括 grounding(基础性)、correctness(正确性)和 naturalness(自然性),评分范围为 1-5,由 LLM 作为评判者给出。数据以 JSONL 格式存储,每个源文档对应一个分片文件(data/train-<shard>.jsonl),重新运行时分片会被幂等覆盖。重要提示:本数据集中的所有记录均低于预设的质量门槛,每条记录都包含拒绝原因(reject_reasons)。因此,数据集不适合直接用于指令调优;它适用于评判校准、难负样本挖掘,或者使用不同阈值进行重新过滤。

This is a Nepali language source-based instruction dataset (rejected version), automatically generated by NVIDIA NeMo Data Designer from authoritative Nepali documents (including agricultural manuals and legal texts). Each instruction tuning sample in the dataset is strictly based on the source text, with answers entirely derived from the source documents; for unanswerable questions, the model explicitly gives a refusal response. Each record is in a chat message format (messages), accompanied by metadata and quality scores (quality_scores) for each record, with dimensions including grounding, correctness, and naturalness, scored on a scale of 1-5, given by an LLM as the judge. The data is stored in JSONL format, with each source document corresponding to a shard file (data/train-<shard>.jsonl), and shards are idempotently overwritten upon re-execution. Important note: All records in this dataset are below the preset quality threshold, and each record contains rejection reasons (reject_reasons). Therefore, the dataset is not suitable for direct instruction tuning; it is suitable for judge calibration, hard negative mining, or re-filtering with different thresholds.

创建时间:
2026-09-07
原始信息汇总

数据集概述

该数据集是一个尼泊尔语、基于权威来源的指令数据集(被拒绝版本),由 NVIDIA NeMo Data Designer 从尼泊尔官方文档(农业手册、法律文本)中生成。

核心特点

  • 语言:尼泊尔语
  • 任务类别:文本生成
  • 标注/标签:尼泊尔语、指令微调、农业、法律、合成、基于来源

数据说明

  • 答案严格限定于源文档内容;对于无法回答的问题,会给出明确拒绝的回复。
  • 记录采用聊天 messages 格式,并附带 metadata 和逐条记录的 quality_scores(基于来源性/正确性/自然度,评分范围1-5,由LLM作为评判者)。
  • 数据以 data/train-<shard>.jsonl 形式存储,每个源文档对应一个分片;分片在重新运行时会被幂等地覆盖。

数据性质与用途

  • 这些记录均被判定为低于质量门槛,每条记录都包含 reject_reasons
  • 适用场景:评判标准校准、困难负样本挖掘,或使用不同阈值进行重新过滤。
  • 不适用场景:不应用于直接的指令微调。
搜集汇总
数据集介绍
rejected-agriculture-instructions-dataset 数据集图片
构建方式
本数据集依托NVIDIA NeMo Data Designer,从权威尼泊尔语文献(涵盖农业手册与法律文本)中提炼合成指令数据,构建过程恪守源文约束,凡超出文献范畴之问询均以明确拒答机制处理。每条记录遵循聊天式消息结构,并附带元数据及由LLM评判员赋予的质量评分(涵盖依据契合度、正确性及自然度,分值为1至5)。数据以分片JSONL格式存储,每个源文档对应独立分片,且在重复执行时具备幂等覆盖特性,确保了流程的可复现性。
特点
该数据集的核心特质在于其被标记为“拒绝”状态,意味着其中所有记录均未通过预设质量门槛,并逐一注明了具体拒绝缘由。这一独特定位使其超越常规训练语料范畴,转而成为评估校准工具、难例挖掘资源或自定义阈值再过滤的测试平台。尤为关键的是,其源文锚定的生成方式保障了答案的严格溯源,而拒答机制则真实模拟了知识边界情形,为鲁棒性研究与质量评判基准提供了难能可贵的素材。
使用方法
使用时需明确其非为直接指令微调而设,应避免将其作为训练集原样导入。适宜的应用路径包括:用于校准自动评判模型,通过分析拒绝原因与质量分数的关联以优化评分逻辑;作为困难负样本库,强化模型对不可答问题的辨识能力;或依据各异质性阈值对数据行二次滤选,以构建定制化高质量训练子集。鉴于其语言与领域的专属性,此数据集对尼泊尔语NLP及垂直领域(农业与法律)的指令遵循研究具有特殊价值。
背景与挑战
背景概述
该数据集诞生于自然语言处理与低资源语言智能应用交叉的前沿领域,由NVIDIA NeMo Data Designer工具链在近期催生,聚焦于尼泊尔语农业与法律文本的指令微调。研究团队依托权威文献构建合成数据,旨在弥补尼泊尔语在指令遵循与接地生成任务中的语料匮乏。其核心研究问题在于如何从源文档中生成忠实且自然的问答对,并通过严格质量控制保障数据可靠性。作为被拒绝的样本集合,该数据集在指令微调社区中独树一帜,为质量评估、判别模型训练及过滤策略优化提供了珍贵素材,对推动低资源语言NLP的稳健发展具有潜在影响力。
当前挑战
该领域首要挑战在于尼泊尔语作为低资源语言,其指令微调数据稀缺且语义复杂度高,农业与法律文本蕴含专业术语与严谨逻辑,要求模型在生成时恪守源文接地原则,拒绝机制需精准平衡可答性与拒答率,此乃数据集旨在解决的领域难题。于构建层面,挑战则体现为合成数据生成的质量控制:需确保跨文档的一致性与自然性,避免幻觉注入;质量评分依赖LLM-as-judge,其评判标准存在固有偏差与尺度波动;被拒样本的reject_reasons标注需细致入微,以供后续校准或硬负样本挖掘,构建流程中的迭代覆盖机制亦要求对数据管线的幂等性及阈值设定进行审慎考量。
常用场景
经典使用场景
在自然语言处理与低资源语言建模的学术前沿,尼泊尔语指令微调数据长期匮乏,制约了该区域语言智能体的发展。此数据集以其独特的“被拒样本”定位,成为指令调优流程中关键的负样本资源。研究者可运用该数据开展指令遵循模型的鲁棒性测试,通过注入这些低于质量门槛的样本,系统评估模型对不完整、误导性或无根据指令的拒答能力,进而优化分类器或强化学习中的奖励模型,使其更精准地辨识低质量响应。
解决学术问题
该数据集直面低资源语言环境下指令微调数据质量不可控的学术挑战。传统数据集往往剔除低质样本,但缺乏对拒绝理由的系统性标注,导致模型难以学习何时应明确拒绝而非臆造答案。此数据集通过为每个样本提供细粒度的质量评分及拒绝原因,促进了可解释的答案生成研究,并为质量评估指标的校准提供了黄金标准。其意义在于推动构建更诚实、更可靠的多语言对话系统,尤其针对法律与农业领域的事实性问答,减少了模型幻觉现象。
衍生相关工作
围绕该数据集的特性,已衍生出若干值得关注的探索方向。其一,基于其质量分数与拒绝理由,研究者可训练一个小型评判器(judge model),用于实时评估新生成指令的质量,进而构建自动化数据清洗流程。其二,利用其硬负样本,可辅助微调检索增强生成(RAG)系统中的重排序器,提升对不相关语料的判别力。其三,该数据集也为跨语言对齐研究提供了素材,通过对比尼泊尔语与英语的拒绝行为差异,促进多语言安全对齐技术的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务