遇见数据集

nepali-nli-20k

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

Nepali-Nli-20k 是一个合成生成的尼泊尔语自然语言推理(NLI)数据集,旨在训练和评估尼泊尔语语言理解模型,特别是句子嵌入模型、检索模型、交叉编码器以及其他需要理解尼泊尔语中语义相似性、矛盾和蕴含关系的模型。数据集包含 20,000 个样本,分为 16,000 个训练样本和 4,000 个测试样本。每个样本由三个字段组成:前提(premise)、假设(hypothesis)和标签(label)。标签遵循标准 NLI 格式,包括“蕴含”(entailment,假设从前提逻辑推导出)、“矛盾”(contradiction,假设与前提冲突)和“中性”(neutral,假设与前提相关但无法证明真伪)。数据集覆盖广泛的尼泊尔和现实世界主题,如尼泊尔文化与传统、节日仪式、地理环境、教育、健康、金融、数字支付、就业、政治、媒体、农业和技术等,旨在使样本多样化并适用于理解现实日常语境中的尼泊尔语。数据集由本地指令遵循语言模型合成生成,通过明确约束确保前提和假设均为尼泊尔语、标签关系逻辑一致、主题反映在生成文本中。由于是合成数据,可能存在逻辑关系不完美、重复句子模式、轻微语言或语法问题以及文化上合理但未经事实验证的陈述等局限性,建议在高风险应用前进行检查、过滤和验证。预期用途包括训练尼泊尔语句子嵌入模型、微调 NLI 或分类模型、训练语义匹配交叉编码器、构建检索和重排序系统、评估尼泊尔语语义理解以及创建对比学习三元组数据集。

Nepali-Nli-20k is a synthetically generated Nepali natural language inference (NLI) dataset designed to train and evaluate Nepali language understanding models, particularly sentence embedding models, retrieval models, cross-encoders, and other models that require understanding semantic similarity, contradiction, and entailment in Nepali. The dataset contains 20,000 samples, divided into 16,000 training samples and 4,000 test samples. Each sample consists of three fields: premise, hypothesis, and label. The labels follow the standard NLI format, including entailment (where the hypothesis logically follows from the premise), contradiction (where the hypothesis conflicts with the premise), and neutral (where the hypothesis is related to the premise but cannot be proven true or false). The dataset covers a wide range of Nepali and real-world topics, such as Nepali culture and traditions, festivals and rituals, geography, education, health, finance, digital payments, employment, politics, media, agriculture, and technology, aiming to diversify samples and make them applicable to understanding Nepali in real-world daily contexts. The dataset is synthetically generated using a local instruction-following language model, with explicit constraints to ensure that both premise and hypothesis are in Nepali, label relationships are logically consistent, and topics are reflected in the generated text. Due to its synthetic nature, there may be limitations such as imperfect logical relationships, repetitive sentence patterns, minor language or grammatical issues, and culturally plausible but factually unverified statements; it is recommended to check, filter, and validate before high-risk applications. Intended uses include training Nepali sentence embedding models, fine-tuning NLI or classification models, training semantic matching cross-encoders, building retrieval and reranking systems, evaluating Nepali semantic understanding, and creating contrastive learning triplet datasets.

创建时间:
2026-06-09
原始信息汇总

数据集概述:Nepali-Nli-20k

Nepali Natural Language Inference Dataset 是一个合成生成的尼泊尔语自然语言推理(NLI)数据集,包含 20,000 个样本,用于训练和评估尼泊尔语语义理解模型。

数据集信息

  • 规模:10,000 < 样本数 < 100,000(实际 20,000 个样本)
  • 数据划分
    • 训练集:16,000 个样本
    • 测试集:4,000 个样本
  • 数据集大小:约 9.16 MB(下载大小约 3.00 MB)
  • 特征字段
    • premise(前提):尼泊尔语文本
    • hypothesis(假设):尼泊尔语文本
    • label(标签):字符串类型(entailmentcontradictionneutral

标签含义

  • entailment:假设逻辑上从前提推出。
  • contradiction:假设与前提冲突。
  • neutral:假设与前提相关,但无法确定真伪。

覆盖主题

涵盖尼泊尔文化、节日习俗、地理环境、教育、健康、数字支付、就业、政治、农业、技术与AI等广泛现实主题。

预期用途

  • 训练尼泊尔语句子嵌入模型
  • 微调NLI或分类模型
  • 训练交叉编码器进行语义匹配
  • 构建检索与重排序系统
  • 评估尼泊尔语语义理解能力
  • 创建对比学习的三元组数据集
  • 改进尼泊尔语问答与搜索系统

数据集创建

使用本地指令跟随语言模型合成生成,针对每个样本采样主题和NLI标签,生成对应的前提与假设对,并确保逻辑一致性与结构规范性。

局限性

  • 合成数据可能包含不完美的逻辑关系、重复模式、轻微语法问题
  • 场景简化,部分事实未经验证

推荐处理步骤

  • 去重前提-假设对
  • 使用独立模型或人工审查验证标签一致性
  • 过滤短或低质量样本
  • 平衡各标签样本数量
  • 可额外划分验证集
  • 可选将标签转换为句子对或三元组格式

快速加载(Python)

python from datasets import load_dataset dataset = load_dataset("jangedoo/nepali-nli-20k", "data", split="train") df = dataset.to_pandas()

引用格式

bibtex @dataset{subedi_nepali_nli_dataset, author = {Subedi, Sanjaya}, title = {Nepali Natural Language Inference Dataset}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/jangedoo/nepali-nli-20k} }

搜集汇总
数据集介绍
nepali-nli-20k 数据集图片
构建方式
该数据集通过本地指令跟随语言模型合成生成。构建时,首先为每个样本采样一个主题与NLI标签,随后由模型依据给定标签生成对应的尼泊尔语前提与假设对。生成过程受到显式约束,确保前提与假设均以尼泊尔语书写、标签逻辑关系一致、文本反映所选主题,并遵循严格的格式化输出结构。最终形成包含16000条训练样本与4000条测试样本的高质量NLI数据集。
特点
数据集涵盖广泛且多元的现实世界主题,包括尼泊尔文化传统、节日习俗、地理环境、教育健康、数字支付、媒体素养、政治治理与农业市场等,极具多样性与真实语境代表性。每条样本包含标准NLI三标签分类:蕴含、矛盾与中立。合成数据虽可能存在逻辑不完美、句式重复或语法瑕疵,但整体上为尼泊尔语语义理解模型提供了丰富且可扩展的训练资源。
使用方法
该数据集可应用于多种NLP任务:训练尼泊尔语句子嵌入模型、微调自然语言推理或分类模型、训练交叉编码器进行语义匹配、构建检索与重排序系统。推荐使用前进行去重、标签一致性校验、过滤低质量样本、平衡标签分布等预处理。可直接通过datasets库加载:dataset = load_dataset("jangedoo/nepali-nli-20k", "data", split="train"),并转换为pandas DataFrame以方便使用。
背景与挑战
背景概述
自然语言推理(NLI)作为自然语言理解的核心任务,旨在判别前提与假设之间的蕴含、矛盾或中立关系,是评估语言模型语义理解能力的重要基准。然而,现有NLI数据集多集中于英语等资源丰富语言,低资源语言如尼泊尔语的研究进展相对滞后,缺乏大规模、高质量的标注语料。由Sanjaya Subedi于2026年创建的Nepali-NLI-20k数据集,通过利用本地指令遵循语言模型合成生成,首次系统性地为尼泊尔语提供了包含20,000个样本的NLI基准,涵盖文化传统、地理旅游、教育健康等广泛主题。这一数据集的问世填补了尼泊尔语在语义推理与句嵌入模型训练方面的空白,为尼泊尔语信息检索、问答系统及语言理解模型的评估与优化奠定了重要基础。
当前挑战
Nepali-NLI-20k数据集主要面临双重挑战。在领域问题层面,尼泊尔语作为低资源语言,缺乏成熟的语义理解基准与大规模标注语料,现有模型难以准确识别蕴含、矛盾与中立关系,尤其在处理尼泊尔语特有的文化概念与复杂句式时表现不佳,限制了相关自然语言处理系统的性能提升。在构建过程中,由于数据完全由语言模型合成生成,存在逻辑关系不完全一致、句式模式重复、语法错误及文化陈述未经事实验证等局限,且示例可能过于简化现实场景。这些因素要求使用者投入额外筛选与验证工作,以确保数据质量与任务适用性。
常用场景
经典使用场景
在自然语言推理(NLI)领域,该数据集主要用于训练和评估尼泊尔语语义理解模型。经典使用方式是将前提(premise)与假设(hypothesis)构成的文本对输入模型,预测二者之间的蕴含(entailment)、矛盾(contradiction)或中立(neutral)关系。这一任务不仅是句子嵌入模型、交叉编码器与检索系统的核心测试平台,也为对比学习中的三元组构造提供了高质量语料。尼泊尔语作为低资源语言,此数据集填补了其NLI基准的空白,推动了多语言语义理解研究的均衡发展。
实际应用
在实际应用中,该数据集可助力构建尼泊尔语的智能问答系统、语义搜索引擎与对话机器人。例如,在尼泊尔的数字政务服务中,公民使用尼泊尔语咨询政策时,系统能精准识别其意图与已有信息的逻辑关系,给出蕴含或矛盾的判断,从而提升答复准确性。在电商平台,消费者与客服的对话中,模型可实时分析用户问题与产品描述的语义匹配度,实现高效的产品推荐与争议处理。此外,该数据也支撑社交媒体内容审核,判断信息之间的矛盾或误导性,维护网络环境的清朗。
衍生相关工作
该数据集衍生出多项重要工作,为低资源语言NLI研究树立了范式。基于此数据集,研究者开发了尼泊尔语专用的句子嵌入模型,如Nepali-BERT的微调版本,并提出了融合文化知识与逻辑约束的训练策略。同时,该数据催生了面向南亚语言的跨语言NLI基准,推动了句对分类与密集检索的联合建模方法。此外,利用其合成数据属性,相关团队探索了弱监督学习与半自举标签增强技术,有效缓解了低资源场景下的标注瓶颈,为诸如印地语、孟加拉语等类似语言的NLI数据集构建提供了可复现的生成管线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务