遇见数据集

liuyanchen1015/MULTI_VALUE_mnli_a_ing

收藏
Hugging Face2022-12-12 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: premise dtype: string - name: hypothesis dtype: string - name: label dtype: int64 - name: idx dtype: int64 - name: score dtype: int64 splits: - name: dev_matched num_bytes: 810269 num_examples: 3322 - name: dev_mismatched num_bytes: 928761 num_examples: 3712 - name: test_matched num_bytes: 841249 num_examples: 3473 - name: test_mismatched num_bytes: 899925 num_examples: 3605 - name: train num_bytes: 32720971 num_examples: 133743 download_size: 23435025 dataset_size: 36201175 --- # Dataset Card for "MULTI_VALUE_mnli_a_ing" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征项: - 名称:前提(premise),数据类型:字符串(string) - 名称:假设(hypothesis),数据类型:字符串(string) - 名称:标签(label),数据类型:64位整数(int64) - 名称:索引(idx),数据类型:64位整数(int64) - 名称:得分(score),数据类型:64位整数(int64) 数据集划分: - 名称:匹配开发集(dev_matched),字节大小:810269,样本数量:3322 - 名称:不匹配开发集(dev_mismatched),字节大小:928761,样本数量:3712 - 名称:匹配测试集(test_matched),字节大小:841249,样本数量:3473 - 名称:不匹配测试集(test_mismatched),字节大小:899925,样本数量:3605 - 名称:训练集(train),字节大小:32720971,样本数量:133743 下载大小:23435025 数据集总大小:36201175 --- # 「MULTI_VALUE_mnli_a_ing」数据集卡片 【需补充更多信息】(https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
liuyanchen1015
原始信息汇总

数据集概述

数据集名称

MULTI_VALUE_mnli_a_ing

数据集特征

  • premise: 数据类型 - string
  • hypothesis: 数据类型 - string
  • label: 数据类型 - int64
  • idx: 数据类型 - int64
  • score: 数据类型 - int64

数据集分割

  • dev_matched:
    • 字节数: 810269
    • 示例数: 3322
  • dev_mismatched:
    • 字节数: 928761
    • 示例数: 3712
  • test_matched:
    • 字节数: 841249
    • 示例数: 3473
  • test_mismatched:
    • 字节数: 899925
    • 示例数: 3605
  • train:
    • 字节数: 32720971
    • 示例数: 133743

数据集大小

  • 下载大小: 23435025 字节
  • 数据集大小: 36201175 字节
搜集汇总
数据集介绍
liuyanchen1015/MULTI_VALUE_mnli_a_ing 数据集图片
构建方式
在自然语言推理(NLI)领域,MULTI_VALUE_mnli_a_ing 数据集基于经典的 Multi-Genre NLI(MNLI)语料库构建而成。其构建方式保留了原始 MNLI 的结构框架,包含前提(premise)与假设(hypothesis)文本对,并赋予三类标签(蕴含、矛盾、中立)以表征逻辑关系。该数据集进一步整合了样本索引(idx)与评分(score)字段,以支持多值推理场景下的细粒度分析。数据划分为训练集(133,743条)、开发集(matched与mismatched)及测试集(matched与mismatched),从而确保跨体裁和领域的一致性与泛化能力评估。
特点
该数据集的核心特点在于其多值标签体系的引入,通过 score 字段对推理强度进行量化,突破了传统三分类的局限,为研究蕴含关系的连续性与层次性提供了可能。同时,数据集继承了 MNLI 的跨体裁特性,涵盖小说、电话录音、政府报告等十余种文本类型,显著增强了模型的域迁移鲁棒性。数据量充沛,训练集规模逾13万条,且开发与测试集均区分匹配与非匹配场景,便于系统评测模型在领域内与领域外的表现差异。
使用方法
使用该数据集时,研究者可将其加载至 Hugging Face Datasets 库中,通过指定分割名称(如 'train'、'dev_matched')获取对应子集。每条样本包含 premise 与 hypothesis 作为模型输入,label 作为分类目标(0、1、2 分别对应蕴含、中立、矛盾),而 idx 与 score 可用于多值推理实验或作为附加特征。推荐采用序列分类模型(如 BERT、RoBERTa)进行微调,并利用 mismatched 分割评估跨域泛化能力。此外,score 字段可辅助构建回归任务或对比学习框架,以挖掘蕴含强度的潜在分布。
背景与挑战
背景概述
自然语言推理(NLI)是自然语言处理领域的核心任务之一,旨在判断前提与假设之间的逻辑关系(蕴涵、矛盾或中立)。liuyanchen1015/MULTI_VALUE_mnli_a_ing数据集由研究者刘彦辰等人于近期构建,其核心研究问题聚焦于多值逻辑推理场景下的语义理解能力。该数据集基于经典的MNLI(Multi-Genre Natural Language Inference)语料库进行扩展,通过引入多值标注体系,旨在克服传统三分类NLI任务在表达复杂语义关系时的局限性。数据集包含超过13万条训练样本,覆盖匹配与非匹配两种开发集和测试集划分,为评估模型在跨领域、多值逻辑推理上的泛化性能提供了标准化基准。其发布对推动细粒度语义推理研究、提升模型对现实世界中模糊与矛盾信息的处理能力具有重要学术价值。
当前挑战
该数据集所解决的核心领域挑战在于传统NLI任务仅支持三分类标签,难以捕捉诸如部分蕴涵、程度矛盾等细粒度语义关系,尤其在多源文本融合与知识推理场景中,模型常因逻辑维度缺失而输出错误结论。构建过程中面临的主要挑战包括:第一,多值标签体系的定义与一致性标注,需确保不同标注者对复杂逻辑关系(如“强蕴涵”与“弱蕴涵”)的判定标准高度统一;第二,跨领域数据覆盖的平衡性,需防止某一类型语料(如新闻、小说)主导训练集而削弱泛化能力;第三,大规模标注数据的质量控制,需通过多轮校验与冲突消解机制降低噪声,避免标签歧义对模型学习产生误导。
常用场景
经典使用场景
MULTI_VALUE_mnli_a_ing数据集是基于经典MNLI语料库的衍生版本,专为自然语言推理(NLI)任务设计。其核心场景在于评估模型对前提与假设之间蕴含、矛盾或中立关系的理解能力。通过引入多值标签与评分机制,该数据集突破了传统三分类NLI的局限,使模型能够学习更细腻的语义推理层次。研究者常利用其训练集与匹配/非匹配验证集,来检验语言模型在跨领域泛化时的鲁棒性,从而推动文本蕴含分析从简单判别迈向连续值推理的范式演进。
实际应用
在实际应用中,该数据集为智能客服、内容审核与教育评估等场景提供了语义理解基石。例如,在自动问答系统中,模型需判断用户问题与知识库条目间的逻辑关系,该数据集的细粒度标签可提升对近似匹配或部分矛盾句子的识别精度。在虚假新闻检测中,其连续评分机制有助于量化声明与证据间的偏离程度,而非仅输出二元对立结果。此外,多领域测试划分使其能有效支撑跨场景部署的模型调优。
衍生相关工作
该数据集衍生了一系列重要工作,包括基于对比学习的蕴含强度预测模型,以及利用软标签进行知识蒸馏的轻量级推理框架。部分研究将其扩展至多模态场景,如图文蕴含的连续值推理;另一些工作则借鉴其评分机制,构建了面向法律文本或医疗记录的专业领域NLI数据集。此外,该数据集的非匹配划分设计启发了领域泛化研究,催生了诸如对抗性领域对齐与因果推理增强等创新方法论,持续推动文本理解技术的边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务