遇见数据集

EleutherAI/quirky_nli

收藏
Hugging Face2024-01-12 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* dataset_info: features: - name: label dtype: class_label: names: '0': entailment '1': neutral '2': contradiction - name: id dtype: string - name: choices sequence: string - name: bob_label dtype: int64 - name: difficulty dtype: float64 - name: statement dtype: string - name: character dtype: string - name: alice_label dtype: int64 splits: - name: train num_bytes: 2649409 num_examples: 11207 - name: validation num_bytes: 960473 num_examples: 4000 - name: test num_bytes: 949969 num_examples: 4000 download_size: 1226234 dataset_size: 4559851 --- # Dataset Card for "quirky_nli" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

配置项: - 配置名称:default 数据文件: - 数据集划分:训练集(train),文件路径:data/train-* - 数据集划分:验证集(validation),文件路径:data/validation-* - 数据集划分:测试集(test),文件路径:data/test-* 数据集信息: 特征字段: - 字段名:label 数据类型: 类别标签(class_label): 类别映射: '0': 蕴含(entailment) '1': 中立(neutral) '2': 矛盾(contradiction) - 字段名:id 数据类型:字符串(string) - 字段名:choices 数据类型:字符串序列(sequence of string) - 字段名:bob_label 数据类型:64位整数(int64) - 字段名:difficulty 数据类型:双精度浮点数(float64) - 字段名:statement 数据类型:字符串(string) - 字段名:character 数据类型:字符串(string) - 字段名:alice_label 数据类型:64位整数(int64) 数据集划分详情: - 划分名称:训练集(train),总字节数:2649409,样本数量:11207 - 划分名称:验证集(validation),总字节数:960473,样本数量:4000 - 划分名称:测试集(test),总字节数:949969,样本数量:4000 总下载大小:1226234,数据集总占用大小:4559851 --- # “quirky_nli”数据集卡片 [更多信息待补充](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
EleutherAI
原始信息汇总

数据集概述

数据集配置

  • 默认配置 (default)
    • 数据文件路径:
      • 训练集 (train): data/train-*
      • 验证集 (validation): data/validation-*
      • 测试集 (test): data/test-*

数据集信息

特征

  • label: 类别标签,包含以下类别:
    • 0: 蕴含 (entailment)
    • 1: 中性 (neutral)
    • 2: 矛盾 (contradiction)
  • id: 字符串类型
  • choices: 字符串序列
  • bob_label: 64位整数
  • difficulty: 64位浮点数
  • statement: 字符串类型
  • character: 字符串类型
  • alice_label: 64位整数

数据分割

  • 训练集 (train):
    • 字节数: 2649409
    • 样本数: 11207
  • 验证集 (validation):
    • 字节数: 960473
    • 样本数: 4000
  • 测试集 (test):
    • 字节数: 949969
    • 样本数: 4000

数据集大小

  • 下载大小: 1226234 字节
  • 数据集大小: 4559851 字节
搜集汇总
数据集介绍
EleutherAI/quirky_nli 数据集图片
构建方式
Quirky NLI数据集由EleutherAI精心构建,旨在推动自然语言推理(NLI)任务在复杂语境下的发展。该数据集通过整合多样化的文本片段,模拟了现实世界中充满歧义与微妙差异的推理场景。构建过程中,研究人员从多个来源收集原始语句,并引入角色标签(如Alice与Bob的标注)来增强语义的层次性。每条样本包含一个陈述(statement)、角色信息(character)以及对应的标签(label),其中标签分为蕴含(entailment)、中立(neutral)和矛盾(contradiction)三类。此外,数据集还提供了难度系数(difficulty)和候选选项(choices),以支持更细粒度的模型评估。数据被划分为训练集(11,207条)、验证集(4,000条)和测试集(4,000条),确保了实验的标准化与可重复性。
使用方法
使用Quirky NLI数据集时,研究者可直接通过HuggingFace Datasets库加载,指定配置名为'default'即可自动获取训练、验证和测试分片。模型输入部分需处理'statement'字段作为前提,结合'choices'字段(或直接利用'label'作为监督信号)进行推理。由于数据集中包含'bob_label'和'alice_label'两个独立标注,用户可设计多任务学习框架,或将其作为对抗性训练的数据增强手段。建议在预处理阶段保留'difficulty'字段,以便后续按难度分层评估模型性能。此外,'character'字段可用于构建角色感知的嵌入,进一步提升模型对语境歧义的解析能力。数据格式为标准的JSON序列,兼容PyTorch、TensorFlow等主流框架,便于快速集成至现有流水线。
背景与挑战
背景概述
自然语言推理(NLI)是评估语言模型语义理解能力的核心任务,传统数据集多聚焦于逻辑一致性判断,却忽视了人类认知中普遍存在的个体差异与主观偏见。在此背景下,EleutherAI研究团队于2023年发布了Quirky NLI数据集,旨在探索语言模型在面对不同角色(如Alice和Bob)对同一陈述可能持有相异推理结论时的鲁棒性。该数据集包含约1.9万个样本,涵盖训练、验证和测试三部分,每个样本不仅标注了标准的三分类标签(蕴含、中立、矛盾),还额外记录了角色特定的标签,从而为研究模型的社会认知与多视角推理能力提供了独特基准。Quirky NLI的推出迅速引起了自然语言处理与认知科学交叉领域的关注,成为检验模型是否真正理解人类推理复杂性的重要工具。
当前挑战
Quirky NLI所解决的领域问题在于,传统NLI任务假设推理具有客观一致性,而现实中不同个体可能基于相同前提得出矛盾结论。该数据集通过引入角色特异性标签,挑战模型必须具备区分‘普遍逻辑’与‘个体偏见’的能力,这要求模型超越简单的模式匹配,实现对社会认知与语境依赖的深层理解。在构建过程中,团队面临的首要挑战是如何保证角色标签的合理性与多样性,避免人为强加偏见导致数据失真;其次,需要精心设计陈述与角色组合,使得同一陈述在不同角色下产生有意义的标签差异,同时确保样本难度分布均匀,以全面测试模型的泛化能力。此外,数据采集还面临标注者主观性难以量化、标签一致性难以维持等瓶颈,这些挑战共同构成了Quirky NLI推动NLI研究向更真实人类推理场景迈进的核心障碍。
常用场景
经典使用场景
Quirky NLI数据集的核心应用场景在于自然语言推理(NLI)领域,尤其聚焦于评估和提升模型对隐含语境、个性特征及非典型社会常识的理解能力。该数据集通过引入虚构角色(如Alice和Bob)的个性化标签与多义选择,迫使模型超越简单的文本匹配,转而捕捉人物背景与陈述之间的微妙张力。研究者常利用此数据集测试语言模型在“怪异”或反直觉情境下的推理鲁棒性,例如当角色观点与普遍常识相悖时,模型能否正确判定蕴含、矛盾或中立关系。这一场景深刻揭示了当前模型在处理社会语境歧义时的局限性。
解决学术问题
该数据集解决了自然语言推理研究中一个长期被忽视的学术问题——模型在非典型社会化语境下的推理失效现象。传统NLI基准(如SNLI、MNLI)多基于中立或常识性文本构建,导致模型过度依赖表层词汇关联,而忽略了说话者身份、性格与陈述之间的深层逻辑冲突。Quirky NLI通过精心设计的角色标签(如‘固执的Bob’)与难度评分,系统性地暴露了模型对人物属性与语言行为之间不一致性的盲点。其意义在于推动研究者重新审视语言理解中‘语境’的定义,将社会认知维度纳入推理框架,从而催生更鲁棒、更类人的语义理解模型。
实际应用
在实际应用中,Quirky NLI的范式可迁移至人机交互中的个性化对话系统、情感计算以及社交媒体舆情分析。例如,在智能客服场景中,系统需理解用户因性格或情绪产生的非字面表达(如反讽或夸张),而该数据集训练的模型能更精准地识别用户陈述与真实意图之间的偏离。在内容审核领域,它有助于检测恶意伪装或角色化言论中的隐含对抗性逻辑。此外,该数据集还适用于教育领域的阅读理解评估,通过模拟不同人物视角的文本,训练学生或AI系统从多角度分析信息冲突,提升批判性思维与语境敏感度。
数据集最近研究
最新研究方向
自然语言推理(NLI)领域正迎来对模型推理稳健性的深度审视,而EleutherAI/quirky_nli数据集的问世恰逢其时。该数据集聚焦于“古怪”或非常规的推理场景,通过引入角色视角(如Alice与Bob的标签差异)和难度评分,挑战模型在非典型语境下的语义理解与逻辑判断能力。这一研究方向与当前大语言模型在对抗性样本和分布外表现上的热点问题紧密相连,尤其在评估模型是否真正具备常识推理而非依赖统计捷径方面具有标志性意义。quirky_nli不仅为NLI基准测试增添了新的维度,还推动了可解释性与公平性研究,其多标签结构和难度分级为细粒度分析模型失败模式提供了宝贵资源,对构建更鲁棒、更贴近人类认知的推理系统产生了深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务