遇见数据集

zhili312/Textual-Natural-Contextual-Classification

收藏
Hugging Face2023-10-30 更新2024-03-04 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - text-classification language: - en pretty_name: TNCC size_categories: - 1K<n<10K --- Given the scarcity of datasets for understanding natural language in visual scenes, we introduce a novel textual entailment dataset, named Textual Natural Contextual Classification (TNCC). This dataset is formulated on the foundation of Crisscrossed Captions (https://github.com/google-research-datasets/Crisscrossed-Captions), an image captioning dataset supplied with human-rated semantic similarity ratings on a continuous scale from 0 to 5. We tailor the dataset to suit a binary classification task. Specifically, sentence pairs with annotation scores exceeding 4 are categorized as positive (entailment), whereas pairs with scores less than 1 are marked as negative (non-entailment). The TNCC dataset is partitioned into training, validation, and testing sets, containing 3,600, 1,200, and 1,560 instances, respectively. If you use this dataset for academic research, please cite the NeurIPS 2023 paper titled 'Back-Modality: Leveraging Modal Transformation for Data Augmentation'.

许可证:Apache-2.0许可证 任务类别: - 文本分类(text-classification) 语言: - 英语(en) 展示名称:TNCC 样本规模: - 1000 < 样本量 < 10000 鉴于当前面向视觉场景自然语言理解的数据集较为稀缺,我们推出了一款全新的文本蕴含数据集——文本自然上下文分类(Textual Natural Contextual Classification,缩写TNCC)。 本数据集基于交叉字幕(Crisscrossed Captions,https://github.com/google-research-datasets/Crisscrossed-Captions)构建,后者是一款附带人工标注的语义相似度评分的图像字幕数据集,评分区间为0至5的连续量表。 我们将该数据集适配为二分类任务:具体而言,标注评分高于4的句子对被划分为正样本(蕴含关系),而评分低于1的句子对则被标记为负样本(非蕴含关系)。 TNCC数据集被划分为训练集、验证集与测试集,三者分别包含3600、1200以及1560个样本实例。 若将本数据集用于学术研究,请引用2023年神经信息处理系统大会(NeurIPS)论文《Back-Modality: Leveraging Modal Transformation for Data Augmentation》。

提供机构:
zhili312
原始信息汇总

数据集概述

数据集名称

  • 名称: TNCC

数据集类型

  • 类型: 文本蕴含数据集

任务类别

  • 任务: 文本分类

语言

  • 语言: 英语

数据集大小

  • 大小: 1K<n<10K

数据集描述

  • 描述: TNCC数据集基于Crisscrossed Captions图像字幕数据集构建,该数据集提供了人类评定的语义相似度评分,范围从0到5。TNCC数据集针对二分类任务进行了调整,具体来说,评分超过4的句子对被归类为正类(蕴含),而评分低于1的句子对被标记为负类(非蕴含)。

数据集划分

  • 划分:
    • 训练集: 3,600个实例
    • 验证集: 1,200个实例
    • 测试集: 1,560个实例

引用信息

  • 引用: 如果使用该数据集进行学术研究,请引用NeurIPS 2023论文《Back-Modality: Leveraging Modal Transformation for Data Augmentation》。
搜集汇总
数据集介绍
zhili312/Textual-Natural-Contextual-Classification 数据集图片
构建方式
在视觉场景中自然语言理解数据集稀缺的背景下,我们基于Crisscrossed Captions图像描述数据集构建了Textual Natural Contextual Classification(TNCC)数据集。该数据集利用人工标注的0至5连续语义相似度评分,筛选出评分大于4的句子对作为正例(蕴含关系),评分小于1的作为负例(非蕴含关系),从而适配二元文本分类任务。最终数据集划分为训练集、验证集和测试集,分别包含3,600、1,200和1,560个实例。
特点
TNCC数据集聚焦于自然语境下的文本蕴含分类,其独特之处在于源自图像描述数据,融合了视觉场景的语义信息。通过严格阈值划分正负样本,确保了类别间的清晰界限,同时保留了原始评分中蕴含的细微语义差异。数据集规模适中,约6,360个实例,适合作为基准测试或小样本学习场景的评估资源。
使用方法
该数据集适用于文本分类领域的二分类任务,可直接用于训练和评估蕴含关系识别模型。使用时,用户需加载已划分好的训练、验证和测试集,将句子对作为输入,并预测其蕴含(正例)或非蕴含(负例)标签。建议采用预训练语言模型(如BERT)进行微调,并参考NeurIPS 2023论文中的Back-Modality数据增强方法以提升性能。
背景与挑战
背景概述
在自然语言处理与视觉场景理解交叉领域,语义蕴含关系识别是连接语言与视觉信息的关键技术之一。现有数据集多聚焦于纯文本或纯图像领域,难以有效捕捉自然语言在视觉语境中的复杂语义关联。针对这一研究空白,TNCC(Textual Natural Contextual Classification)数据集于2023年由相关研究团队构建,其核心研究问题在于如何基于图像描述中的语义相似度评判,构建适用于二分类任务的文本蕴含数据集。该数据集以Crisscrossed Captions为基石,通过筛选高相似度(>4)与低相似度(<1)的句子对,分别定义为蕴含与非蕴含关系,最终形成包含3600训练样本、1200验证样本及1560测试样本的标准化资源。作为NeurIPS 2023收录论文《Back-Modality: Leveraging Modal Transformation for Data Augmentation》的配套数据,TNCC为多模态语义推理、数据增强策略评估等领域提供了关键基准,推动了视觉场景下自然语言理解研究的发展。
当前挑战
TNCC数据集面临的挑战体现在双重维度。在领域问题层面,其核心挑战在于如何从连续语义相似度评分中精准提取离散化的二分类标签,避免边界样本(如评分接近4或1的句子对)引入分类歧义;同时,基于图像描述构建的文本对需克服视觉场景中语义歧义性,例如同义表述因语境差异导致蕴含关系误判。在构建过程中,原始Crisscrossed Captions数据集仅提供连续评分,缺乏明确的正负样本划分标准,研究者需制定合理的阈值策略以平衡数据平衡性与分类难度;此外,数据集规模较小(总计6360样本)限制了模型泛化能力,且仅覆盖英文语境,难以评估跨语言场景下的鲁棒性。这些挑战共同指向一个根本问题:如何在有限资源下,设计既能忠实反映视觉语义蕴含关系、又具备实用分类区分度的数据集构建范式。
常用场景
经典使用场景
在自然语言处理与视觉场景理解交叉领域,文本蕴含任务长期面临细粒度语义标注数据匮乏的困境。TNCC数据集应运而生,其核心场景聚焦于文本对是否构成蕴含关系的二元分类任务。基于Crisscrossed Captions图像描述数据集中的连续语义相似度评分,研究者将评分超过4的样本定义为蕴含正例,低于1的则归为非蕴含负例,构建了包含3600条训练集、1200条验证集和1560条测试集的精炼数据体系。这一设计使得该数据集成为评估模型在视觉语义背景下进行文本蕴含推理能力的经典基准。
实际应用
在实际应用中,TNCC数据集赋能了多个视觉与语言交互系统的核心能力。智能视觉辅助系统可借助基于该数据集训练的蕴含判别模型,精准判断用户自然语言指令与当前视觉场景描述之间的逻辑一致性,例如在自动驾驶中验证路况描述与传感器文本的匹配度。电商平台的商品检索与推荐系统同样受益,通过识别用户查询与商品描述间的蕴含关系提升搜索精度。此外,社交媒体内容审核场景中,该数据集训练的模型能够高效检测图文信息是否构成逻辑矛盾。
衍生相关工作
该数据集催生了一系列具有里程碑意义的后续工作。NeurIPS 2023收录的《Back-Modality: Leveraging Modal Transformation for Data Augmentation》论文直接基于TNCC展开研究,提出了通过模态变换进行数据增强的创新框架,有效缓解了视觉-语言数据稀疏问题。后续研究者还探索了将TNCC与对比学习范式结合,发展出视觉文本蕴含的跨模态预训练策略。在模型架构层面,基于该数据集衍生了多种融合注意力机制与门控网络的分类器设计,为多模态推理领域树立了新的评价标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务