five

pkavumba/balanced-copa|自然语言处理数据集|因果推理数据集

收藏
hugging_face2022-10-03 更新2024-03-04 收录
自然语言处理
因果推理
下载链接:
https://hf-mirror.com/datasets/pkavumba/balanced-copa
下载链接
链接失效反馈
资源简介:
Balanced COPA数据集是一个用于训练机器学习模型以进行常识因果推理的基准数据集。该数据集扩展了COPA数据集(Roemmele et al. 2011),通过添加镜像实例来平衡原始COPA答案中的词汇分布,从而减少模型对表面线索的依赖。Balanced COPA通过添加具有相同答案选择但不同标签的镜像实例,使词汇分布更加均衡。数据集包含1000个验证实例和500个测试实例,每个实例包含前提、两个选择、问题类型、标签和是否镜像的信息。
提供机构:
pkavumba
原始信息汇总

数据集卡片:Balanced COPA

数据集描述

数据集摘要

Bala-COPA:一个用于训练鲁棒常识因果推理模型的英语数据集。

Balanced Choice of Plausible Alternatives数据集是一个用于训练机器学习模型的基准,这些模型对表面线索/虚假相关性具有鲁棒性。该数据集扩展了COPA数据集(Roemmele et al. 2011),通过添加镜像实例来缓解原始COPA答案中的令牌级表面线索。原始COPA数据集中的表面线索是由于正确和错误答案选择之间的令牌分布不平衡,即某些令牌在正确选择中比错误选择中出现得更频繁。Balanced COPA通过添加具有相同答案选择但不同标签的镜像实例来均衡令牌分布。

支持的任务和排行榜

更多信息需要

语言

  • 英语

数据集结构

数据实例

一个validation示例如下: json { "id": 1, "premise": "My body cast a shadow over the grass.", "choice1": "The sun was rising.", "choice2": "The grass was cut.", "question": "cause", "label": 1, "mirrored": false, }

数据字段

所有拆分的数据字段相同:

  • premise:一个string特征。
  • choice1:一个string特征。
  • choice2:一个string特征。
  • question:一个string特征。
  • label:一个int32特征。
  • id:一个int32特征。
  • mirrored:一个bool特征。

数据拆分

validation test
1,000 500

数据集创建

策划理由

更多信息需要

源数据

初始数据收集和规范化

更多信息需要

源语言生产者是谁?

更多信息需要

注释

注释过程

更多信息需要

注释者是谁?

更多信息需要

个人和敏感信息

更多信息需要

使用数据的注意事项

数据集的社会影响

更多信息需要

偏见的讨论

更多信息需要

其他已知限制

更多信息需要

附加信息

数据集策展人

更多信息需要

许可信息

Creative Commons Attribution 4.0 International (CC BY 4.0)

引用信息

bibtex @inproceedings{kavumba-etal-2019-choosing, title = "When Choosing Plausible Alternatives, Clever Hans can be Clever", author = "Kavumba, Pride and Inoue, Naoya and Heinzerling, Benjamin and Singh, Keshav and Reisert, Paul and Inui, Kentaro", booktitle = "Proceedings of the First Workshop on Commonsense Inference in Natural Language Processing", month = nov, year = "2019", address = "Hong Kong, China", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/D19-6004", doi = "10.18653/v1/D19-6004", pages = "33--42", abstract = "Pretrained language models, such as BERT and RoBERTa, have shown large improvements in the commonsense reasoning benchmark COPA. However, recent work found that many improvements in benchmarks of natural language understanding are not due to models learning the task, but due to their increasing ability to exploit superficial cues, such as tokens that occur more often in the correct answer than the wrong one. Are BERT{}s and RoBERTa{}s good performance on COPA also caused by this? We find superficial cues in COPA, as well as evidence that BERT exploits these cues.To remedy this problem, we introduce Balanced COPA, an extension of COPA that does not suffer from easy-to-exploit single token cues. We analyze BERT{}s and RoBERTa{}s performance on original and Balanced COPA, finding that BERT relies on superficial cues when they are present, but still achieves comparable performance once they are made ineffective, suggesting that BERT learns the task to a certain degree when forced to. In contrast, RoBERTa does not appear to rely on superficial cues.", }

@inproceedings{roemmele2011choice, title={Choice of plausible alternatives: An evaluation of commonsense causal reasoning}, author={Roemmele, Melissa and Bejan, Cosmin Adrian and Gordon, Andrew S}, booktitle={2011 AAAI Spring Symposium Series}, year={2011}, url={https://people.ict.usc.edu/~gordon/publications/AAAI-SPRING11A.PDF}, }

贡献

感谢@pkavumba添加此数据集。

用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4098个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

中国1km分辨率逐月降水量数据集(1901-2023)

该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。

国家青藏高原科学数据中心 收录

中国空气质量数据集(2014-2020年)

数据集中的空气质量数据类型包括PM2.5, PM10, SO2, NO2, O3, CO, AQI,包含了2014-2020年全国360个城市的逐日空气质量监测数据。监测数据来自中国环境监测总站的全国城市空气质量实时发布平台,每日更新。数据集的原始文件为CSV的文本记录,通过空间化处理生产出Shape格式的空间数据。数据集包括CSV格式和Shape格式两数数据格式。

国家地球系统科学数据中心 收录

网易云音乐数据集

该数据集包含了网易云音乐平台上的歌手信息、歌曲信息和歌单信息,数据通过爬虫技术获取并整理成CSV格式,用于音乐数据挖掘和推荐系统构建。

github 收录

CIFAR-10

CIFAR-10 数据集由 10 个类别的 60000 个 32x32 彩色图像组成,每个类别包含 6000 个图像。有 50000 个训练图像和 10000 个测试图像。 数据集分为五个训练批次和一个测试批次,每个批次有 10000 张图像。测试批次恰好包含来自每个类别的 1000 个随机选择的图像。训练批次包含随机顺序的剩余图像,但一些训练批次可能包含来自一个类的图像多于另一个。在它们之间,训练批次恰好包含来自每个类别的 5000 张图像。

OpenDataLab 收录

Breast Ultrasound Images (BUSI)

小型(约500×500像素)超声图像,适用于良性和恶性病变的分类和分割任务。

github 收录