five

CogComp/eraser_multi_rc|阅读理解数据集|多句问题处理数据集

收藏
hugging_face2024-01-18 更新2024-05-25 收录
阅读理解
多句问题处理
下载链接:
https://hf-mirror.com/datasets/CogComp/eraser_multi_rc
下载链接
链接失效反馈
资源简介:
Eraser MultiRC(多句子阅读理解)是一个包含短段落和多句子问题的数据集,问题的答案可以从段落内容中得出。数据集设计时考虑了三个关键挑战:每个问题的正确答案数量未预先指定、正确答案不一定是文本中的片段、段落来源多样。数据集的目的是鼓励研究社区探索超越词汇级别匹配的方法。数据集包含训练集、验证集和测试集,分别有24029、3214和4848个样本。数据字段包括passage、query_and_answer、label和evidences。

Eraser MultiRC(多句子阅读理解)是一个包含短段落和多句子问题的数据集,问题的答案可以从段落内容中得出。数据集设计时考虑了三个关键挑战:每个问题的正确答案数量未预先指定、正确答案不一定是文本中的片段、段落来源多样。数据集的目的是鼓励研究社区探索超越词汇级别匹配的方法。数据集包含训练集、验证集和测试集,分别有24029、3214和4848个样本。数据字段包括passage、query_and_answer、label和evidences。
提供机构:
CogComp
原始信息汇总

数据集概述

名称: Eraser MultiRC (Multi-Sentence Reading Comprehension)

语言: 英语 (en)

许可证: 其他

多语言性: 单语

大小类别: 10K<n<100K

来源数据集: 原创

任务类别: 多项选择

任务ID: 多项选择-qa

数据集结构

数据实例

  • 字段:
    • passage: 字符串类型
    • query_and_answer: 字符串类型
    • label: 分类标签,包括 False (0) 和 True (1)
    • evidences: 字符串序列列表

数据分割

名称 训练 验证 测试
默认 24029 3214 4848

数据集创建

许可证信息

  • 许可证: 研究与学术使用许可证,由伊利诺伊大学厄巴纳-香槟分校认知计算组提供。
  • 条款: 允许学术和研究目的的使用、衍生作品的创建和分发,禁止商业使用。

引用信息

@unpublished{eraser2019, title = {ERASER: A Benchmark to Evaluate Rationalized NLP Models}, author = {Jay DeYoung and Sarthak Jain and Nazneen Fatema Rajani and Eric Lehman and Caiming Xiong and Richard Socher and Byron C. Wallace} } @inproceedings{MultiRC2018, author = {Daniel Khashabi and Snigdha Chaturvedi and Michael Roth and Shyam Upadhyay and Dan Roth}, title = {Looking beyond the Surface: A Challenge Set for Reading Comprehension over Multiple Sentences}, booktitle = {Proceedings of North American Chapter of the Association for Computational Linguistics (NAACL)}, year = {2018} }

用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4098个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

Materials Project 在线材料数据库

Materials Project 是一个由伯克利加州大学和劳伦斯伯克利国家实验室于 2011 年共同发起的大型开放式在线材料数据库。这个项目的目标是利用高通量第一性原理计算,为超过百万种无机材料提供全面的性能数据、结构信息和计算模拟结果,以此加速新材料的发现和创新过程。数据库中的数据不仅包括晶体结构和能量特性,还涵盖了电子结构和热力学性质等详尽信息,为研究人员提供了丰富的材料数据资源。相关论文成果为「Commentary: The Materials Project: A materials genome approach to accelerating materials innovation」。

超神经 收录

马达加斯加岛 – 世界地理数据大百科辞条

马达加斯加岛在非洲的东南部,位于11o56′59″S - 25o36′25″S及43o11′18″E - 50o29′36″E之间。通过莫桑比克海峡与位于非洲大陆的莫桑比克相望,最近距离为415千米。临近的岛屿分别为西北部的科摩罗群岛、北部的塞舌尔群岛、东部的毛里求斯岛和留尼汪岛等。在google earth 2015年遥感影像基础上研发的马达加斯加海岸线数据集表明,马达加斯加岛面积591,128.68平方千米,其中马达加斯加本岛面积589,015.06平方千米,周边小岛面积为2,113.62平方千米。马达加斯加本岛是非洲第一大岛,是仅次于格陵兰、新几内亚岛和加里曼丹岛的世界第四大岛屿。岛的形状呈南北走向狭长纺锤形,南北向长1,572千米;南北窄,中部宽,最宽处达574千米。海岸线总长16,309.27千米, 其中马达加斯加本岛海岸线长10,899.03千米,周边小岛海岸线长5,410.24千米。马达加斯加岛属于马达加斯加共和国。全国共划分22个区,119个县。22个区分别为:阿那拉芒加区,第亚那区,上马齐亚特拉区,博爱尼区,阿齐那那那区,阿齐莫-安德列发那区,萨瓦区,伊达西区,法基南卡拉塔区,邦古拉法区,索非亚区,贝齐博卡区,梅拉基区,阿拉奥特拉-曼古罗区,阿那拉兰基罗富区,阿莫罗尼马尼亚区,法土法韦-非图韦那尼区,阿齐莫-阿齐那那那区,伊霍罗贝区,美那贝区,安德罗伊区和阿诺西区。首都安塔那那利佛(Antananarivo)位于岛屿的中东部。马达加斯加岛是由火山及喀斯特地貌为主。贯穿海岛的是巨大火山岩山体-察腊塔纳山,其主峰马鲁穆库特鲁山(Maromokotro)海拔2,876米,是全国最高峰。马达加斯加自然景观垂直地带性分异显著,是热带雨林和热带草原广布的地区。岛上大约有20多万种动植物,其中包括马达加斯加特有物种狐猴(Lemur catta)、马达加斯加国树猴面包树(Adansonia digitata L.)等。

国家对地观测科学数据中心 收录

DAT

DAT是一个统一的跨场景跨领域基准,用于开放世界无人机主动跟踪。它提供了24个视觉复杂的场景,以评估算法的跨场景和跨领域泛化能力,并具有高保真度的现实机器人动力学建模。

github 收录

UniProt

UniProt(Universal Protein Resource)是全球公认的蛋白质序列与功能信息权威数据库,由欧洲生物信息学研究所(EBI)、瑞士生物信息学研究所(SIB)和美国蛋白质信息资源中心(PIR)联合运营。该数据库以其广度和深度兼备的蛋白质信息资源闻名,整合了实验验证的高质量数据与大规模预测的自动注释内容,涵盖从分子序列、结构到功能的全面信息。UniProt核心包括注释详尽的UniProtKB知识库(分为人工校验的Swiss-Prot和自动生成的TrEMBL),以及支持高效序列聚类分析的UniRef和全局蛋白质序列归档的UniParc。其卓越的数据质量和多样化的检索工具,为基础研究和药物研发提供了无可替代的支持,成为生物学研究中不可或缺的资源。

www.uniprot.org 收录

Apple Stock Price Data

Historical stock price data for AAPL (apple)

kaggle 收录