awesome-question-answering
收藏资源简介:
这是一个关于问答(Question Answering)领域的精选资源合集,涵盖相关数据集、论文等资源。合集以Awesome List形式组织,旨在收集和索引多个问答相关的数据集,主题领域包括自然语言处理、知识库问答、对话系统等,内容涉及资源整理和推荐,而非具体数据集的发布或代码实现。
This is a curated resource collection in the field of Question Answering (QA), encompassing relevant resources such as datasets and academic papers. Organized as an Awesome List, this collection aims to collect and index multiple QA-related datasets, covering thematic areas including natural language processing (NLP), knowledge-based question answering, and dialogue systems, among others. Its core focus lies in resource organization and recommendation, rather than the release of specific datasets or code implementations.
数据集详情概述
该页面是一个精选的问答(Question Answering)相关资源列表,涵盖了论文、数据集等多个方面。以下是对其中Datasets(数据集)部分的总结。
核心数据集列表
页面列出了多个用于问答任务的数据集,具体如下:
- bAbI dataset:由Facebook Research提供,用于测试模型在多种推理任务上的能力。
- CNN QA Task (Teaching Machines to Read & Comprehend):来自DeepMind,用于阅读理解任务。
- WebQuestions:来自斯坦福大学,是一个基于知识库的问答数据集。
- Simple Questions:同样来自Facebook Research,专注于简单事实型问答。
- Movie QA:基于电影的问答数据集,由Facebook Research提供。
- WebQuestionsSP:微软提供的,WebQuestions的扩充版本,包含语义解析标注。
- WikiQA:微软提供的,基于维基百科的开放域问答数据集。
- Kaggle AllenAI Challenge:来自Kaggle的艾伦人工智能科学挑战赛数据集。
- MC Test (Machine Comprehension Test Microsoft 2013):微软2013年发布的机器阅读理解测试集。
- MSR Sentence Completion Challenge:微软研究院的句子补全挑战数据集。
- Dialog State Tracking Challenge:对话状态跟踪挑战赛数据集。
- QA dataset featured in Teaching Machines to Read and Comprehend:与DeepMind的阅读理解论文配套的数据集。
- WebNav:用于网络导航任务的问答数据集。
- Stanford Question Answering Dataset (SQuAD):斯坦福大学的大规模机器阅读理解数据集。
- FB15K Knowledge Base:微软提供的,包含15,000个实体的知识库子集。
- Yahoo! Answers Comprehensive Questions and Answers version 1.0 (multi part):雅虎问答的综合数据集(多部分)。
- Cornell Movie Dialogue Dataset:康奈尔大学提供的电影对话数据集。
- WikiQA:微软提供的另一版WikiQA数据集(同一概念的不同链接)。
- Quora Duplicate Questions Dataset:Quora的重复问题识别数据集。
- Query Reformulator Dataset Jeopardy etc:基于《Jeopardy!》等来源的查询改写数据集。
- Quiz Bowl Questions:来自科罗拉多大学博尔德分校的问答比赛数据集。
- WebQA-Chinese:百度提供的中文WebQA数据集。
- Chat corpus:聊天语料库。
- MultiRC:来自伊利诺伊大学厄巴纳-香槟分校的Multi-Sentence Reading Comprehension数据集。
- NewsQA:来自Maluuba的新闻问答数据集。
其他相关资源
- Knowledge Bases (KBs):列出了两个知识库资源:NetBase 和 Freebase。
- Language Model Datasets (LM Datasets):列出了两个语言模型常用数据集:PennTree Bank 和 Text8。
- Code & Relevant Projects:列出了多个与问答相关的代码库和项目,例如MemNN、Key Value MemNN、ParlAI、BiAttnFlow等。





