WebQuestions QA Benchmarking Dataset
收藏资源简介:
WebQuestions是一个流行的数据集,用于基准测试QA引擎,特别是那些在结构化知识库上工作的引擎。该数据集通过为每个问题分配唯一ID,并提供额外的注释,如问题和Freebase的相关性,以及基于主题的分割,使其更加组织化和易于使用。
WebQuestions is a popular dataset used for benchmarking question answering (QA) engines, especially those tailored for structured knowledge bases. This dataset is rendered more organized and user-friendly by assigning a unique identifier to each question, alongside supplementary annotations including the relevance between each question and Freebase, as well as topic-based splitting.
WebQuestions QA Benchmarking Dataset
概述
WebQuestions是一个用于基准测试QA引擎的数据集,特别是那些处理结构化知识库的引擎。该数据集经过整理,每个问题都分配了一个唯一ID,并提供了额外的注释,例如与问题和Freebase相关的信息。此外,还提供了几个基于主题的拆分。
数据集版本
这是一个开发版本的数据集,使用时请引用Git仓库和最后一次提交的日期及短ID。数据格式和问题集目前没有稳定性保证。该数据集遵循CC-BY 4.0许可协议。
数据目录
main/:包含数据集的拆分。d-dump/:包含来自YodaQA的问题转储。d-freebase/:包含从问题到单个Freebase键的映射。d-freebase-mids/:包含每个问题中每个概念的Freebase mids。d-freebase-rp/:包含额外自定义计算的Freebase关系路径。d-freebase-brp/:包含额外自定义计算的分支Freebase关系路径。d-entities/:包含在问题文本中检测到的实体出现。t-movies/:包含与电影主题相关的问题子拆分。
拆分
原始WebQuestions数据集包含train(3778个问题)和test(2032个问题)拆分。该数据集保留了这些问题在其各自的拆分中,但将train进一步拆分为几个子拆分,以利于机器学习方法的应用:
- devtest(189个问题):用于开发但不适用于训练模型的问题集。
- val(755个问题):验证集,用于测试模型性能。
- trainmodel(2834个问题):用于模型训练的问题集。
数据模型
问题标识符采用"wqr%06d"(train)或"wqs%06d"(test)的形式,其中%06d是基于原始数据集顺序分配的六位数。主JSON文件包含每个问题的对象,每个对象具有字符串属性"qId"、字符串属性"qText"和一个字符串数组属性"answers"。
数据生成
- 生成包含完整train拆分的.json文件,运行
scripts/mktrain.py。 - 构建每个拆分的包含每个问题完整数据的单个文件,运行
scripts/fulldata.py。 - 构建YodaQA兼容的TSV格式数据集,运行
scripts/json2tsv.pl。




