遇见数据集

facebook/kilt_tasks

收藏
Hugging Face2024-01-04 更新2024-06-15 收录
官方服务:

资源简介:

KILT数据集是一个多任务知识密集型语言任务数据集,主要用于填充掩码、问答、文本分类、文本生成、文本检索和文本到文本生成等任务。数据集包含多个配置,如aidayago2、cweb、eli5、fever、hotpotqa、nq、structured_zeroshot、trex、triviaqa_support_only和wned。数据集为单语(英语),通过众包、已有数据和机器生成的方法创建。每个配置包含详细的特征描述,如输入、输出、元数据等,并提供了训练、验证和测试集的字节大小和示例数量。

The KILT dataset is a multi-task knowledge-intensive language task dataset mainly utilized for tasks such as masked language modeling, question answering, text classification, text generation, text retrieval, and text-to-text generation. It encompasses multiple configurations including aidayago2, cweb, eli5, fever, hotpotqa, nq, structured_zeroshot, trex, triviaqa_support_only, and wned. This monolingual (English) dataset is constructed via crowdsourcing, existing public datasets, and machine generation approaches. Each configuration includes detailed feature descriptions such as inputs, outputs, metadata, and other relevant details, and provides the byte sizes and sample counts for the training, validation, and test sets.

提供机构:
facebook
原始信息汇总

数据集概述

基本信息

  • 数据集名称: KILT
  • 语言: 英语
  • 许可证: MIT
  • 多语言性: 单语种
  • 数据集大小分类: 1K<n<10K, 10K<n<100K, 100K<n<1M, 1M<n<10M
  • 任务类别:
    • 填充掩码
    • 问答
    • 文本分类
    • 文本生成
    • 文本检索
    • 文本到文本生成
  • 任务ID:
    • 抽象问答
    • 对话建模
    • 文档检索
    • 实体链接检索
    • 抽取问答
    • 事实检查
    • 事实检查检索
    • 开放域抽象问答
    • 开放域问答
    • 槽填充

配置详情

aidayago2

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id: 字符串
  • 分割:
    • train: 18395个样本, 68943890字节
    • validation: 4784个样本, 20743172字节
    • test: 4463个样本, 14210587字节
  • 下载大小: 13419920字节
  • 数据集大小: 103897649字节

cweb

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id: 字符串
  • 分割:
    • validation: 5599个样本, 89819252字节
    • test: 5543个样本, 99208393字节
  • 下载大小: 32809813字节
  • 数据集大小: 189027645字节

eli5

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id: 字符串
  • 分割:
    • train: 272634个样本, 525554458字节
    • validation: 1507个样本, 13860033字节
    • test: 600个样本, 107092字节
  • 下载大小: 329302944字节
  • 数据集大小: 539521583字节

fever

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id: 字符串
  • 分割:
    • train: 104966个样本, 23937486字节
    • validation: 10444个样本, 3167751字节
    • test: 10100个样本, 1040116字节
  • 下载大小: 11571038字节
  • 数据集大小: 28145353字节

hotpotqa

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id: 字符串
  • 分割:
    • train: 88869个样本, 33595295字节
    • validation: 5600个样本, 2371262字节
    • test: 5569个样本, 887204字节
  • 下载大小: 17914796字节
  • 数据集大小: 36853761字节

nq

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id: 字符串
  • 分割:
    • train: 87372个样本, 30385368字节
    • validation: 2837个样本, 6190373字节
    • test: 1444个样本, 333162字节
  • 下载大小: 16535475字节
  • 数据集大小: 36908903字节

structured_zeroshot

  • 特征:
    • id: 字符串
    • input: 字符串
    • meta: 结构体
      • left_context: 字符串
      • mention: 字符串
      • right_context: 字符串
      • partial_evidence: 列表
        • start_paragraph_id: 32位整数
        • end_paragraph_id: 32位整数
        • title: 字符串
        • section: 字符串
        • wikipedia_id: 字符串
        • meta: 结构体
          • evidence_span: 字符串列表
      • obj_surface: 字符串列表
      • sub_surface: 字符串列表
      • subj_aliases: 字符串列表
      • template_questions: 字符串列表
    • output: 列表
      • answer: 字符串
      • meta: 结构体
        • score: 32位整数
      • provenance: 列表
        • bleu_score: 32位浮点数
        • start_character: 32位整数
        • start_paragraph_id: 32位整数
        • end_character: 32位整数
        • end_paragraph_id: 32位整数
        • meta: 结构体
          • fever_page_id: 字符串
          • fever_sentence_id: 32位整数
          • annotation_id: 字符串
          • yes_no_answer: 字符串
          • evidence_span: 字符串列表
        • section: 字符串
        • title: 字符串
        • wikipedia_id:
搜集汇总
数据集介绍
facebook/kilt_tasks 数据集图片
构建方式
KILT(Knowledge Intensive Language Tasks)数据集由Facebook AI研究院构建,旨在为知识密集型自然语言处理任务提供统一基准。该数据集整合了多个已有大规模资源,包括Natural Questions、TriviaQA、HotpotQA、FEVER、ELI5、Wizard of Wikipedia、T-REx、Zero-Shot RE、AIDA-YAGO2、WNED-CWEB和WNED-WIKI等。构建过程融合了众包标注、自动生成与现有数据挖掘三种方式,对每个任务实例均保留了输入文本、输出答案及其在Wikipedia上的证据来源(provenance),从而实现了任务间的标准化对齐。数据划分为训练、验证和测试三部分,各子集规模从数千到数百万条不等,整体规模覆盖1K至10M条记录。
特点
KILT数据集的核心特点在于其多任务统一性与知识溯源能力。它涵盖了问答、事实验证、实体链接、槽位填充、对话建模、文本生成与检索等十余种知识密集型任务,每个样本均包含结构化的元信息,如上下文左右片段、提及实体、部分证据段落及Wikipedia页面ID。输出侧不仅提供答案文本,还附带了BLEU分数、字符级与段落级定位信息以及细粒度的证据跨度(evidence span),支持对模型预测结果进行可解释性分析。这种设计使得KILT成为评估模型在开放域知识检索与推理方面综合性能的权威平台。
使用方法
使用KILT数据集时,可通过Hugging Face Datasets库按配置名称加载特定子集,例如`load_dataset('facebook/kilt_tasks', 'nq')`加载Natural Questions子集。每个样本包含'id'、'input'、'meta'和'output'字段,其中'input'为任务输入文本,'output'为包含'answer'和'provenance'的列表。开发者可根据任务类型(如抽取式问答、事实验证)选择合适的子集进行模型微调或评估。数据集支持fill-mask、text-generation、text2text-generation等多种任务模式,适用于基于Transformer架构的预训练语言模型。建议在加载时指定'split'参数(如'train'、'validation'、'test')以获取对应数据划分。
背景与挑战
背景概述
KILT(Knowledge Intensive Language Tasks)数据集由Meta AI研究团队于2020年创建,旨在为知识密集型自然语言处理任务提供统一的基准平台。该数据集整合了包括自然问题(Natural Questions)、HotpotQA、FEVER、TriviaQA等在内的多个知名子数据集,覆盖了从开放域问答、事实验证到实体链接、槽位填充等多种任务类型。其核心研究问题在于如何评估模型在依赖外部知识源(如维基百科)进行推理和生成时的综合能力。KILT的出现填补了以往缺乏统一评估框架的空白,通过标准化知识源和任务格式,推动了检索增强型语言模型的发展,对后续如RAG(检索增强生成)等范式的兴起产生了深远影响。
当前挑战
KILT数据集面临的核心挑战在于知识密集型任务的复杂性与多样性。首先,在领域问题层面,模型需要同时掌握检索与推理能力,即从海量知识库中精准定位相关信息,并基于此进行多跳推理、事实验证或抽象式回答,这对模型的语义理解与知识整合能力提出了极高要求。其次,在构建过程中,由于KILT整合了来源各异、标注风格不同的子数据集(如部分为众包标注、部分为机器生成),如何保证跨任务数据格式的一致性、减少标注噪声与偏差成为重大挑战。此外,各子数据集规模差异悬殊(从数千到数百万样本),如何设计公平的评估协议以避免模型对大规模任务过拟合,亦是研究难点。
常用场景
经典使用场景
在知识密集型自然语言处理任务的研究版图中,KILT(Knowledge Intensive Language Tasks)数据集以其独特的统一基准定位,成为连接知识检索与语言生成的桥梁。该数据集最经典的使用场景聚焦于开放域问答、事实验证和实体链接等任务,通过将来自Natural Questions、TriviaQA、FEVER、HotpotQA等知名数据源的样本整合至统一的维基百科知识框架下,为模型提供了端到端的知识检索与推理能力评估范式。研究者可借助其标准化的输入输出格式,在单一平台上训练和评测模型在知识检索、证据定位与答案生成方面的综合表现。
衍生相关工作
KILT数据集的发布催生了一系列具有里程碑意义的经典工作,其中最引人注目的是基于检索增强生成(RAG)范式的模型研究。例如,Facebook AI提出的RAG模型直接利用KILT作为核心评估基准,开创了将非参数化知识检索与参数化序列生成相结合的新范式,该工作发表于NeurIPS并成为后续研究的基础。此外,FiD(Fusion-in-Decoder)模型在KILT的开放域问答子集上取得了当时最优的性能,其多段落编码与融合解码的思想被广泛借鉴。在事实验证领域,KGAT(Knowledge Graph Augmented Transformer)等模型借助KILT的FEVER子集推动了图神经网络与文本推理的融合。这些工作共同构建了知识增强语言模型的理论与实践体系。
数据集最近研究
最新研究方向
KILT数据集作为知识密集型语言任务的基准平台,当前研究前沿聚焦于多任务统一预训练与检索增强生成(RAG)的深度融合。随着大语言模型对事实性知识需求的激增,该数据集的11个子任务(涵盖开放域问答、事实验证、实体链接与槽填充等)被广泛用于评估模型在结构化知识检索与生成间的协同能力。近期热点包括利用KILT进行零样本跨任务泛化研究,以及通过多跳推理证据链构建提升模型可解释性,其统一的Wikipedia知识锚点设计为构建具备持久记忆与动态知识更新的可信AI系统提供了关键评测框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务