遇见数据集

WorkInTheDark/FairytaleQA

收藏
Hugging Face2023-08-22 更新2024-03-04 收录
官方服务:

资源简介:

这是FairytaleQA数据集的存储库,一个专注于叙事理解的开源数据集,目标用户是从幼儿园到八年级的学生。FairytaleQA数据集由教育专家基于证据支持的理论框架进行注释。它包含10,580个明确和隐含的问题,这些问题来源于278个适合儿童的故事,涵盖了七种叙事元素或关系。

This is the repository for the FairytaleQA dataset, an open-source dataset focused on narrative comprehension, targeting students from kindergarten to eighth grade. The FairytaleQA dataset is annotated by educational experts based on an evidence-backed theoretical framework. It contains 10,580 explicit and implicit questions derived from 278 child-friendly stories, covering seven narrative elements or relationships.

提供机构:
WorkInTheDark
原始信息汇总

数据集概述:FairytaleQA

数据集描述

  • 数据集名称:FairytaleQA
  • 数据集目的:专注于叙事理解,针对幼儿园至八年级学生。
  • 数据集规模:包含10,580个明确和隐含问题,源自278个儿童友好故事。
  • 数据集特点:由教育专家基于证据的理论框架进行标注,涵盖七种类型的叙事元素或关系。

支持的任务

  • 问答(Question-Answering)
  • 问题生成(Question-Generation)
  • 问答对生成(Question-Answer Pair Generation)

语言

  • 英语(English)

数据集结构

数据实例

  • 示例字段
    • story_name:故事名称
    • story_section:与问答对相关的故事部分
    • question:问题内容
    • answer1:第一个答案
    • answer2:第二个答案(仅在测试/验证集提供)
    • local-or-sum:问题关联的故事部分类型(局部或总结)
    • attribute:由教育专家分类的七种叙事元素之一
    • ex-or-im:答案的明确性(明确或隐含)
    • ex-or-im2:另一个标注者的明确性标注(仅在测试/验证集提供)

数据分割

  • 训练集:232本书,8548个问答对
  • 验证集:23本书,1025个问答对
  • 测试集:23本书,1007个问答对

许可证

  • Apache-2.0

引用信息

@inproceedings{xu2022fairytaleqa, author={Xu, Ying and Wang, Dakuo and Yu, Mo and Ritchie, Daniel and Yao, Bingsheng and Wu, Tongshuang and Zhang, Zheng and Li, Toby Jia-Jun and Bradford, Nora and Sun, Branda and Hoang, Tran Bao and Sang, Yisi and Hou, Yufang and Ma, Xiaojuan and Yang, Diyi and Peng, Nanyun and Yu, Zhou and Warschauer, Mark}, title = {Fantastic Questions and Where to Find Them: Fairytale{QA} -- An Authentic Dataset for Narrative Comprehension}, publisher = {Association for Computational Linguistics}, year = {2022} }

搜集汇总
数据集介绍
构建方式
在阅读理解与教育评估的交叉领域中,FairytaleQA数据集应运而生,专为K-8年级学生的叙事理解能力而设计。该数据集由教育专家基于循证理论框架精心构建,从278篇儿童友好型故事中提炼出10,580个显性与隐性问答对。每个问答对均标注了故事来源、文本段落、问题类型(显性/隐性)、叙事元素(如角色、设定、行为、情感、因果关系等七类)以及问题覆盖范围(局部或全局),确保了数据在认知层次与叙事结构上的全面覆盖。训练集、验证集与测试集分别包含232本故事(8,548对)、23本故事(1,025对)与23本故事(1,007对),为模型训练与评估提供了均衡的分割。
使用方法
FairytaleQA的设计支持多种自然语言处理任务,包括问答、问题生成以及问答对联合生成。用户可直接使用HuggingFace Datasets库加载数据,每个实例以字典形式呈现,包含故事名称、相关文本段落、问题、答案及多维标注字段。对于问答任务,模型需基于给定故事段落回答显性或隐性问题;对于生成任务,则可利用叙事元素标签(attribute)与类型标签(local-or-sum)作为条件输入,生成符合特定认知层级的问题或答案。该数据集采用Apache-2.0许可协议,便于学术研究与商业应用,研究者可通过公开的GitHub仓库获取完整代码与预处理脚本,实现快速复现与扩展。
背景与挑战
背景概述
叙事理解是自然语言处理与教育领域交叉的重要研究方向,尤其对于低龄学习者而言,基于故事文本的问答能力是评估其认知发展水平的关键指标。在此背景下,由加州大学尔湾分校、IBM研究院等多所机构的研究人员于2022年发布的FairytaleQA数据集应运而生。该数据集基于教育学领域证据驱动的理论框架,由教育专家精心标注,涵盖278篇儿童友好故事,共包含10,580个显性与隐性问题,覆盖角色、场景、行动、情感、因果关系、结局解决等七种叙事元素。其提出不仅为自动问答与问题生成任务提供了高质量教育资源,更推动了叙事理解评估从浅层事实检索向深层推理的范式转变,在ACL 2022上发表后迅速成为相关领域的重要基准。
当前挑战
FairytaleQA数据集所面临的挑战主要体现在两个维度。在领域问题层面,叙事理解任务要求模型不仅具备局部文本检索能力,还需捕捉跨段落的情节关联与隐含因果逻辑,这对现有神经模型的长文本建模与常识推理能力构成严峻考验。在构建过程中,教育专家需在保持问题多样性的同时确保标注一致性,例如对同一故事片段生成显性与隐性问题时,不同标注者可能对“隐含”程度的判断存在偏差;此外,覆盖七种叙事元素的问题分布需平衡,避免某一类元素(如因果关系)因语义复杂而出现标注偏差,这对标注指南的细化与质量控制提出了高要求。
常用场景
经典使用场景
在自然语言处理与教育技术的交叉领域,FairytaleQA数据集被广泛用于构建和评估面向儿童的叙事理解系统。其经典应用场景聚焦于基于童话故事的问答任务,涵盖显性与隐性问题的生成与回答,尤其强调对叙事元素(如角色、情节、因果关系)的深层理解。研究者借助该数据集训练模型,使其能够从多段落文本中定位关键信息并推断隐含语义,从而提升机器在低龄教育场景下的语言交互能力。
解决学术问题
该数据集的核心学术贡献在于填补了面向基础教育阶段叙事理解研究的资源空白。传统问答数据集多聚焦于事实性知识,而FairytaleQA基于教育心理学理论框架,系统标注了七类叙事关系,解决了模型在因果推理、情感归因与结局总结等复杂认知任务上的评估难题。它为探究显性与隐性知识提取差异提供了标准化基准,推动了可解释性问答与教育导向的文本生成领域的发展。
实际应用
在实际应用中,FairytaleQA赋能智能教育辅导系统,支持个性化阅读能力诊断与自适应提问。例如,系统可根据学生回答的准确性自动调整故事难度与问题类型,辅助教师识别学生在因果推理或情感理解上的薄弱环节。此外,该数据集被整合至儿童语音交互设备中,使虚拟助手能够根据故事内容生成启发式问题,促进学龄前至初中阶段学生的批判性思维与叙事能力发展。
数据集最近研究
最新研究方向
FairytaleQA数据集聚焦于叙事文本的深度理解,其前沿研究方向集中于基于教育心理学的自动问答与问题生成,尤其关注儿童认知发展中的推理能力评估。该数据集由教育专家依据证据驱动理论框架标注,涵盖因果推理、情感归因等七类叙事元素,为构建可解释的智能教育系统提供了高质量基准。当前研究热点包括利用该数据集训练面向低龄学习者的对话式AI,以支持个性化阅读辅导;同时,其显性与隐性问题的二元结构被用于探索机器在多跳推理与常识推理中的表现,推动了自然语言处理在基础教育领域的应用。该数据集的发布促进了从机械式问答向深层叙事理解的范式转变,对智能教育评估与自适应学习系统的研发具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务