遇见数据集

Asimok/KGLQA-KeySentenceSelect-QuALITY

收藏
Hugging Face2024-01-29 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: normal data_files: - split: train path: - "KGLQA-KeySentenceSelect-QuALITY/train.jsonl" - split: dev path: - "KGLQA-KeySentenceSelect-QuALITY/dev.jsonl" - split: test path: - "KGLQA-KeySentenceSelect-QuALITY/test.jsonl" - config_name: instruct data_files: - split: train path: - "KGLQA-KeySentenceSelect-QuALITY-instruct/train.jsonl" - split: dev path: - "KGLQA-KeySentenceSelect-QuALITY-instruct/dev.jsonl" - config_name: raw data_files: - split: train path: - "KGLQA-KeySentenceSelect-QuALITY-raw/*.train" - split: dev path: - "KGLQA-KeySentenceSelect-QuALITY-raw/*.dev.jsonl" - split: test path: - "KGLQA-KeySentenceSelect-QuALITY-raw/*.test.jsonl" ---

数据集配置项: - 配置名称:normal 数据文件: - 数据拆分(split):训练集,路径:["KGLQA-KeySentenceSelect-QuALITY/train.jsonl"] - 数据拆分(split):验证集,路径:["KGLQA-KeySentenceSelect-QuALITY/dev.jsonl"] - 数据拆分(split):测试集,路径:["KGLQA-KeySentenceSelect-QuALITY/test.jsonl"] - 配置名称:instruct 数据文件: - 数据拆分(split):训练集,路径:["KGLQA-KeySentenceSelect-QuALITY-instruct/train.jsonl"] - 数据拆分(split):验证集,路径:["KGLQA-KeySentenceSelect-QuALITY-instruct/dev.jsonl"] - 配置名称:raw 数据文件: - 数据拆分(split):训练集,路径:["KGLQA-KeySentenceSelect-QuALITY-raw/*.train"] - 数据拆分(split):验证集,路径:["KGLQA-KeySentenceSelect-QuALITY-raw/*.dev.jsonl"] - 数据拆分(split):测试集,路径:["KGLQA-KeySentenceSelect-QuALITY-raw/*.test.jsonl"]

提供机构:
Asimok
原始信息汇总

数据集配置详情

配置名称:normal

  • 训练集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY/train.jsonl
  • 验证集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY/dev.jsonl
  • 测试集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY/test.jsonl

配置名称:instruct

  • 训练集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY-instruct/train.jsonl
  • 验证集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY-instruct/dev.jsonl

配置名称:raw

  • 训练集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY-raw/*.train
  • 验证集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY-raw/*.dev.jsonl
  • 测试集
    • 文件路径:KGLQA-KeySentenceSelect-QuALITY-raw/*.test.jsonl
搜集汇总
数据集介绍
Asimok/KGLQA-KeySentenceSelect-QuALITY 数据集图片
构建方式
在自然语言处理领域,高质量的问答数据集对于提升模型的理解与推理能力至关重要。KGLQA-KeySentenceSelect-QuALITY数据集基于QuALITY问答语料库进行深度加工,聚焦于关键句选择任务。其构建过程首先从原始语料中提取篇章级文本与对应问题,随后通过人工标注与规则校验相结合的方式,为每个问题从原文中筛选出作为答案依据的关键句子。数据集以JSONL格式存储,并划分为normal、instruct与raw三种配置,分别对应标准问答、指令化格式以及原始未处理版本,以适配不同研究需求。训练集、开发集与测试集的划分确保了模型评估的严谨性。
特点
该数据集最显著的特点在于其任务设计的精细性——它要求模型不仅给出答案,还需从文本中定位并选择支撑答案的关键句子,从而强化了可解释性与证据溯源能力。数据规模覆盖了多样化的叙事文本,包含丰富的篇章结构与语义层次,使得模型必须综合运用局部理解与全局推理。此外,instruct配置的引入使得数据集能够直接用于指令微调,提升了与当前大语言模型训练范式的兼容性。每个样本均经过严格的质量控制,确保了标注的一致性与准确性。
使用方法
使用该数据集时,研究者可根据任务需求选择合适的配置:normal配置适用于标准的关键句选择与问答联合训练,instruct配置则更契合指令微调场景,而raw配置为自定义预处理提供了原始素材。数据加载可通过HuggingFace的datasets库便捷实现,指定配置名称与数据切分即可获取对应样本。典型用法是将篇章文本与问题作为输入,目标输出为所选关键句子的索引或内容,进而用于训练模型在理解文本基础上进行证据定位的能力。评估时可采用准确率、F1分数等指标衡量关键句选择的精确性。
背景与挑战
背景概述
在自然语言处理领域,机器阅读理解与知识推理的深度融合一直是研究的前沿课题。Asimok/KGLQA-KeySentenceSelect-QuALITY数据集由研究团队于近期构建,旨在探索如何通过关键句子选择机制提升模型在复杂问答任务中的知识利用效率。该数据集基于QuALITY基准进行扩展,聚焦于长文本理解场景中证据定位与推理链构建的核心问题。其创建机构致力于推动知识增强型语言模型的发展,通过引入结构化知识图谱与篇章级语义的交互,为评估模型在细粒度信息筛选与逻辑一致性维护方面的能力提供了标准化测试平台。这一数据集的发布对理解知识驱动型问答系统的局限性具有重要价值,尤其促进了基于检索增强生成范式的相关研究。
当前挑战
该数据集面临的核心挑战体现在多维度层面。首先,长文本中关键证据的稀疏性导致模型难以精准定位与问题相关的语义片段,传统的注意力机制在此类场景下常出现信息衰减现象。其次,知识图谱与自然语言表征之间的异构性使得跨模态对齐存在显著障碍,模型需同时处理离散符号推理与连续语义理解。在构建过程中,人工标注关键句与知识三元组的对应关系面临高成本与低一致性的矛盾,不同标注者对‘关键性’的判定标准存在主观差异。此外,数据集涵盖的篇章长度跨度极大,从数百词到数千词不等,这对现有Transformer架构的上下文窗口容量提出了严峻考验,亟需设计更高效的长程依赖建模方案。
常用场景
经典使用场景
在自然语言处理与知识图谱的交叉研究领域,KGLQA-KeySentenceSelect-QuALITY数据集为机器阅读理解任务提供了精细化的评估基准。其经典使用场景聚焦于关键句子选择(Key Sentence Selection),即从长篇文本中精准定位与问题答案最相关的核心语句。这一任务不仅考验模型对上下文语义的深层理解,还要求模型具备知识驱动的推理能力,能够将外部结构化知识(如知识图谱中的实体关系)与文本线索相结合,从而在复杂叙事文本中完成高精度的信息抽取。该数据集通过引入知识增强的问答范式,推动了阅读理解从浅层匹配向深层认知的演进。
实际应用
在实际应用层面,该数据集所定义的关键句子选择任务与智能文档审阅、法律卷宗摘要、医学文献证据检索等场景高度契合。例如,在智能法律助手系统中,模型需从冗长的判决书中提取支持特定法律主张的关键段落,而KGLQA-KeySentenceSelect-QuALITY的训练范式能够显著提升此类系统的证据定位准确率。此外,该数据集还可赋能教育领域的自适应学习平台,通过从教材文本中筛选与疑难问题直接相关的核心句子,为学生提供精准的知识点回溯,从而优化个性化学习路径的推荐质量。
衍生相关工作
该数据集的发布催生了一系列具有影响力的衍生工作。研究者基于其关键句子选择与知识图谱对齐的双重特性,提出了融合图注意力网络与预训练语言模型的混合架构,在QuALITY基准上取得了显著的性能突破。另一些工作则围绕其指令微调(instruct)配置,探索了通过自然语言指令引导模型进行细粒度证据链生成的范式,推动了少样本学习在复杂推理任务中的泛化能力。此外,该数据集还被用作评估大型语言模型在知识密集型场景下事实一致性(Factual Consistency)的测试平台,衍生出关于幻觉抑制与知识溯源的前沿方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务