遇见数据集

nasa-impact/nasa-smd-IR-benchmark

收藏
Hugging Face2024-10-11 更新2024-06-12 收录
官方服务:

资源简介:

NASA SMD和IBM Research共同开发了一个领域特定的信息检索基准`NASA-IR`,涵盖了地球科学、行星科学、太阳物理学、天体物理学和生物物理科学等领域。数据集包含近500个问答对,这些问答对是从AGU、AMS、ADS、PMC和PubMed中抽取的166个段落,并手动标注了每个段落的3个可回答问题,总计498个问题。其中398个问题用于训练集,100个问题用于验证集。为了全面评估信息检索系统并模拟真实世界的数据,数据集还结合了26,839个随机ADS摘要。每个查询平均长度为12个单词,每个段落平均长度为120个单词。评估指标使用Recall@10,因为每个问题只有一个相关文档。该数据集是为了支持训练和评估编码语言模型`Indus`而发布的。

NASA SMD和IBM Research共同开发了一个领域特定的信息检索基准`NASA-IR`,涵盖了地球科学、行星科学、太阳物理学、天体物理学和生物物理科学等领域。数据集包含近500个问答对,这些问答对是从AGU、AMS、ADS、PMC和PubMed中抽取的166个段落,并手动标注了每个段落的3个可回答问题,总计498个问题。其中398个问题用于训练集,100个问题用于验证集。为了全面评估信息检索系统并模拟真实世界的数据,数据集还结合了26,839个随机ADS摘要。每个查询平均长度为12个单词,每个段落平均长度为120个单词。评估指标使用Recall@10,因为每个问题只有一个相关文档。该数据集是为了支持训练和评估编码语言模型`Indus`而发布的。

提供机构:
nasa-impact
原始信息汇总

数据集概述

数据集名称

  • NASA-IR

数据集开发机构

  • NASA SMD(NASA科学任务部)
  • IBM Research

数据集内容

  • 包含近500个问题-答案对,涉及地球科学、行星科学、日地物理学、天体物理学和生物物理科学领域。
  • 从AGU、AMS、ADS、PMC和PubMed中抽样166个段落,并为每个段落手动标注了3个可回答的问题,总计498个问题。
  • 使用398个问题作为训练集,剩余100个问题作为验证集。

数据集特点

  • 结合了26,839个随机的ADS摘要与这些标注段落,以全面评估信息检索系统并模拟真实世界数据。
  • 平均每个查询长度为12个单词,每个段落长度为120个单词。
  • 使用Recall@10作为评估指标,因为每个问题只有一个相关文档。

数据集用途

  • 支持训练和评估编码语言模型"Indus"。

相关文献

  • 相关论文链接:https://arxiv.org/abs/2405.10725
搜集汇总
数据集介绍
nasa-impact/nasa-smd-IR-benchmark 数据集图片
构建方式
在科学研究领域,信息检索系统的性能评估对于知识发现至关重要。NASA-IR基准数据集由NASA空间任务理事会(SMD)与IBM研究院联合开发,旨在构建一个面向特定学科的信息检索评估资源。该数据集从AGU、AMS、ADS、PMC及PubMed等权威学术来源中精心选取了166个段落,每个段落由领域专家手动标注三个可回答的问题,最终形成包含498个问答对的集合。其中398个问题被划分为训练集,剩余100个作为验证集。为模拟真实检索场景,研究团队将标注段落与来自ADS的26,839篇随机摘要合并,构建了包含丰富噪声的检索环境。
特点
该数据集展现出显著的学科聚焦性与结构严谨性。其涵盖地球科学、行星科学、太阳物理学、天体物理学及生物物理科学五大领域,体现了跨学科的信息检索需求。平均每条查询长度为12个词,每个段落约120个词,保证了查询与文档的语义匹配难度适中。采用Recall@10作为评估指标,由于每个问题仅对应一个相关文档,该指标能够有效衡量系统在前十位检索结果中捕获唯一相关文档的能力。此外,数据集与Indus编码器语言模型的训练和评估紧密关联,为领域特定模型提供了标准化测试平台。
使用方法
研究人员可通过HuggingFace平台直接加载该数据集,其格式兼容标准信息检索任务框架。使用时需注意,训练集包含398个问答对,验证集包含100个问答对,每个问答对对应一个唯一的相关文档。在模型评估过程中,建议采用Recall@10作为核心指标,以衡量检索系统从包含26,839篇噪声文档的语料库中准确召回唯一相关段落的能力。该数据集特别适用于训练和评估面向科学文献的语义检索模型,可作为领域特定信息检索系统的基准测试工具,相关使用细节与基线结果可参考arXiv上的配套论文。
背景与挑战
背景概述
在科研信息检索领域,跨学科文献的精准定位始终是提升知识发现效率的关键瓶颈。为应对这一挑战,美国国家航空航天局(NASA)的空间任务数据部(SMD)携手IBM研究院,于近期构建了领域专用信息检索基准——NASA-IR数据集。该数据集聚焦地球科学、行星科学、太阳物理学、天体物理学及生物物理科学五大核心学科,从AGU、AMS、ADS、PMC及PubMed等权威学术源中精心采样166个段落,并手工标注了498个可回答性问题。其训练集与验证集分别包含398和100个问答对,旨在推动科学文献检索模型的评估与优化。NASA-IR的发布不仅为自然语言处理在科研场景的应用提供了标准化测试平台,更通过集成26,839篇ADS摘要构建真实检索环境,显著提升了基准的生态效度,对遥感科学、天体生物学等跨学科领域的信息提取研究产生了深远影响。
当前挑战
NASA-IR数据集所面临的挑战体现在两个层面。首先,在领域问题层面,科研文献检索的核心难题在于语义稀疏性与领域特异性——每个问题仅对应一篇相关文档,而查询平均长度仅12词,段落平均长度达120词,这种短查询-长文档的不对称性使得传统基于关键词匹配的检索系统难以精准捕捉深层语义关联,亟需模型具备跨学科知识推理与细粒度相关性判别能力。其次,在构建过程中,团队需应对多源文献格式异构、专业术语歧义性高、以及人工标注一致性保障等实操困境,例如从五大不同学科中筛选可回答性段落时,需确保问题与段落间的逻辑闭合性,避免引入无关噪声;同时,将26,839篇随机摘要与标注段落混合后,必须平衡正负样本比例以防止模型过拟合。这些挑战共同构成了推动科研检索技术革新的关键试验场。
常用场景
经典使用场景
NASA-IR基准数据集在信息检索领域扮演着标杆角色,尤其适用于评估和提升面向科学文献的检索系统性能。该数据集精心构建了近500个问答对,覆盖地球科学、行星科学、太阳物理学、天体物理学及生物物理学等多元学科领域,每段学术摘要均对应三个可回答的问题。研究者常利用该数据集训练和测试基于稠密向量检索的模型,通过Recall@10等指标度量检索质量,从而推动科学文献检索技术的精细化发展。
衍生相关工作
该数据集衍生出多项开创性工作,最典型的是与其配套发布的编码器语言模型Indus,该模型基于NASA-IR进行训练与评估,专门优化了科学文本的表示学习。此外,相关研究论文(arXiv:2405.10725)系统阐述了数据集构建方法及检索基线结果,为后续领域自适应检索模型、跨模态科学检索等方向奠定了数据基础。这些衍生工作共同推动了科学AI从通用检索向领域专用检索的范式迁移。
数据集最近研究
最新研究方向
在空间科学与地球观测数据呈指数级增长的背景下,信息检索系统的精准性成为推动科研效率的关键瓶颈。NASA-IR基准数据集由NASA空间任务理事会与IBM研究院联合构建,覆盖地球科学、行星科学、太阳物理学、天体物理学及生物物理学五大领域,包含近500个问答对,其独特之处在于融合了来自AGU、AMS、ADS等权威学术源的段落与海量ADS摘要,模拟真实科研场景中的检索挑战。当前前沿研究方向聚焦于利用该数据集训练领域专用编码器语言模型(如Indus),以提升对复杂科学文献的语义理解与检索召回率。这一工作不仅为空间科学领域的信息检索评估树立了标准化标杆,还通过公开基准推动了AI在科研数据挖掘中的落地,其影响延伸至气候变化监测、深空探测等热点议题的自动化知识发现,具有显著的跨学科方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务