遇见数据集

IVUL-KAUST/MOLE

收藏
Hugging Face2025-09-20 更新2025-07-05 收录
官方服务:

资源简介:

MOLE是一个用于评估和验证从科学论文中提取的元数据的中文数据集,包含52篇注释论文的元数据信息,支持多种语言。该数据集旨在为特征提取和验证任务提供支持。

MOLE is a Chinese dataset for evaluating and validating metadata extracted from scientific papers, containing metadata information of 52 annotated papers in multiple languages. It is designed to support feature extraction and validation tasks.

提供机构:
IVUL-KAUST
搜集汇总
数据集介绍
构建方式
MOLE数据集由IVUL-KAUST团队构建,旨在为科学文献中的元数据提取与验证提供标准化评估基准。该数据集基于对52篇经过精细标注的学术论文进行系统整理而成,每篇论文均依据预定义的元数据架构进行结构化标注。数据集涵盖了包括数据集名称、子集、链接、许可协议、出版年份、语言、方言、领域、形式、采集方式、规模、单位、伦理风险、提供者、来源、论文标题、脚本、是否分词、托管平台、访问方式、费用、测试集划分、任务类型、会议信息、作者、机构及摘要等在内的34个核心特征。此外,每个特征均配备一个二进制标识字段,用于指示该元数据是否可从原文中明确获取,从而为评估模型的提取完备性提供量化依据。
特点
MOLE数据集的核心特点在于其多维度的元数据覆盖与细粒度的可验证性设计。其元数据架构不仅包括常规的文献基本信息,还深入涉及数据集的伦理风险评估、采集方式、方言与脚本等专业属性,能够全面反映科学数据集的复杂生态。尤为突出的是,数据集引入了‘attribute_exist’二进制标识体系,针对每篇论文的每个元数据字段记录其可提取性状态,这一设计使得模型评估不再局限于简单的正确率,而是能够深入分析模型在不同元数据维度上的提取能力与盲区。此外,数据集涵盖英语、阿拉伯语、法语、日语、俄语等多语言论文,并包含多种方言与领域数据,具有显著的语言与领域多样性,为跨语言与跨领域的元数据提取研究提供了宝贵的测试资源。
使用方法
MOLE数据集可通过Hugging Face Datasets库便捷加载,用户仅需调用`load_dataset('IVUL-KAUST/mole')`即可获取训练集数据。数据集以JSON格式存储,每个样本对应一篇论文的完整元数据记录,包含所有预定义字段及其对应的二进制存在性标识。研究人员可直接使用该数据集评估大语言模型在科学文献元数据提取任务上的表现,通过对比模型输出与数据集中的标准标注,计算各字段的提取准确率与完整性指标。同时,由于数据集提供了详细的元数据架构定义与样本示例,用户亦可将其作为微调数据,训练专门用于科学文献信息抽取的模型。值得注意的是,当前版本包含132条训练样本,规模较小,适用于小样本学习与基准测试场景。
背景与挑战
背景概述
随着学术出版物的指数级增长,从海量科学文献中高效、准确地提取结构化元数据已成为自然语言处理与知识图谱构建领域的一项核心挑战。在此背景下,由沙特阿拉伯阿卜杜拉国王科技大学(KAUST)的Zaid Alyafeai、Maged S. Al-Shaibani与Bernard Ghanem研究团队于2025年创建的MOLE数据集应运而生。该数据集专注于评估与验证从科学论文中提取元数据的能力,其核心研究问题在于如何系统性地衡量大语言模型(LLM)在解析论文标题、作者、机构、许可协议等关键元数据字段时的性能。MOLE数据集通过提供52篇经过精细人工标注的学术论文样本,为元数据提取任务建立了标准化的评估基准,填补了该领域缺乏高质量验证集的空白,对推动自动化文献管理、学术搜索引擎优化及科研诚信审查等应用具有显著的奠基性影响。
当前挑战
MOLE数据集所面临的挑战首先体现在领域问题层面:元数据提取任务要求模型不仅理解自由文本的语义,还需精准识别并结构化数十种不同属性的信息(如方言、脚本、伦理风险等),这比传统的文本分类或命名实体识别更为复杂,对LLM的细粒度理解与跨领域泛化能力提出了极高要求。在数据集构建过程中,挑战同样严峻:人工标注52篇论文的完整元数据需要领域专家逐一对每篇论文的摘要、正文及引用信息进行核验,确保如“Derived From”等稀有字段的准确性,标注成本高昂且一致性难以保证。此外,当前数据集规模较小(仅132条训练样本),可能不足以充分评估LLM在多样化论文类型上的表现,亟需扩展以覆盖更多学科与语种,从而提升评估的鲁棒性与代表性。
常用场景
经典使用场景
在自然语言处理与科学文献计量学交叉领域,MOLE数据集为元数据抽取与验证任务提供了标准化的评估基准。该数据集精选了涵盖多语种、多领域的高质量科学论文,通过精细标注论文标题、作者、机构、出版年份、许可协议等32项元数据属性,并引入二值化存在性标记,使得研究者能够系统性地评估大语言模型在结构化信息抽取上的表现。其经典使用场景聚焦于从非结构化论文文本中自动提取元数据字段,并验证提取结果的完整性与准确性,成为推动科学文献自动化管理的关键测试平台。
解决学术问题
MOLE数据集直面学术研究中科学论文元数据自动化抽取面临的核心挑战,即缺乏统一、多维度、跨语种的标注基准。传统方法依赖于规则或小规模人工校验,难以适应海量文献的异构性与语种多样性。该数据集通过提供涵盖英语、阿拉伯语、法语、日语、俄语等多语种论文的精细标注,解决了元数据字段缺失、格式不统一及语义歧义等长期困扰学术界的难题。其意义在于为信息检索、知识图谱构建及学术影响力分析等下游任务奠定了可靠的数据基础,显著推动了文献计量学与自然语言处理技术的深度融合。
衍生相关工作
围绕MOLE数据集已衍生出一系列具有影响力的研究工作,主要聚焦于大语言模型在科学文献元数据抽取中的能力边界探索。例如,研究者利用该数据集对比了GPT-4、Llama等模型在零样本与微调场景下的抽取性能,揭示了模型对低资源语种与复杂元数据属性(如伦理风险等级)的处理短板。另有工作基于其标注结构,开发了多任务联合学习框架,将属性存在性预测与字段值抽取协同优化。这些衍生工作不仅深化了对元数据抽取任务的理解,也为未来构建更鲁棒、更通用的科学文献理解系统指明了方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务