遇见数据集

FOSSIL (Footnote-based Open-access SSH Scientific Instance Labels)

收藏
arXiv2026-05-31 更新2026-06-05 收录
官方服务:

资源简介:

FOSSIL数据集是一个面向法律与人文学科的多语言开放获取标注语料库,由葡萄牙ScienciaLAB和德国马克斯·普朗克法律史与法律理论研究所联合创建,旨在解决脚注中引文提取的难题。该数据集包含96篇学术文章,涵盖法律、人文、历史和社会科学等多个学科,涉及英语、葡萄牙语、意大利语和德语,时间跨度为1959年至2025年,共标注了约7,600条参考文献。其构建过程采用基于Grobid架构的PDF-TEI Editor工具,通过多人协作的五阶段标注工作流程完成,确保了数据的高质量和一致性。该数据集主要应用于法律与人文学科的引文解析、信息抽取和知识图谱构建,为训练和评估领域专用模型提供了关键资源,以应对脚注中混杂的参考文献、交叉引用和评论内容所带来的解析挑战。

FOSSIL Dataset is a multilingual open access annotated corpus tailored for law and humanities, co-developed by ScienciaLAB from Portugal and the Max Planck Institute for Legal History and Legal Theory in Germany. It aims to address the challenge of citation extraction from footnotes. The dataset comprises 96 academic articles spanning multiple disciplines including law, humanities, history and social sciences, covering four languages: English, Portuguese, Italian and German, with a time span from 1959 to 2025, and a total of approximately 7,600 annotated references. Its construction adopts the PDF-TEI Editor tool based on the Grobid architecture, and is completed through a five-stage collaborative annotation workflow involving multiple contributors, ensuring high data quality and consistency. This dataset is primarily applied to citation parsing, information extraction and knowledge graph construction in law and humanities, providing a critical resource for training and evaluating domain-specific models to tackle the parsing challenges posed by mixed references, cross-references and commentaries in footnotes.

创建时间:
2026-05-31
搜集汇总
数据集介绍
FOSSIL (Footnote-based Open-access SSH Scientific Instance Labels) 数据集图片
构建方式
在法学与人文学科中,引文常以脚注形式呈现,并与评论、交叉引用等混杂,给传统抽取方法带来巨大挑战。FOSSIL数据集基于Grobid架构,采用分层设计构建。首先,研究团队从DOAJ和CrossRef收录的开放获取期刊中筛选出96篇多语种文章,涵盖法学、人文学科、历史学与社会科学。其次,依托自主开发的PDF-TEI Editor在线协作标注工具,经过预标注、双重修正、资深评审与反馈迭代的五阶段流程,由七名标注员完成三层标注:文章结构分割、参考文献分割及引文解析。最终形成包含逾7600条脚注引文的高质量多层级标注数据集。
特点
FOSSIL数据集具有鲜明的领域针对性与开放属性。它是首个面向法律学术文献的大规模开放许可脚注引用资源,覆盖英语、葡萄牙语、意大利语与德语等多种语言,文献时间跨度从1959年至2025年。数据集包含约2400个脚注块,其中约500个为评论性脚注、1900个为书目性脚注,平均每篇文章含约100条参考文献。特别值得关注的是,FOSSIL在注释中创新性地编码了交叉引用类型(如同上注、参见前注等),并严格遵循TEI标准,支持按层级单独或端到端使用,极大增强了数据复用灵活性。
使用方法
FOSSIL数据集支持灵活的使用方式以适应不同研究需求。用户既可下载整合后的完整注释文件,也可按文章分割、参考文献分割和引文解析三个层级分别获取独立标注数据,便于针对特定子任务训练或评估模型。数据集直接兼容Grobid框架,研究者可将其作为专门化处理流程投入端到端引文抽取系统,也可与LLaMore等评估工具联合使用进行精确度评测。此外,借助FOSSIL预训练的领域专用分割模型已公开可用,用户可通过替换Grobid标准流水线中的相应组件,快速构建面向法学与人文学科的定制化引文抽取管道,实现显著性能提升。
背景与挑战
背景概述
在人文社科领域,参考文献的引用方式与自然科学迥异,学者们惯于在脚注中嵌入书目信息,同时夹杂评注、说明与交叉引用,形成高度异构且难以解析的内容。为应对这一挑战,Luca Foppiano与Christian Boulanger率领团队于2026年构建了FOSSIL(Footnote-based Open-access SSH Scientific Instance Labels)数据集。该数据集依托马克斯·普朗克法律史与法律理论研究所,包含96篇经人工标注的学术论文,涵盖法律、人文学科、历史学与社会科学等多学科,语种涉及英语、葡萄牙语、意大利语与德语,其核心研究问题在于为脚注式引用提取提供高质量、开放许可的基准资源。FOSSIL作为首个面向法学脚注引文的大规模开放数据集,填补了该领域金标准数据的空白,为评估大语言模型及训练传统序列标注模型奠定了关键基础。
当前挑战
FOSSIL数据集面对的挑战具有双重性。首先,在领域问题层面,脚注中引用内容与评注、交叉引用交织,且引文风格随语言、学科与期刊剧烈变化,标准的模式化方法难以应对这种异构性;同一参考文献常以简略形式出现,指向先前脚注,进一步加剧了解析难度。其次,在数据集构建过程中,团队需处理五种反复出现的脚注内容类型——纯评注、传记信息、可拆分参考文献、交叉引用以及混合内容,并在标注流程中确保一致性。为此,七名标注员历经十轮批处理与五阶段迭代,通过双人校正与高级审查机制,最终在分段任务上达到了0.917的Krippendorff’s α信度,展现了克服数据复杂性的严谨设计。
常用场景
经典使用场景
在法律与人文学术研究中,脚注是承载参考文献的核心载体,但其内容常与评注、解释及互见引用交织,呈现出高度异质性的结构。FOSSIL数据集收录了96篇来自38种开放获取期刊、涵盖多语种(英语、葡萄牙语、意大利语、德语)的学术论文,包含超过7600条嵌入于约2400个脚注块中的参考文献。该数据集的经典使用场景在于为脚注参考文献的自动提取与解析提供高质量的训练与评估基准,尤其适用于训练序列标注模型以识别和分割脚注中的混合内容,并支持从文档结构分割到参考文献解析的端到端流程优化。
衍生相关工作
FOSSIL的发布催生了一系列关注脚注参考文献解析的学术进展。Zhu等人(2026)基于FOSSIL基准对比了多种开源大语言模型与Grobid的性能,证实微调后的LLM在非英语和脚注密集型文档上具有更强分布鲁棒性,并提出Grobid与任务适应型LLM相结合的路由策略。同时,该数据集为LoRA参数高效微调方法的实验提供了标准化评估语料,并激励了端到端神经架构的设计,以联合优化文档结构分割与参考文献解析。此外,跨参考文献消解方向的研究亦因FOSSIL对互见引用的系统标注而获得新的数据驱动力。
数据集最近研究
最新研究方向
面对法律与人文学科中脚注引用的高度异质性与解析难题,FOSSIL数据集的问世标志着该领域向开放、可复现的标注资源迈出了关键一步。当前前沿研究正聚焦于将大型语言模型与经典序列标注框架深度融合,通过LoRA微调或端到端神经架构实现对文章分割、参考文献分割与引文解析的联合优化。该数据集不仅为评估LLM在社会科学与人文学科引文抽取中的鲁棒性提供了黄金标准基准,更推动了跨语言、跨学科脚注引用解析的领域自适应研究。其显著提升的召回率(微平均F1从0.36跃升至0.72)表明,针对脚注密集型文献的专门化模型训练是弥合自然科学与人文社科引文处理鸿沟的可行路径,也为构建更为通用的学术知识图谱奠定了数据基础。
相关研究论文
  • 1
    Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities葡萄牙ScienciaLAB; 德国马克斯·普朗克法律史与法律理论研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务