遇见数据集

HIPE-2026数据集

收藏
arXiv2026-06-24 更新2026-06-26 收录
官方服务:

资源简介:

HIPE-2026数据集是由苏黎世大学等机构创建的多语言历史文本关系抽取基准,旨在从嘈杂的数字化文献中提取人物与地点之间的时序关系。该数据集包含法语、德语和英语的19-20世纪历史报纸文本,以及16-18世纪早期现代法语文学文本作为泛化测试集,数据量涵盖数百个文档和数千个候选关系对,通过人工和GPT-4.1辅助标注构建。其核心应用是支持数字人文研究,通过建模‘at’和‘isAt’两类时序关系,解决历史人物轨迹重建和知识图谱构建中的信息提取挑战。

The HIPE-2026 dataset is a multilingual historical text relation extraction benchmark created by the University of Zurich and other institutions, aiming to extract temporal relations between persons and locations from noisy digitized documents. This dataset includes 19th-20th century historical newspaper texts in French, German and English, as well as early modern French literary texts from the 16th to 18th centuries as its generalization test set. It comprises hundreds of documents and thousands of candidate relation pairs, and is constructed via manual and GPT-4.1-assisted annotation. Its core application is to support digital humanities research, by modeling two types of temporal relations, "at" and "isAt", to address information extraction challenges in historical person trajectory reconstruction and knowledge graph construction.

创建时间:
2026-06-24
原始信息汇总

数据集概述

HIPE-2026-data 是专为 HIPE 2026 共享任务(CLEF 2026 评估实验室)准备的数据集,旨在从多语言历史文档中提取和限定人物-地点关系,回答“谁在何时何地”的问题,从而重构生命轨迹、追踪流动模式并识别地方背景中的行动者。

关键信息

  • 任务目标:从多语言历史文档中提取人物-地点关系。
  • 官方网站:https://hipe-eval.github.io/HIPE-2026/
  • 参与指南:https://doi.org/10.5281/zenodo.17800136
  • 许可证:CC BY-NC-SA 4.0
  • 数据位置
    • 主要数据:GitHub 仓库的 data 文件夹
    • 后续也将发布在 Zenodo 上
  • 发布历史
    • 2025-12-04:数据样本 + JSON Schema
    • 2025-12-19:扩展数据样本 v1.0 和沙盒数据(高质量自动标注)
    • 2026-01-22:完整训练集发布
    • 2026-05-05:掩码测试数据发布
    • 待定:未掩码测试数据发布(已在 评估仓库 中提供)

数据内容

  • 基础数据集:基于 HIPE-2022 v2.1 中标注了人名(PERS)和地点(LOC)的历史报纸数据集,包括 impresso-hipe-2020newseyesonarletemps

  • 数据格式:JSON 格式,遵循 HIPE-2026 数据 JSON Schema。所有文档按语言合并到同一个 JSON Line 文件中。

  • 目录结构

    • 训练和测试数据为 UTF-8 编码的 .jsonl 文件,每种语言和数据集拆分各一个文件。

    • 文件名格式:HIPE-2026-vx.x-<dataset>-<train|test>-<lg1>.jsonl

    • 数据目录按版本和语言组织,例如:

      data └── newspapers └── v1.0 ├── HIPE-2026-v1.0-newspapers-train-en.jsonl └── ... └── literaryworks └── v<x.y> └── HIPE-2026-v<x.y>-literaryworks-test-<language>.jsonl

  • 数据准备流程

    1. 将 IOB 标注转换为结构化 JSON
    2. 数据清洗与过滤:合并 NIL 实体,移除过长文档
    3. 候选人物-地点对提取
    4. 使用大语言模型集成进行预标注,再人工审核修正
    5. 最终数据集构建与打包发布

数据验证与统计

  • 数据集统计:可通过 此 Colab Notebook 加载训练数据并生成统计信息。
  • 数据验证:使用验证脚本 check_jsonlschema.py 检查 .jsonl 文件是否符合 Schema,命令示例: bash python scripts/check_jsonlschema.py --schemafile schemas/hipe-2026-data.schema.json data/v1.0/*.jsonl

评估示例

提供了一个使用随机基线进行预测并评估的示例流程:

  1. 使用 dummy_predict.py 生成预测结果
  2. 使用 file_scorer_evaluation.py 进行评分

致谢

HIPE-2026 组织团队感谢 CLEF-2026 实验室组委会的协调与支持。HIPE-eval 系列由 Impresso - Media Monitoring of the Past 项目组织,该项目获得瑞士国家科学基金会(资助号 CRSII5_213585)和卢森堡国家研究基金会(资助号 17498891)的资助。

参考文献

  • HIPE-2026 扩展概述:https://doi.org/10.5281/zenodo.20344461
  • HIPE-2026 精简概述:收录于 CLEF 2026 会议论文集(LNCS)
  • HIPE-2022 扩展概述:https://doi.org/10.5281/zenodo.6979577
  • HIPE-2020 扩展概述:https://doi.org/10.5281/zenodo.4117566
搜集汇总
数据集介绍
HIPE-2026数据集 数据集图片
构建方式
在数字人文研究的浪潮中,历史文献的自动化分析成为重要命题。HIPE-2026数据集由苏黎世大学、洛桑联邦理工学院及苏黎世联邦理工学院联合构建,旨在推动多语种历史文本中人物-地点关系抽取的进展。该数据集包含两大领域:领域A源自HIPE-2022的报纸语料,涵盖19至20世纪的法语、德语和英语文本,并基于GPT-4.1的三次投票进行初始标注,随后由八位经过培训的标注员(每语言至少两位母语者)进行人工修正,形成黄金标准。领域B作为惊喜测试集,选自16至18世纪的法国文学与史学作品(FreEMNER语料库),专门评估跨域泛化能力。数据经过实体提及聚类、文档长度过滤及候选对采样(最多每文档16对,依据文本距离加权)等预处理步骤,最终形成包含人物-地点关系三元组的结构化数据集。
使用方法
研究者可通过GitHub仓库(https://github.com/hipe-eval/hipe-2026-data)获取数据集,并利用官方评估工具包(https://github.com/hipe-eval/hipe-2026-eval)进行系统评估。使用流程包括:加载符合HIPE-2026 JSON Schema的文档与候选实体对,对每对输出'at'(TRUE/PROBABLE/FALSE)和'isAt'(TRUE/FALSE)预测标签。评估时,官方采用宏平均召回率作为主要指标,并通过准确性、效率与泛化性三个独立排名提供多维性能视角。数据集支持多种方法探索,从提示大型语言模型、参数高效微调,到基于编码器的分类器、图神经网络及轻量级规则系统。参与者需注意,领域B仅评估'at'关系,且PROBABLE标签的处理将显著影响最终分数。
背景与挑战
背景概述
HIPE-2026数据集由苏黎世大学、洛桑联邦理工学院及苏黎世联邦理工学院联合创建,于2026年发布,旨在推动多语种历史文献中的人-地关系抽取研究。该数据集聚焦于从19至20世纪的法语、德语及英语历史报纸中,甄别人物与地点间的两种时间约束关系——'at'(过去某时在场)与'isAt'(出版时在场),并延伸至16至18世纪法语文学文本的跨域泛化测试。作为HIPE评测系列的第三届,其核心问题在于从噪声密集、语言变异显著的历史资料中,回答'此人何时在何地'这一数字人文领域的基础性命题,为人物轨迹重建与传记知识图谱构建提供关键支撑。
当前挑战
该数据集的挑战体现在三层维度。领域层面,关系抽取需超越实体共现的浅层关联,辨明间接语境线索(如事件隐含的位置)、跨句证据及OCR噪声所致的文本退化,同时区分'过去在场'与'出版时在场'的微妙时间界限,考验模型在推定与明确证据间的推理能力。构建层面,标注面临历史语言变异、代词消解(如长距离指代)及标签不平衡('PROBABLE'标签稀缺)等困境;此外,跨领域泛化需应对16世纪法语文学文本与20世纪报纸在文体、句法及实体密度上的显著差异,使得域迁移成为独立于域内精度的核心挑战。
常用场景
经典使用场景
在数字人文与计算史学的交叉领域中,HIPE-2026数据集被广泛用于评估和推动从多语言历史文献中抽取带有时间维度的人物-地点关系。该数据集以十九至二十世纪的报纸文本为核心,辅以文艺复兴至启蒙时期的法语文学作品作为域外泛化测试,为研究者提供了涵盖法语、德语和英语三种语言的噪声文本与历史语言变体。其经典使用模式在于训练和评测系统能否区分人物在出版日期前某时到达某地(at)与出版时即身处该地(isAt)这两类关系,从而衡量模型在复杂上下文线索、跨句推理以及OCR错误干扰下的鲁棒表现。
解决学术问题
该数据集直面历史文献处理中一个长期悬而未决的难题:如何在噪声环境下实现证据敏感且有时间锚定的人物-地点关系抽取。它超越了传统命名实体识别与共指消解,将任务提升至需要对隐含证据进行溯因推理的层面——例如通过事件参与、职务描述或旅行叙述间接推断人物行踪。HIPE-2026的三维评估框架(准确性、计算效率、跨域泛化)首次将实用约束纳入学术评价,揭示了高精度大语言模型与轻量级分类器之间的权衡。这一设计显著推动了数字人文领域对历史人物地理轨迹重建、传记知识图谱扩充及人口志研究的方法论进展。
实际应用
在实际应用层面,该数据集支撑了文化遗产机构大规模处理历史报纸与古籍的核心需求。图书馆、档案馆和数字化平台可借助基于HIPE-2026训练的系统自动提取人物活动轨迹,从而构建传记型知识图谱、生成历史人物迁徙地图,并辅助空间人文分析。例如,瑞士国家科学基金资助的Impresso项目已将其用于监测过去媒体中名人的地理流动。此外,该数据集的三类评估配置使其适用于资源受限场景:轻量级模型可部署于机构内部的批量处理管线,而高精度模型则服务于学者对特定文本的深度探究,兼顾了学术严谨性与工程实用性。
数据集最近研究
最新研究方向
HIPE-2026数据集将历史文档中的人物-地点关系抽取从实体共现的浅层模式推向深层叙事理解,聚焦于时间锚定推理与证据敏感分类。该任务不仅要求系统判定人物是否曾身处某地(at关系),还需区分其是否在文档出版时间附近在场(isAt关系),并引入PROBABLE标签以捕捉仅能通过语境推断的模糊关联。这一设计回应了数字人文领域对大规模历史文献时空轨迹重构的迫切需求,尤其为传记知识图谱填充、迁徙空间分析提供了关键支撑。评估框架涵盖准确性、计算效率与跨域泛化三个互补维度,在法语、德语、英语的多源历史新闻及早期现代文学文本上展开评测,揭示了大型语言模型在整合分散时空线索上的潜力,同时凸显了轻量级分类器在文化遗产规模化处理中的实用价值。
相关研究论文
  • 1
    Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts苏黎世大学; 洛桑联邦理工学院; 苏黎世联邦理工学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务