遇见数据集

HistoriQA-ThirdRepublic

收藏
arXiv2026-06-30 更新2026-07-04 收录
官方服务:

资源简介:

HistoriQA-ThirdRepublic是由EPITA等机构联合创建的法语历史研究多跳问答数据集,旨在模拟历史学家的复杂推理模式。该数据集基于法国第三共和国(1870-1940年)的议会辩论记录和同期报纸文献构建,包含1782个自动生成并经历史学家验证的问题,覆盖单跳与多跳推理类型,数据来源包括超过3200份议会文档及《Le Gaulois》《L'Intransigeant》等报刊的数字化文本。其创建过程通过嵌入相似性计算、时间约束和专家引导的提示工程实现跨文档对齐,专门用于评估检索增强生成系统在长文档、多源异构历史语料中的推理能力,以弥合自然语言处理基准与历史学术需求之间的鸿沟。

HistoriQA-ThirdRepublic is a French historical research multi-hop question answering dataset jointly created by institutions including EPITA, aiming to simulate the complex reasoning patterns of historians. This dataset is built upon parliamentary debate records and contemporary newspaper documents of the French Third Republic (1870-1940), comprising 1782 automatically generated and historian-validated questions covering both single-hop and multi-hop reasoning types. Its data sources encompass over 3,200 parliamentary documents and digitized texts from newspapers such as *Le Gaulois* and *L'Intransigeant*. The dataset's creation process achieves cross-document alignment via embedding similarity calculation, temporal constraints, and expert-guided prompt engineering. It is specifically tailored to evaluate the reasoning capabilities of retrieval-augmented generation (RAG) systems on long, multi-source heterogeneous historical corpora, bridging the gap between natural language processing (NLP) benchmarks and the demands of historical academic research.

创建时间:
2026-06-30
原始信息汇总

数据集概览

HistoriQA-ThirdRepublic 是一个面向历史研究的法语多跳问答语料库,专注于法国第三共和国时期(1887年),包含 1,782 个问题3,386 个文档片段,旨在评估检索增强生成(RAG)系统和大语言模型在复杂、专业的历史任务上的表现。该数据集由历史学家参与验证,已收录于 LREC-COLING 2026

关键特征

  • 问题数量:总共 1,782 个问题,其中 897 个单跳问题,885 个多跳问题。
  • 文档数量:3,386 个文档片段,来自议会辩论记录和报纸。
  • 异构来源:包括官方议会记录和意识形态对立的两家报纸(Le Gaulois 和 LIntransigeant)。
  • 历史学家验证:与历史学家合作开发,确保历史准确性。
  • 多跳推理:问题需要跨多个文档和来源进行综合。
  • 时间对齐:问题关联同一时期的辩论和媒体报道。

数据集结构与统计

基本信息

指标 数值
总问题数 1,782
单跳问题 897
多跳问题 885
总文档片段 3,386
议会辩论片段 3,229
报纸文章 157(Le Gaulois 78 篇 + LIntransigeant 79 篇)
时间段 1887年
语言 法语

语料库来源

来源 文档片段数 集合标识 描述
议会辩论记录 3,229 debattre_1887__sectioncohere 基于连贯性分割的议会辩论片段
Le Gaulois 报纸 78 legaulois_1887_v1 君主主义/保守派报纸文章
LIntransigeant 报纸 79 lintransigeant_1887_v1 社会主义报纸文章
总计 3,386 完整语料库

问题类型分布

问题类型 数量 描述
单跳 897 可从一个文档片段回答的问题
多跳 - 通用 541 需要综合两个文档信息的问题
多跳 - 比较 192 跨来源比较观点或信息的问题
多跳 - 桥梁实体 152 第一个文档为理解第二个文档提供上下文的问题

数据文件与格式

数据集位于 dataset/ 文件夹,包含两个 JSONL 文件:

  • question_dataset.jsonl (1,782行):每个JSON对象代表一个问题及其关联的文档,字段包括问题ID、类型、问题文本、答案文档ID及来源文档内容。
  • corpus_dataset.jsonl (3,386行):每个JSON对象代表一个文档片段,字段包括集合标识、文档ID、文本内容、日期、会议厅信息(辩论记录)等。报纸文章为单一字符串,议会辩论文档可能为文本段数组。

历史背景

数据集聚焦于法国第三共和国时期的 1887年,这一时期以政治危机(布朗热危机)、国际紧张(施纳贝莱事件)和媒体格局变化为特征。来源包括:

  • 议会辩论:来自法国国家图书馆(Gallica)的会议记录。
  • 报纸:两家意识形态对立的报纸——Monarchist/Conservative 的 Le Gaulois 和 Socialist 的 LIntransigeant,用于评估系统对机构话语与公共解释的关联能力。

应用场景

支持以下研究领域:

  1. 检索增强生成(RAG):在领域特定的历史文本上测试检索质量和生成能力。
  2. 多跳推理:评估跨文档的组合推理、实体链接和时序推理。
  3. 历史自然语言处理与数字人文:开发历史文档理解模型,构建档案研究工具。
  4. 跨来源信息综合:测试机构话语与媒体报道的整合,以及视角检测和偏见分析。
  5. 法语语言模型评估:在复杂、专业的法语任务上进行基准测试。

数据集构建方法

  • 单跳问题生成:从单个文档片段生成,经 TF-IDF 语义距离分析验证质量,并由历史学家审核。
  • 多跳问题生成:通过嵌入相似度(余弦相似度 ≥ 0.7)和时间约束(报纸对在7天内)配对文档,再根据关系选择问题类型(通用、比较、桥梁实体)。
  • 历史学家参与:提供领域专业知识、验证历史准确性、反馈问题相关性和复杂性。

基准与基线

论文中的关键基准结果包括:

  • 单跳检索:密集嵌入实现约 68% 的 Recall@3。
  • 多跳检索:仍然困难(约 36% Recall@3),尤其是跨报纸查询。
  • 答案生成:单跳精度约 54-59%,多跳精度约 14-19%。
  • 语料库偏差:检索器偏好议会辩论,即使对于仅报纸查询也是如此。

许可协议

该数据集采用 Creative Commons Attribution 4.0 International License (CC-BY 4.0) 发布。历史文档来自法国国家图书馆(Gallica),为公共领域内容;问题部分采用 CC-BY 4.0 许可。

搜集汇总
数据集介绍
HistoriQA-ThirdRepublic 数据集图片
构建方式
HistoriQA-ThirdRepublic数据集的构建始于对法国第三共和国时期(1870-1940)议会辩论记录与同期报纸的数字化文本采集。研究者聚焦于1887年的议会辩论,辅以代表不同政治立场的《Le Gaulois》和《L’Intransigeant》两份报纸。构建过程中,首先通过正则表达式对议会辩论文本进行分割,识别会议边界与发言人轮次,并过滤非辩论内容以增强文本连贯性;报纸文章则通过专用正则模式提取。随后,利用嵌入向量相似度计算与时间约束,将议会辩论片段与报纸文章进行配对,筛选相似度高于0.7的候选对。在此基础上,研究者与历史学家协作,通过迭代优化提示策略,自动生成单跳与多跳问题,并由领域专家进行事实与上下文一致性验证,最终形成包含1782个问题的语料库。
特点
该数据集的核心特点在于其对历史学研究中复杂推理模式的深度模拟。首先,问题类型丰富,涵盖时间推理、跨源综合与稀疏证据整合,尤其强调多跳推理能力,要求模型在异质性文档间建立桥接实体、进行对比分析与追踪观点演变。其次,数据集融合了议会辩论这一制度性话语与报纸的公共诠释,构建了跨语域、跨风格的认知鸿沟,对检索增强生成系统形成严峻挑战。此外,所有问题均由历史学家参与验证,确保了历史事实的准确性与问题的学术相关性。最后,数据集附带详细元数据,包括问题类型、关联源文档与难度等级,为系统评估提供了细粒度分析维度。
使用方法
数据集适用于评估检索增强生成系统及大型语言模型在专业历史语料上的表现。使用时,研究者可将问题作为查询输入,从构建的混合语料库中检索相关文档,并生成答案。评估可聚焦于两个环节:检索阶段,通过Recall@K与Accuracy@K等指标衡量系统定位证据源的能力;生成阶段,利用LLM-as-a-Judge或人类专家评判答案的准确性与归因一致性。数据集提供了单跳与多跳两种设置,便于分解分析检索与推理瓶颈。特别地,多跳问题要求跨来源检索,可测试系统处理异质性文档、克服语料库偏差与融合多源信息的能力,为历史学的数字化推理研究提供了标准化评测基准。
背景与挑战
背景概述
HistoriQA-ThirdRepublic 是由 Aurélien Pellet 等人于2026年提出的法语多跳问答数据集,聚焦法国第三共和国(1870-1940年)的议会辩论与报纸文献。该数据集由法国EPITA LRE实验室、Bpifrance等机构联合研发,旨在解决历史学研究中跨源推理、时序分析与稀疏证据整合的复杂问题。通过历史学家协作设计,数据集包含1782个问题(897个单跳、885个多跳),覆盖追述、桥接实体与比较性提问类型。其创新之处在于将议程设置理论引入自然语言处理,将议会记录与同时期报纸相结合,为检索增强生成系统提供了具有领域深度的评测基准,推动了数字人文与NLP的交叉融合。
当前挑战
当前数据集面临的核心挑战体现在领域适应性与系统鲁棒性两大维度。首先,历史文献的多跳推理要求模型具备跨异质文档(议会辩论与报刊)的时序关联与隐喻理解能力,而现有基准多聚焦单文档事实问答,难以捕获历史学家的论证式推理需求。其次,构建过程中需克服OCR文本噪声、档案碎片化及语义鸿沟——跨报纸检索的召回率仅14.3%,远低于跨领域检索的47.8%,且重排序模块在部分场景下反而恶化性能。此外,自动评估与人工标注的校准仍存在偏差,尤其在涉及政治立场判断的复杂问题上,LLM法官的决策边界亟待澄清。
常用场景
经典使用场景
HistoriQA-ThirdRepublic 数据集的核心经典用途在于为多跳问答系统提供一个专门针对历史学研究的评估基准。该数据集以法兰西第三共和国(1870–1940年)的议会辩论与同期报纸档案为语料,精心构造了1782道涵盖单跳与多跳推理的复杂问题。其最典型的使用场景是检验检索增强生成(RAG)系统在跨异构历史文档上的推理能力,包括跨源信息综合、时间推理以及稀疏证据整合。通过与历史学家的深度协作,数据集确保了问题设计真实反映历史研究中典型的复杂推理模式,从而超越了传统仅基于短文段落或单一文档的问答基准,为数字人文领域中的信息检索与语言模型评估提供了弥合专业需求与通用技术鸿沟的关键资源。
解决学术问题
该数据集精准回应了历史学研究中长期存在的计算挑战,即如何让大语言模型与检索增强系统有效处理专业性强、难以获取的源文档。传统的NLP基准往往聚焦于多选或短回答的事实性问题,无法捕捉历史学者所需的跨文档连接、时间线追踪与分散信息聚合。HistoriQA-ThirdRepublic通过引入需要跨议会记录与报纸报道进行推理的多跳问题,系统性地揭示了现有模型在长文背景下的幻觉与检索错误。其意义在于推动信息检索与问答技术的评估从通用场景向领域特化方向发展,为学界提供了第一个基于真实历史研究范式的高质量法语多跳问答语料库,深刻影响了数字人文与自然语言处理的交叉研究。
衍生相关工作
HistoriQA-ThirdRepublic 的提出催生了一系列相关研究工作。首先,其问题生成方法论(结合嵌入相似度、时间约束与专家引导的提示工程)启发了更多面向特定领域的自动多跳问题生成框架。其次,该数据集中对检索错误模式的分析,特别是跨来源类型混淆与时间近邻遗漏的发现,促进了针对历史文档的感知源类型的检索架构研究,如强制多集合分配与基于分类的路由策略。此外,数据集对LLM作为评价者与人类历史学专家对齐度的深入探究,激发了关于自动化评估在领域特定RAG系统中可靠性的讨论,推动了更鲁棒的“裁判模型”设计,并引导后续工作关注高歧义性“困难样本”的评估边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务