HistoriQA-ThirdRepublic
收藏资源简介:
HistoriQA-ThirdRepublic是由EPITA等机构联合创建的法语历史研究多跳问答数据集,旨在模拟历史学家的复杂推理模式。该数据集基于法国第三共和国(1870-1940年)的议会辩论记录和同期报纸文献构建,包含1782个自动生成并经历史学家验证的问题,覆盖单跳与多跳推理类型,数据来源包括超过3200份议会文档及《Le Gaulois》《L'Intransigeant》等报刊的数字化文本。其创建过程通过嵌入相似性计算、时间约束和专家引导的提示工程实现跨文档对齐,专门用于评估检索增强生成系统在长文档、多源异构历史语料中的推理能力,以弥合自然语言处理基准与历史学术需求之间的鸿沟。
HistoriQA-ThirdRepublic is a French historical research multi-hop question answering dataset jointly created by institutions including EPITA, aiming to simulate the complex reasoning patterns of historians. This dataset is built upon parliamentary debate records and contemporary newspaper documents of the French Third Republic (1870-1940), comprising 1782 automatically generated and historian-validated questions covering both single-hop and multi-hop reasoning types. Its data sources encompass over 3,200 parliamentary documents and digitized texts from newspapers such as *Le Gaulois* and *L'Intransigeant*. The dataset's creation process achieves cross-document alignment via embedding similarity calculation, temporal constraints, and expert-guided prompt engineering. It is specifically tailored to evaluate the reasoning capabilities of retrieval-augmented generation (RAG) systems on long, multi-source heterogeneous historical corpora, bridging the gap between natural language processing (NLP) benchmarks and the demands of historical academic research.
数据集概览
HistoriQA-ThirdRepublic 是一个面向历史研究的法语多跳问答语料库,专注于法国第三共和国时期(1887年),包含 1,782 个问题 和 3,386 个文档片段,旨在评估检索增强生成(RAG)系统和大语言模型在复杂、专业的历史任务上的表现。该数据集由历史学家参与验证,已收录于 LREC-COLING 2026。
关键特征
- 问题数量:总共 1,782 个问题,其中 897 个单跳问题,885 个多跳问题。
- 文档数量:3,386 个文档片段,来自议会辩论记录和报纸。
- 异构来源:包括官方议会记录和意识形态对立的两家报纸(Le Gaulois 和 LIntransigeant)。
- 历史学家验证:与历史学家合作开发,确保历史准确性。
- 多跳推理:问题需要跨多个文档和来源进行综合。
- 时间对齐:问题关联同一时期的辩论和媒体报道。
数据集结构与统计
基本信息
| 指标 | 数值 |
|---|---|
| 总问题数 | 1,782 |
| 单跳问题 | 897 |
| 多跳问题 | 885 |
| 总文档片段 | 3,386 |
| 议会辩论片段 | 3,229 |
| 报纸文章 | 157(Le Gaulois 78 篇 + LIntransigeant 79 篇) |
| 时间段 | 1887年 |
| 语言 | 法语 |
语料库来源
| 来源 | 文档片段数 | 集合标识 | 描述 |
|---|---|---|---|
| 议会辩论记录 | 3,229 | debattre_1887__sectioncohere |
基于连贯性分割的议会辩论片段 |
| Le Gaulois 报纸 | 78 | legaulois_1887_v1 |
君主主义/保守派报纸文章 |
| LIntransigeant 报纸 | 79 | lintransigeant_1887_v1 |
社会主义报纸文章 |
| 总计 | 3,386 | 完整语料库 |
问题类型分布
| 问题类型 | 数量 | 描述 |
|---|---|---|
| 单跳 | 897 | 可从一个文档片段回答的问题 |
| 多跳 - 通用 | 541 | 需要综合两个文档信息的问题 |
| 多跳 - 比较 | 192 | 跨来源比较观点或信息的问题 |
| 多跳 - 桥梁实体 | 152 | 第一个文档为理解第二个文档提供上下文的问题 |
数据文件与格式
数据集位于 dataset/ 文件夹,包含两个 JSONL 文件:
question_dataset.jsonl(1,782行):每个JSON对象代表一个问题及其关联的文档,字段包括问题ID、类型、问题文本、答案文档ID及来源文档内容。corpus_dataset.jsonl(3,386行):每个JSON对象代表一个文档片段,字段包括集合标识、文档ID、文本内容、日期、会议厅信息(辩论记录)等。报纸文章为单一字符串,议会辩论文档可能为文本段数组。
历史背景
数据集聚焦于法国第三共和国时期的 1887年,这一时期以政治危机(布朗热危机)、国际紧张(施纳贝莱事件)和媒体格局变化为特征。来源包括:
- 议会辩论:来自法国国家图书馆(Gallica)的会议记录。
- 报纸:两家意识形态对立的报纸——Monarchist/Conservative 的 Le Gaulois 和 Socialist 的 LIntransigeant,用于评估系统对机构话语与公共解释的关联能力。
应用场景
支持以下研究领域:
- 检索增强生成(RAG):在领域特定的历史文本上测试检索质量和生成能力。
- 多跳推理:评估跨文档的组合推理、实体链接和时序推理。
- 历史自然语言处理与数字人文:开发历史文档理解模型,构建档案研究工具。
- 跨来源信息综合:测试机构话语与媒体报道的整合,以及视角检测和偏见分析。
- 法语语言模型评估:在复杂、专业的法语任务上进行基准测试。
数据集构建方法
- 单跳问题生成:从单个文档片段生成,经 TF-IDF 语义距离分析验证质量,并由历史学家审核。
- 多跳问题生成:通过嵌入相似度(余弦相似度 ≥ 0.7)和时间约束(报纸对在7天内)配对文档,再根据关系选择问题类型(通用、比较、桥梁实体)。
- 历史学家参与:提供领域专业知识、验证历史准确性、反馈问题相关性和复杂性。
基准与基线
论文中的关键基准结果包括:
- 单跳检索:密集嵌入实现约 68% 的 Recall@3。
- 多跳检索:仍然困难(约 36% Recall@3),尤其是跨报纸查询。
- 答案生成:单跳精度约 54-59%,多跳精度约 14-19%。
- 语料库偏差:检索器偏好议会辩论,即使对于仅报纸查询也是如此。
许可协议
该数据集采用 Creative Commons Attribution 4.0 International License (CC-BY 4.0) 发布。历史文档来自法国国家图书馆(Gallica),为公共领域内容;问题部分采用 CC-BY 4.0 许可。




