遇见数据集

tempbench

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

TempBench 是一个多跳时序知识图谱问答(Temporal KGQA)基准数据集,旨在使检索质量独立于答案准确性进行可测量评估。该数据集包含 8,710 个问题,基于源自 Wikidata 的时序知识图谱(tkgl-smallpedia,来自 TGB 2.0)。每个问题都附带一个黄金支持子图(S*)以及两个类型的负例:干扰项(S_dist,相同主语和关系但错误对象)和过时事实(S_stale,相同主语、关系、对象但错误时间)。数据集覆盖 4 种时序操作符(时间点、之前/之后、区间、序列)和 3 种跳数复杂度(1-hop、2-hop、3+-hop),构成 4×3 矩阵,其中 3+ 跳因数据稀疏而数量较少(710 个)。数据按复杂度分层划分为 70% 训练集、10% 验证集和 20% 测试集。评估指标包括 TRP(时序检索精确率,衡量检索到的三元组中属于 S* 且查询时间有效比例)和 CCR(完整链召回率,衡量是否检索到所有 S* 三元组且时间有效)。参考基线包括 BM25、BM25-RAG 和无需检索的系统。已知问题包括:区间问题在原始评估协议中会泄露答案(t_query 设为答案年份),需按修正协议处理;自然性评分不可靠;仅测试集经人工验证,训练集为自动生成未审核;问题模板仅 9 个,语言多样性低。数据集以 CC BY 4.0 许可发布,要求引用论文。

TempBench is a multi-hop temporal knowledge graph question answering (Temporal KGQA) benchmark dataset designed to enable measurable evaluation of retrieval quality independent of answer accuracy. The dataset contains 8,710 questions based on a temporal knowledge graph (tkgl-smallpedia from TGB 2.0) derived from Wikidata. Each question comes with a gold support subgraph (S*) and two types of negative examples: distractors (S_dist, same subject and relation but wrong object) and stale facts (S_stale, same subject, relation, object but wrong time). The dataset covers 4 temporal operators (point time, before/after, interval, sequence) and 3 hop complexities (1-hop, 2-hop, 3+-hop), forming a 4×3 matrix, with 3+-hop having fewer samples (710) due to data sparsity. The data is stratified by complexity and split into 70% training, 10% validation, and 20% test sets. Evaluation metrics include TRP (Temporal Retrieval Precision, measuring the proportion of retrieved triples that belong to S* and are valid for the query time) and CCR (Complete Chain Recall, measuring whether all S* triples are retrieved and time-valid). Baselines include BM25, BM25-RAG, and retrieval-free systems. Known issues include: interval questions leaking answers in the original evaluation protocol (t_query set to the answer year), requiring a corrected protocol; unreliable naturalness scores; only the test set is manually verified, while the training set is automatically generated and unverified; only 9 question templates, resulting in low linguistic diversity. The dataset is released under CC BY 4.0 license and requires citation of the paper.

创建时间:
2026-08-20
原始信息汇总

TempBench 数据集概述

基本信息

  • 名称: TempBench — Temporal KGQA benchmark with per-question gold subgraphs
  • 许可证: CC BY 4.0
  • 语言: 英语
  • 规模: 8,710 个问答对(1K < n < 10K)
  • 数据集地址: https://huggingface.co/datasets/Guen/tempbench

核心定位

TempBench 是一个基于时间知识图谱的多跳问答基准,其设计核心目标是使检索质量可独立于答案准确率进行度量。每个问题均附带黄金支持子图(gold supporting subgraph)及两种类型化的负样本,覆盖 4×3 的时间操作符 × 跳数复杂度矩阵。

数据构成

问题分布(按时间操作符与跳数)

操作符 1跳 2跳 3+跳 合计
Point-in-time 1,349 1,259 274 2,882
Before/after 1,135 1,065 131 2,331
Interval 403 435 26 864
Sequence 1,113 1,241 279 2,633
总计 4,000 4,000 710 8,710

数据划分

  • 训练/开发/测试比例为 70/10/20,并按复杂度进行分层
  • 仅测试集经过人工验证(500 问试点 + 120 项盲评);训练集(6,096 问)为自动生成标签,未经人工审核

每问题的三元组结构

每个问题包含:

  • S*:黄金支持子图
  • S_dist:干扰项(相同主体和关系,错误客体)
  • S_stale:过时事实(相同主体、关系和客体,错误时间)

其中 71.5% / 81.3% 的问题的负样本是功能性的(与 S* 真正不同)。区间×过时组合因结构原因缺失(8.1%),相关标志文件位于 benchmark/functional_negatives.jsonl

文件结构

  • benchmark/benchmark_labelled.jsonl: 人类可读标签的基准数据
  • benchmark/benchmark.jsonl: 原始 QID/PID 版本
  • benchmark/functional_negatives.jsonl: 每问功能性负样本标志
  • code/: 确定性构建流水线(索引器、6 阶段基准构建器、标签解析器)
  • code/tempbench_eval.py: TRP 与 CCR 评分器(仅标准库)
  • annotation/: 标注协议(英语主版/意大利语翻译)及验证样本来源
  • baselines/: 参考基线评估输出
  • v1.0.1-addendum.md: 已知问题与评估协议说明

评估指标

  • TRP(时间检索精度):检索到的三元组中属于 S* 且查询时间有效(t_start <= t_query <= t_end)的比例
  • CCR(完整链覆盖率):是否检索到 S* 的所有三元组且时间有效(1/0)
  • 两者均为与答案无关的度量

已知问题与使用注意事项

  1. 区间问题答案泄露:所有 864 个区间问题将 t_query 设为答案年份,存在协议缺陷(非标注缺陷),需先阅读 v1.0.1-addendum.md
  2. 自然度评分不可靠:标注者间不一致,不应作为质量信号
  3. 问题表面形式有限:仅来自 9 个模板,语言多样性低,衡量的是时间检索而非释义鲁棒性
  4. 源知识图谱为时间点类型tkgl-smallpedia),valid_at 退化为精确年份相等;间隔事实泛化性未测试

构建来源与引用

  • 基于 TGB 2.0 中的 tkgl-smallpedia(源自 Wikidata)
  • 问题由 TimelineKGQA 生成器的扩展版本算法生成
  • 出处:Guendalina Caldarini, TempBench: A Temporal Knowledge-Graph QA Benchmark with Per-Question Gold Subgraphs and Retrieval-Quality Metrics, CIKM 26, doi: 10.1145/3799682.3840181
  • 数据集 DOI: 10.57967/hf/10071
搜集汇总
数据集介绍
tempbench 数据集图片
构建方式
TempBench 基准数据集源于对时序知识图谱问答评估体系的深刻洞察,旨在弥补现有语料仅提供答案字符串、无法独立衡量检索质量的缺陷。其构建依托 Wikidata 衍生的 tkgl-smallpedia 时序知识图谱,通过扩展 TimelineKGQA 生成器,以算法化方式产出 8,710 道涵盖时间点、前后关系、时间区间及序列四类时序算子,并横跨 1-hop 至 3+-hop 跳数复杂度的多跳问题。每一道题均附带人工验证的支持性子图(S*)及两种类型化负样本——错误对象干扰项(S_dist)与时间失配的过时事实(S_stale),后者保持主谓宾相同但时间不一致,从而在证据层面精准区分正确检索与偶然正确的推理。构建流程完全确定性,由六阶段管道负责索引、建库、标签解析,且仅依赖标准库,保证了可复现性。
特点
TempBench 的核心特色在于其评估指标不依赖最终答案字符串,而是聚焦于检索证据的时间有效性。每个问题配备的金标准子图与功能型负样本(其中 71.5% 的干扰项和 81.3% 的过时事实被认证为与金标准实质不同)使得系统即使输出正确答案,若依据过时事实,仍可被清晰识别。基准测试提供两个独立于答案的指标——时间有效检索精度(TRP)与完整链覆盖(CCR),两者互补,可揭示系统在部分证据获取与完整链路检索上的权衡。此外,数据集显式标注了负样本功能性子集,并附有已知缺陷说明(如区间问题的时间戳泄漏),敦促使用者在严格的协议下进行评估,确保了评测结果的科学性与可靠性。
使用方法
使用 TempBench 进行评测仅需三个基础步骤,无需安装额外依赖。首先,研究者从 benchmark_labelled.jsonl 文件中按行读取测试集(含 1,743 个问题),每个样本包含问题文本、查询时间 t_query、金标准子图 S_star 及两个负样本。其次,调用自定义检索器,为每个问题返回三元组集合,格式支持字典或五元组。最后,使用附带的 tempbench_eval.py 脚本计算 TRP 与 CCR 分数,该脚本自带自检功能且不依赖参考系统。特别警示,在涉及负样本的分析中,必须根据 functional_negatives.jsonl 中的标志过滤出功能型负样本子集,否则未过滤的数据将导致明显的分数虚高(如 TRP 0.141 真实值应为 0.000)。同时,阅读 v1.0.1 附录以了解区间问题的协议修正,可避免时间戳泄漏造成的误导性结论。
背景与挑战
背景概述
TempBench是一个面向时序知识图谱问答(Temporal KGQA)的多跳推理基准数据集,由学者Guendalina Caldarini构建,于2026年在ACM CIKM会议上发布。该数据集旨在独立于答案准确性衡量检索质量,通过为每个问题提供黄金支持子图(S*)以及两种类型的负样本(distractor和stale fact),解决了现有时序KGQA基准仅提供答案字符串、无法有效评估检索证据时间有效性的核心研究问题。TempBench基于Wikidata衍生的时序知识图谱tkgl-smallpedia,包含8,710个问题,覆盖4种时序算子(时间点、前后关系、区间、序列)与1跳、2跳、3+跳的复杂度矩阵,并提供了70/10/20的训练/验证/测试划分,其中测试集经过人工验证。该数据集在时序推理、检索增强生成(RAG)及知识图谱问答领域具有重要影响力,为评估检索器在时间约束下的证据获取能力提供了细粒度、可复现的基准。
当前挑战
TempBench面临的挑战包括多个层面。首先,在领域问题层面,时序知识图谱问答的核心挑战在于,检索的证据必须在查询时间点有效,而现有基准无法区分系统是否通过过时但偶然正确的事实得出正确答案,因此需要设计能独立衡量检索时间有效性的指标(如TRP和CCR)。其次,在构建过程中,挑战主要体现在:1) 生成功能性的负样本,确保distractor和stale fact与黄金子图在语义上确实不同(仅71.5%和81.3%的问题满足功能性要求);2) 处理结构性的限制,如3+跳问题因tkgl-smallpedia的点时间特性而稀缺,导致长链问题数量有限;3) 避免注释缺陷,例如区间问题在评估协议中泄漏答案(t_query被设为黄金答案年份),以及训练集标签未经过人工审核;4) 确保评估的公平性,因为参考检索器的BFS+BM25方法与构建S*的算法同源,可能造成评估偏差,且尚未验证基准对不同检索器家族的区分能力。
常用场景
经典使用场景
TempBench作为面向时间敏感知识图谱问答(Temporal KGQA)的基准数据集,其经典使用场景在于为检索增强生成(RAG)系统提供可独立评估检索质量的测试平台。该数据集包含8,710道多跳时间推理问题,覆盖四种时间操作符(点时刻、前后、区间、序列)与三种跳数复杂度(1跳、2跳、3跳以上)的交叉矩阵,每道问题均附带金标准支持子图及两类构造性负样本(错误对象与过期事实),从而支持对检索器在时间有效性约束下的精确率(TRP)与完整覆盖率(CCR)进行细粒度度量。研究者可借此评估系统是否在查询时间点检索到真正有效的证据,而非仅凭答案字符串匹配,为时间感知检索与推理的分离诊断提供了严谨的实验范式。
衍生相关工作
TempBench的发布衍生出多项后续研究方向。其一,基于其提供的评分工具,研究者可探索不同检索器家族(如稠密检索、时序感知RAG)在时间基准上的表现,弥补当前仅单一方法验证的空白。其二,数据集揭示的时间有效性组合算子(⊕)启发了面向区间型时间知识图谱(如YAGO3、ICEWS)的扩展研究,催生v2版设计。其三,其功能化负样本及低置信度标注策略为构建更可靠的负采样方法提供参考,推动时间问答中对抗性样本生成的研究。此外,TempBench的系统性协议分析(如区间答案泄漏问题的披露)促进了基准评估规范的完善,成为后续时间知识图谱问答研究的重要参照模板。
数据集最近研究
最新研究方向
TempBench作为时序知识图谱问答领域的前沿基准,其最新研究方向聚焦于可独立评估检索质量的时序推理能力。该数据集通过为每个问题提供黄金支持子图及两种功能性负样本(干扰事实与过期事实),突破传统仅依赖答案准确性的评价范式,使得系统在时间有效性上的证据检索表现得以精确量化。研究热点围绕TRP与CCR两项与答案无关的指标展开,旨在区分因正确检索而作答与因过期或偶然事实而猜中的系统差异。当前工作重点在于验证基准对不同检索器族(如密集检索、时序RAG及参数化大模型)的判别效力,并探索将构建方法推广至有效期窗口型知识图谱(如YAGO3、ICEWS),以测试时序链推理的泛化能力,从而推动该领域向更可靠、可解释的时序问答系统演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务