遇见数据集

Temporal Reasoning Dataset (TRD)

收藏
github2026-05-13 更新2026-05-26 收录
官方服务:

资源简介:

一个程序生成的多语言基准数据集,旨在评估大型语言模型(LLMs)的时间推理能力。该数据集包含10种语言和9种时间任务类型的问题-答案对,通过4个实验轴(变化、难度、插入和记忆)进行系统评估,默认设置下总样本量为104,000个。

This is a programmatically generated multilingual benchmark dataset designed to evaluate the temporal reasoning capabilities of Large Language Models (LLMs). This dataset contains question-answer pairs across 10 languages and 9 temporal task types, enabling systematic evaluation via four experimental axes: variation, difficulty, insertion, and memory, with a total sample size of 104,000 under the default setting.

创建时间:
2026-05-13
原始信息汇总

数据集概览

Temporal Reasoning Dataset (TRD) 是一个用于评估大语言模型(LLMs)多语言时间推理能力的基准数据集。该数据集由程序自动生成,包含 104,000 个样本,覆盖 10 种语言9 类时间推理任务,并设计了 4 组实验以系统评估模型性能。该数据集与 IWSDS 2026 发表的论文《Benchmarking Multilingual Temporal Reasoning in LLMs: The Temporal Reasoning Dataset》配套发布。


关键特性

  • 样本总数: 104,000 个问答对(默认种子 seed=9,可复现)。
  • 语言数量: 10 种语言,涵盖多个语系。
  • 任务类型: 9 种细致设计的时间推理任务。

语言支持

数据集涵盖以下 10 种语言,确保多语言评估的全面性:

语言代码 语言 语系
en_US 英语 印欧语系 (日耳曼语族)
es_ES 西班牙语 印欧语系 (罗曼语族)
de_DE 德语 印欧语系 (日耳曼语族)
fr_FR 法语 印欧语系 (罗曼语族)
it_IT 意大利语 印欧语系 (罗曼语族)
pt_BR 葡萄牙语 印欧语系 (罗曼语族)
nl_NL 荷兰语 印欧语系 (日耳曼语族)
ja_JP 日语 日本语系
ar_SA 阿拉伯语 亚非语系
hi_IN 印地语 印欧语系 (印度-雅利安语支)

任务类型

数据集包含 9 种时间推理任务:

编号 任务名称 描述
1 date_addition 给指定日期增加若干天/周/月/年
2 date_subtraction 从指定日期减去若干天/周/月/年
3 time_addition 给指定时间增加若干小时/分钟
4 time_subtraction 从指定时间减去若干小时/分钟
5 date_duration 计算两个日期之间的天数差
6 time_duration 计算两个时间之间的小时/分钟差
7 date_recurrence 周期性事件下次出现的日期
8 interval_date 日期区间与范围判断
9 day_of_week 给定日期对应的星期几

实验设计

数据集通过 4 组实验系统评估模型能力:

实验名称 描述 默认样本数
变化组 所有任务类型的中等难度基线 9,000
难度组 5 个难度级别(从短到非常非常长) 45,000
插入组 上下文干扰项(相似/不相似) 18,000
记忆组 时间偏移 2025-2095(以 8 年为间隔) 32,000

难度级别配置

每个难度级别对应不同的时间范围配置:

等级 (Level) 天数 小时 周期(Recurrence) 循环问题 日期跨度 时间跨度(分钟) 年份范围
🟢 short 1-4 1-4 1-4 1-2 1-4 1-60 2025
🟡 medium 4-8 4-8 4-8 2-4 4-8 60-120 2025-2028
🟠 long 8-16 8-16 8-16 4-8 8-16 120-240 2025-2030
🔴 very_long 16-32 16-32 16-32 8-16 16-32 240-480 2025-2033
⚫ very_very_long 32-64 32-64 32-64 16-32 32-64 480-960 2025-2036

数据格式

默认输出为 CSV 格式,文件按实验、任务和语言组织。示例目录结构如下:

dataset/ ├── variations/ │ ├── date_addition_medium_en_US.csv │ ├── date_addition_medium_es_ES.csv │ └── ... ├── difficulties/ │ ├── short/ │ ├── medium/ │ ├── long/ │ ├── very_long/ │ └── very_very_long/ ├── insertions/ │ ├── similar/ │ └── dissimilar/ └── memorization/ ├── 2025_date_addition_medium_en_US.csv ├── 2035_date_addition_medium_en_US.csv └── ...

也支持 JSON 格式输出,示例样本结构如下:

json { "id": "var_en_US_date_addition_001", "language": "en_US", "task_type": "date_addition", "question": "Today is 2027-08-07, what is the date going to be in 8 days?", "answer": "2027-08-15" }

搜集汇总
数据集介绍
Temporal Reasoning Dataset (TRD) 数据集图片
构建方式
时序推理数据集(Temporal Reasoning Dataset, TRD)是一个程序化生成的多语言基准测试集,旨在评估大语言模型(LLM)在时间推理方面的能力。该数据集通过单一命令行即可复现研究论文中使用的全部样本,覆盖10种语言和9种时间推理任务类型。其构建依托于精心设计的四种实验轴:Variations实验生成中等难度的基线样本9000个;Difficulties实验设置从“简短”到“极长”五个难度层级,产出45000个样本;Insertions实验通过引入相似或不相似的上下文干扰项,生成18000个样本;Memorization实验则通过将时间范围从2025年推进至2095年,以8年为纪元跨度,创建32000个样本。总计104000个样本在固定随机种子下生成,确保完全可复现。
特点
该数据集的核心特点在于其多维度、系统化的评估框架。首先,多语言覆盖范围广泛,囊括英语、西班牙语、德语、法语、意大利语、葡萄牙语、荷兰语、日语、阿拉伯语和印地语,跨越多个语系,为跨语言时间推理研究奠定了基础。其次,九种任务类型设计精妙,涵盖日期与时间的加减、日期与时间的持续时长计算、周期性事件的下次出现、日期区间判断以及星期几的推算,全面考验模型对日历和时钟逻辑的理解。此外,通过难度层级与干扰项的实验变体,数据集能够深入剖析模型在不同复杂度下的鲁棒性,而跨时间纪元的设计则专门用于探测模型在时间迁移下的泛化与记忆能力,避免了数据泄露对评估的污染。
使用方法
使用该数据集极为便捷,提供命令行工具与Python API两种交互方式。用户可通过`trd generate all --output ./dataset --seed 9`一键复现论文中的104000个样本。若需定制,可指定实验类型(如`trd generate variations`)、样本数量、语言列表及输出格式(CSV或JSON)。Python API同样灵活,支持从顶层函数如`generate_all()`到具体实验类(如`VariationsExperiment`)的细粒度调用。此外,还可直接使用底层生成器(如`date_addition`的生成器)批量获取问答对。输出按实验类型、任务和语言组织为层级目录结构,便于后续分析。数据格式包含完整的元数据与样本字段,可直接用于模型评测。
背景与挑战
背景概述
时间推理作为自然语言理解中的核心认知能力,长期受限于评测数据集的覆盖广度与生成效率。由Mazzia、Pollastrini等研究人员联合亚马逊团队于2025年发布的Temporal Reasoning Dataset (TRD),旨在系统化评估大型语言模型的多语言时间推理能力。该数据集通过程序化生成框架,跨越10种印欧语系与非印欧语系语言,涵盖日期运算、时间计算、周期推算等9类时间任务,并以四个实验轴心(变体、难度、干扰项、记忆偏移)构建了104,000条样本,为当前多语言时间推理研究提供了标准化基准。其论文发表于IWSDS 2026,展现了自动化生成范式在降低人工标注成本与提升评测广度方面的显著优势。
当前挑战
TRD所解决的领域核心挑战在于,现有时间推理基准多局限于单语言与简单任务形式,难以评测模型在跨语言语义映射与复杂时间上下文中的鲁棒性。该数据集通过设计五级难度梯度与含干扰项的插入式实验,系统考察了模型对时间跨度递增、干扰信息过滤及未来时间偏移的记忆敏感性。构建过程中,团队面临两大技术挑战:一是多语言模板需精确适配各语言独特的日期表达与复数规则,确保语法的自然性与一致性;二是生成框架需确保任务类型间的正交性,避免样本间的语义泄漏,同时通过种子控制实现完全可复现的评测流程。
常用场景
经典使用场景
在大规模语言模型(LLM)的评估体系中,时间推理能力作为衡量模型语义理解与逻辑演绎水平的核心维度,长期以来缺乏系统性的多语言基准测试工具。Temporal Reasoning Dataset (TRD) 应运而生,它通过程序化生成横跨10种语言、9类时间推理任务的多层次问答对,构建了包含104,000个样本的综合性基准。研究人员能够利用该数据集,系统性地评估模型在日期运算、时间间隔计算、周期性事件推理等精细任务上的表现,并借助其内置的难易度分级与上下文干扰变量设计,深入剖析不同规模语言模型的时间敏感性与鲁棒性。
实际应用
在实际工业应用中,TRD所评测的时间推理能力直接关乎智能对话系统、日程管理工具与多语言客服机器人的用户体验。例如,电商平台的订单追踪机器人需要准确理解用户关于配送时间、退换货期限的跨语言查询;多语言会议助手则需要正确处理“三天后的下午三点”这类涉及日期与时区转换的复杂请求。借助TRD的系统性评估,开发者能够精准定位模型在处理不同语言时间表达式时的薄弱环节,进而通过针对性微调或模板增强,提升产品在真实场景下的响应准确率与多语言兼容性。该数据集已成为Amazon等机构构建可靠多语言对话系统的关键校验工具。
衍生相关工作
TRD的发布直接催生了一系列前沿研究方向,其中最具代表性的包括:基于该基准设计的多语言时间推理增强训练策略,如对比学习框架下的时间敏感表示蒸馏,以及融合时钟对齐机制的结构化监督微调方法。研究者还借鉴其记忆化实验设计,开发了用于消除时间偏见的事后校准算法。在模型架构层面,TRD启发了多时段注意力机制与可微分时间传播层的设计,这些工作显著提升了LLM在长跨时间问答任务上的泛化能力。此外,该数据集所公开的模板化代码库已成为后续研究者构建跨领域时间推理基准(如医疗诊断、金融预测)的参照范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务