Temporal Reasoning Dataset (TRD)
收藏资源简介:
一个程序生成的多语言基准数据集,旨在评估大型语言模型(LLMs)的时间推理能力。该数据集包含10种语言和9种时间任务类型的问题-答案对,通过4个实验轴(变化、难度、插入和记忆)进行系统评估,默认设置下总样本量为104,000个。
This is a programmatically generated multilingual benchmark dataset designed to evaluate the temporal reasoning capabilities of Large Language Models (LLMs). This dataset contains question-answer pairs across 10 languages and 9 temporal task types, enabling systematic evaluation via four experimental axes: variation, difficulty, insertion, and memory, with a total sample size of 104,000 under the default setting.
数据集概览
Temporal Reasoning Dataset (TRD) 是一个用于评估大语言模型(LLMs)多语言时间推理能力的基准数据集。该数据集由程序自动生成,包含 104,000 个样本,覆盖 10 种语言和 9 类时间推理任务,并设计了 4 组实验以系统评估模型性能。该数据集与 IWSDS 2026 发表的论文《Benchmarking Multilingual Temporal Reasoning in LLMs: The Temporal Reasoning Dataset》配套发布。
关键特性
- 样本总数: 104,000 个问答对(默认种子 seed=9,可复现)。
- 语言数量: 10 种语言,涵盖多个语系。
- 任务类型: 9 种细致设计的时间推理任务。
语言支持
数据集涵盖以下 10 种语言,确保多语言评估的全面性:
| 语言代码 | 语言 | 语系 |
|---|---|---|
| en_US | 英语 | 印欧语系 (日耳曼语族) |
| es_ES | 西班牙语 | 印欧语系 (罗曼语族) |
| de_DE | 德语 | 印欧语系 (日耳曼语族) |
| fr_FR | 法语 | 印欧语系 (罗曼语族) |
| it_IT | 意大利语 | 印欧语系 (罗曼语族) |
| pt_BR | 葡萄牙语 | 印欧语系 (罗曼语族) |
| nl_NL | 荷兰语 | 印欧语系 (日耳曼语族) |
| ja_JP | 日语 | 日本语系 |
| ar_SA | 阿拉伯语 | 亚非语系 |
| hi_IN | 印地语 | 印欧语系 (印度-雅利安语支) |
任务类型
数据集包含 9 种时间推理任务:
| 编号 | 任务名称 | 描述 |
|---|---|---|
| 1 | date_addition | 给指定日期增加若干天/周/月/年 |
| 2 | date_subtraction | 从指定日期减去若干天/周/月/年 |
| 3 | time_addition | 给指定时间增加若干小时/分钟 |
| 4 | time_subtraction | 从指定时间减去若干小时/分钟 |
| 5 | date_duration | 计算两个日期之间的天数差 |
| 6 | time_duration | 计算两个时间之间的小时/分钟差 |
| 7 | date_recurrence | 周期性事件下次出现的日期 |
| 8 | interval_date | 日期区间与范围判断 |
| 9 | day_of_week | 给定日期对应的星期几 |
实验设计
数据集通过 4 组实验系统评估模型能力:
| 实验名称 | 描述 | 默认样本数 |
|---|---|---|
| 变化组 | 所有任务类型的中等难度基线 | 9,000 |
| 难度组 | 5 个难度级别(从短到非常非常长) | 45,000 |
| 插入组 | 上下文干扰项(相似/不相似) | 18,000 |
| 记忆组 | 时间偏移 2025-2095(以 8 年为间隔) | 32,000 |
难度级别配置
每个难度级别对应不同的时间范围配置:
| 等级 (Level) | 天数 | 小时 | 周期(Recurrence) | 循环问题 | 日期跨度 | 时间跨度(分钟) | 年份范围 |
|---|---|---|---|---|---|---|---|
| 🟢 short | 1-4 | 1-4 | 1-4 | 1-2 | 1-4 | 1-60 | 2025 |
| 🟡 medium | 4-8 | 4-8 | 4-8 | 2-4 | 4-8 | 60-120 | 2025-2028 |
| 🟠 long | 8-16 | 8-16 | 8-16 | 4-8 | 8-16 | 120-240 | 2025-2030 |
| 🔴 very_long | 16-32 | 16-32 | 16-32 | 8-16 | 16-32 | 240-480 | 2025-2033 |
| ⚫ very_very_long | 32-64 | 32-64 | 32-64 | 16-32 | 32-64 | 480-960 | 2025-2036 |
数据格式
默认输出为 CSV 格式,文件按实验、任务和语言组织。示例目录结构如下:
dataset/ ├── variations/ │ ├── date_addition_medium_en_US.csv │ ├── date_addition_medium_es_ES.csv │ └── ... ├── difficulties/ │ ├── short/ │ ├── medium/ │ ├── long/ │ ├── very_long/ │ └── very_very_long/ ├── insertions/ │ ├── similar/ │ └── dissimilar/ └── memorization/ ├── 2025_date_addition_medium_en_US.csv ├── 2035_date_addition_medium_en_US.csv └── ...
也支持 JSON 格式输出,示例样本结构如下:
json { "id": "var_en_US_date_addition_001", "language": "en_US", "task_type": "date_addition", "question": "Today is 2027-08-07, what is the date going to be in 8 days?", "answer": "2027-08-15" }




