LongTableBench
收藏资源简介:
LongTableBench是第一个多任务基准测试,旨在评估大型语言模型在长上下文半结构化表格上的推理能力。它包含5,950个问答实例,源自850个种子问题,涵盖7种表格格式(Markdown、HTML、JSON、LaTeX、SQL、XML、CSV)和18个领域(医疗、金融、教育、娱乐等),上下文长度可达128K令牌,支持单轮/多轮、单表/多表场景,并经过严格的符号验证、跨模型验证和人工审查。
LongTableBench is the first multi-task benchmark designed to evaluate the reasoning capabilities of large language models on long-context semi-structured tables. It contains 5,950 question-answering instances derived from 850 seed questions, covering 7 table formats (Markdown, HTML, JSON, LaTeX, SQL, XML, CSV) and 18 domains including healthcare, finance, education, entertainment and others. The context length can reach up to 128K tokens, and it supports single-round/multi-round, single-table/multi-table scenarios, with rigorous symbolic validation, cross-model validation and human review conducted.
LongTableBench 数据集概述
数据集简介
LongTableBench 是一个综合性基准测试,用于评估大型语言模型在长上下文半结构化表格上的推理能力。该数据集覆盖多样化的格式、任务和领域,确保全面覆盖现实世界中的推理挑战。
核心特征
- 5,950个问答实例,源自850个种子问题
- 7种表格格式:Markdown、HTML、JSON、LaTeX、SQL、XML、CSV
- 18个领域:涵盖医疗、金融、教育、娱乐等
- 上下文长度达128K tokens
- 单轮与多轮、单表与多表场景
- 严格的符号验证、跨模型验证和人工审核
任务设计
包含六个精心设计的任务,评估三个基本维度:结构复杂性、长距离依赖和语义集成
| 任务名称 | 缩写 | 主要挑战 |
|---|---|---|
| 精确匹配 | EM | 结构 |
| 基本条件过滤 | BCF | 结构 |
| 模糊条件操作 | FCM | 长距离 |
| 事实检索 | FR | 长距离 |
| 外部知识融合 | EKF | 语义 |
| 不规则数值解释 | INI | 语义 |
数据统计
- 总实例数:5,950
- 长度分布:
- 40% 短(0–8K tokens)
- 35% 中(8K–32K)
- 25% 长(32K–128K)
- 任务比例:
- 35% 结构任务(EM、BCF)
- 35% 长距离任务(FCM、FR)
- 30% 语义任务(EKF、INI)
数据集格式
目录结构
datasets/ ├── tables/ # 表格文件(按来源和长度组织) └── questions/ # 问答文件(按长度和轮次类型组织)
单轮格式
json { "question_id": "唯一ID", "db_id": "数据库ID", "question": "问题文本(可能包含外部知识)", "answer": "真实答案(列表/字典格式)", "highlighted_table": ["相关表格ID"], "is_multi_table": true, "question_type": "任务类型", "db_path": "源表格路径" }
多轮格式
json { "question_id": "唯一ID", "db_id": "数据库ID", "evidence": "可选外部知识", "QA": [ {"round": 1, "question": "问题1", "answer": "答案1"}, {"round": 2, "question": "问题2", "answer": "答案2"} ], "highlighted_table": ["相关表格"], "is_multi_table": true, "question_type": "任务类型", "db_path": "表格路径" }
评估协议
- 指标:F1分数(对结构化答案进行宏平均)
- 设置:零样本,贪婪解码(temperature=0)
- 截断:对超过上下文窗口的输入进行中间截断
- FR任务:必须包含证据(表格单元格或行引用)
许可证
- 代码:MIT许可证
- 数据集:CC BY 4.0许可证




