THUDM/LongBench
收藏资源简介:
LongBench是首个用于双语、多任务和全面评估大语言模型长上下文理解能力的基准。数据集包含中英文两种语言,涵盖六大类别和二十一个不同任务,涉及单文档问答、多文档问答、摘要生成、少样本学习、合成任务和代码补全等关键长文本应用场景。数据集采用全自动评估方法,旨在以最低成本评估模型的长上下文理解能力。数据集包含14个英文任务、5个中文任务和2个代码任务,平均长度在5k到15k之间,共有4,750个测试数据。此外,还提供了LongBench-E测试集,该测试集通过均匀采样构建,长度分布更均匀,用于分析模型在不同输入长度下的性能变化。
LongBench是首个用于双语、多任务和全面评估大语言模型长上下文理解能力的基准。数据集包含中英文两种语言,涵盖六大类别和二十一个不同任务,涉及单文档问答、多文档问答、摘要生成、少样本学习、合成任务和代码补全等关键长文本应用场景。数据集采用全自动评估方法,旨在以最低成本评估模型的长上下文理解能力。数据集包含14个英文任务、5个中文任务和2个代码任务,平均长度在5k到15k之间,共有4,750个测试数据。此外,还提供了LongBench-E测试集,该测试集通过均匀采样构建,长度分布更均匀,用于分析模型在不同输入长度下的性能变化。
数据集概述
LongBench 是一个双语、多任务的基准测试数据集,用于评估大型语言模型对长上下文理解的能力。该数据集包含中文和英文两种语言,涵盖了多种长文本应用场景,如单文档问答、多文档问答、摘要、少样本学习、合成任务和代码完成等。
数据集特点
- 任务类别:包括问答、文本生成、摘要、对话、文本分类等。
- 语言:支持中文和英文。
- 标签:涉及长上下文。
- 数据集大小:包含1K至10K的数据量。
数据集构成
- 任务数量:共包含21个不同的任务,分为六大类。
- 数据量:总共有4,750个测试数据。
- 平均长度:大多数任务的平均长度在5k至15k之间。
数据集使用
- 数据加载:可通过Python的
load_dataset函数从THUDM/LongBench加载数据。 - 数据格式:所有数据标准化为JSON格式,包含输入、上下文、答案、长度、数据集名称、语言等信息。
评估方法
- 自动化评估:采用自动化方法评估模型对长上下文的理解能力,以降低成本。
任务统计
- 任务类型:包括单文档问答、多文档问答、摘要、少样本学习、合成任务和代码完成等。
- 评估指标:如F1分数、Rouge-L等。
- 平均长度:根据任务不同,平均长度从1,235到22,337不等。
任务描述
- 具体任务:如HotpotQA、2WikiMultihopQA等,每个任务都有详细的描述和特定的应用场景。
LongBench-E统计
- 数据分布:在0-4k、4-8k、8k+长度区间内,数据分布均匀,用于分析模型在不同输入长度下的性能变化。
数据集详细信息
任务统计
| 任务 | 任务类型 | 评估指标 | 平均长度 | 语言 | 样本数 |
|---|---|---|---|---|---|
| HotpotQA | Multi-doc QA | F1 | 9,151 | EN | 200 |
| 2WikiMultihopQA | Multi-doc QA | F1 | 4,887 | EN | 200 |
| MuSiQue | Multi-doc QA | F1 | 11,214 | EN | 200 |
| DuReader | Multi-doc QA | Rouge-L | 15,768 | ZH | 200 |
| MultiFieldQA-en | Single-doc QA | F1 | 4,559 | EN | 150 |
| MultiFieldQA-zh | Single-doc QA | F1 | 6,701 | ZH | 200 |
| NarrativeQA | Single-doc QA | F1 | 18,409 | EN | 200 |
| Qasper | Single-doc QA | F1 | 3,619 | EN | 200 |
| GovReport | Summarization | Rouge-L | 8,734 | EN | 200 |
| QMSum | Summarization | Rouge-L | 10,614 | EN | 200 |
| MultiNews | Summarization | Rouge-L | 2,113 | EN | 200 |
| VCSUM | Summarization | Rouge-L | 15,380 | ZH | 200 |
| TriviaQA | Few shot | F1 | 8,209 | EN | 200 |
| SAMSum | Few shot | Rouge-L | 6,258 | EN | 200 |
| TREC | Few shot | Accuracy | 5,177 | EN | 200 |
| LSHT | Few shot | Accuracy | 22,337 | ZH | 200 |
| PassageRetrieval-en | Synthetic | Accuracy | 9,289 | EN | 200 |
| PassageCount | Synthetic | Accuracy | 11,141 | EN | 200 |
| PassageRetrieval-zh | Synthetic | Accuracy | 6,745 | ZH | 200 |
| LCC | Code | Edit Sim | 1,235 | Python/C#/Java | 500 |
| RepoBench-P | Code | Edit Sim | 4,206 | Python/Java | 500 |
任务描述
| 任务 | 任务描述 |
|---|---|
| HotpotQA | 基于多个给定文档回答相关问题 |
| 2WikiMultihopQA | 基于多个给定文档回答相关问题 |
| MuSiQue | 基于多个给定文档回答相关问题 |
| DuReader | 基于多个检索到的文档回答相关中文问题 |
| MultiFieldQA-en | 基于一篇长文章回答英语问题,文章来自相对多样化的领域 |
| MultiFieldQA-zh | 基于一篇长文章回答中文问题,文章来自相对多样化的领域 |
| NarrativeQA | 基于故事或剧本回答问题,包括理解重要元素如角色、情节、主题等 |
| Qasper | 基于一篇NLP研究论文回答问题,问题由NLP实践者提出和回答 |
| GovReport | 需要总结政府工作报告的摘要任务 |
| MultiNews | 需要总结多篇新闻的多文档摘要任务 |
| QMSum | 需要基于用户查询总结会议记录的摘要任务 |
| VCSUM | 需要总结中文会议记录的摘要任务 |
| SAMSum | 对话摘要任务,提供几个少样本示例 |
| TriviaQA | 单文档问答任务,提供几个少样本示例 |
| TREC | 需要对问题进行分类的分类任务,总共包含50个类别 |
| LSHT | 需要对新闻进行分类的中文分类任务,总共包含24个类别 |
| PassageRetrieval-en | 给定30篇英文维基百科段落,确定哪一段落与给定摘要相对应 |
| PassageCount | 确定给定重复文章中不同段落总数 |
| PassageRetrieval-zh | 给定几个来自C4数据集的中文段落,确定哪一段落与给定摘要相对应 |
| LCC | 给定一段长代码,预测下一段代码 |
| RepoBench-P | 给定一个GitHub仓库中的多文件代码(包括跨文件依赖),预测下一段代码 |
LongBench-E统计
| 任务 | 任务类型 | 0-4k数据量 | 4-8k数据量 | 8k+数据量 |
|---|---|---|---|---|
| HotpotQA | Multi-doc QA | 100 | 100 | 100 |
| 2WikiMultihopQA | Multi-doc QA | 100 | 100 | 100 |
| MultiFieldQA-en | Single-doc QA | 67 | 70 | 13 |
| Qasper | Single-doc QA | 100 | 100 | 24 |
| GovReport | Summarization | 100 | 100 | 100 |
| MultiNews | Summarization | 100 | 100 | 94 |
| TriviaQA | Few shot | 100 | 100 | 100 |
| SAMSum | Few shot | 100 | 100 | 100 |
| TREC | Few shot | 100 | 100 | 100 |
| PassageRetrieval-en | Synthetic | 100 | 100 | 100 |
| PassageCount | Synthetic | 100 | 100 | 100 |
| LCC | Code | 100 | 100 | 100 |
| RepoBench-P | Code | 100 | 100 | 100 |
数据集引用
@misc{bai2023longbench, title={LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding}, author={Yushi Bai and Xin Lv and Jiajie Zhang and Hongchang Lyu and Jiankai Tang and Zhidian Huang and Zhengxiao Du and Xiao Liu and Aohan Zeng and Lei Hou and Yuxiao Dong and Jie Tang and Juanzi Li}, year={2023}, eprint={2308.14508}, archivePrefix={arXiv}, primaryClass={cs.CL} }




