遇见数据集

multi-turn123

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

multi-turn123 是一个用于评估语言模型多轮对话能力的基准数据集集合。它整合并过滤了来自多个知名开源数据集的子集,主要包括两大类别:一是源自 microsoft/SCBench 工作空间的多个过滤后非空子集(例如 scbench_choice_eng、scbench_many_shot、scbench_qa_chn/eng、scbench_summary 等),涵盖了选择题、多轮问答、摘要等多种任务形式;二是本地构建的多轮问答子集,包括源自 allenai/qasper 的共享上下文多轮问答子集 `qasper`,源自 THUDM/LongBench 的英文和中文多领域问答子集 `multifieldqa_en` 和 `multifieldqa_zh`,以及一个本地构建的类似 SCBench 的“大海捞针”式多轮问答数据集 `niah`。该数据集旨在为多轮交互场景下的模型能力评估提供统一的测试基准,所有数据均以 Parquet 格式存储,并仅包含测试集分割。

multi-turn123 is a benchmark dataset collection for evaluating the multi-turn dialogue capabilities of language models. It integrates and filters subsets from multiple well-known open-source datasets, primarily including two categories: 1) filtered non-empty subsets from the microsoft/SCBench workspace (e.g., scbench_choice_eng, scbench_many_shot, scbench_qa_chn/eng, scbench_summary, etc.), covering various task forms such as multiple-choice questions, multi-turn Q&A, and summarization; 2) locally constructed multi-turn Q&A subsets, including the shared-context multi-turn Q&A subset `qasper` from allenai/qasper, the English and Chinese multi-domain Q&A subsets `multifieldqa_en` and `multifieldqa_zh` from THUDM/LongBench, and a locally constructed SCBench-like needle-in-a-haystack multi-turn Q&A dataset `niah`. This dataset aims to provide a unified testing benchmark for model capability evaluation in multi-turn interaction scenarios, with all data stored in Parquet format and containing only the test set split.

创建时间:
2026-05-31
原始信息汇总

数据集 multi-turn123 概述

基本信息

  • 许可证: MIT
  • 任务类型: 多轮问答、多轮测试基准

数据来源

该数据集整合自以下三个来源:

  • microsoft/SCBench — 经过非空过滤的 scbench_* 子集
  • allenai/qasper — 多轮问答子集
  • THUDM/LongBench — 多轮问答子集

包含的子集(Configs)

来自 SCBench 的过滤子集(共11个)

子集名称 说明
scbench_choice_eng 选择题(英文)
scbench_many_shot 多示例(many-shot)
scbench_mf 多字段(multi-field)
scbench_prefix_suffix 前缀-后缀匹配
scbench_qa_chn 问答(中文)
scbench_qa_eng 问答(英文)
scbench_repoqa 仓库级问答
scbench_repoqa_and_kv 仓库级问答与键值任务
scbench_summary 摘要任务
scbench_summary_with_needles 含“针”的摘要任务
scbench_vt 虚拟表格(virtual table)

注意:空子集已被剔除,例如 scbench_kv 因过滤后无数据而未包含。

本地多轮问答子集(共4个)

子集名称 说明
niah 类 SCBench 的多轮“大海捞针”(Needle-in-a-Haystack)数据集
qasper 共享上下文的多轮问答子集,源自 allenai/qasper
multifieldqa_en 共享上下文的多轮问答子集(英文),源自 THUDM/LongBench
multifieldqa_zh 共享上下文的多轮问答子集(中文),源自 THUDM/LongBench

数据格式与加载

所有数据以 Parquet 文件格式存储,每个子集对应一个独立的 test 切分文件,路径为 data/{config_name}.parquet

加载示例(Python)

python from datasets import load_dataset

ds = load_dataset("<your-hf-namespace>/multi-turn123", "qasper", split="test")

其他说明

  • 本数据集仅包含数据文件,不包含评估代码。
  • 所有子集均为 test 切分,无训练/验证集。
搜集汇总
数据集介绍
multi-turn123 数据集图片
构建方式
multi-turn123数据集的构建源于对多轮对话与大语言模型评估领域的深刻洞察。该数据集整合了来自多个权威来源的高质量子集,包括从microsoft/SCBench中筛选出的非空子集(如scbench_choice_eng、scbench_many_shot等),以及从allenai/qasper和THUDM/LongBench中提取的本地多轮子集(如qasper、multifieldqa_en和multifieldqa_zh)。此外,还引入了自建的niah子集,用于模拟SCBench风格的“大海捞针”多轮检索场景。所有数据均以Parquet格式存储,并剔除了空配置(如scbench_kv),确保了集成的纯净性与高效性。
特点
该数据集的核心特点在于其多样性与针对性。它涵盖了多种评估维度,包括英语与中文的多领域问答(如multifieldqa_en和multifieldqa_zh)、共享上下文的多轮问答(如qasper)、以及复杂的检索与推理任务(如scbench_repoqa和scbench_repoqa_and_kv)。同时,scbench_summary和scbench_summary_with_needles等子集专门用于评测摘要生成与细粒度信息定位能力。这种结构设计使得multi-turn123成为一个全面评估大语言模型在多轮交互中表现的综合基准,尤其在长上下文处理与多步骤推理方面具有独特价值。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集。具体操作时,需指定配置名称(如qasper、multifieldqa_en等)并设置split参数为test,例如使用load_dataset函数加载特定子集。每个配置对应独立的Parquet文件,直接提供了测试集数据,无需额外预处理。值得注意的是,该仓库仅负责数据分发,评估代码需另行存放于独立的代码仓库中。建议研究者在论文或项目说明中引用此数据集,并搭配自建的评估器使用,以系统性地衡量模型在多轮对话场景中的表现。
背景与挑战
背景概述
在大语言模型评估领域,多轮对话能力的测度一直是研究前沿。2024年,研究者整合microsoft/SCBench、allenai/qasper及THUDM/LongBench等权威数据集,构建了multi-turn123数据集,旨在系统性地测试模型在复杂多轮交互中的表现。该数据集汇聚了来自多源的长文本理解、多领域问答及海量上下文检索等核心任务,涵盖英语与中文两种语言,为评估模型在现实场景下的对话连贯性、历史依赖处理及信息综合能力提供了标准化基准。自发布以来,multi-turn123迅速成为多轮对话评估的重要资源,推动了长上下文模型与检索增强生成系统的发展。
当前挑战
multi-turn123聚焦于解决多轮对话评估中两大核心挑战。领域问题层面,现有基准多侧重单轮问答,难以度量模型在长对话中保持上下文一致性、执行深层推理及处理跨轮次信息冲突的能力,亟需覆盖多类型交互场景的综合性评估方案。构建过程中,从SCBench等源数据筛取非空子集时,面临多语言混合、任务形式差异大且样本量不均的难题;同时,从Qasper与LongBench衍生的共享上下文子集需精细清洗以确保对话轮次间的逻辑连贯性,而NIAH任务的加入进一步增加了对模型在海量上下文中定位稀缺信息的要求。
常用场景
经典使用场景
在长文本理解与多轮对话评估领域,multi-turn123数据集以其独特的跨场景多任务设计,成为评测大语言模型长距离依赖捕捉和上下文记忆能力的基准。该数据集整合了源自SCBench、Qasper和LongBench的多样化子集,涵盖多字段问答、需在长文本中检索关键信息的“大海捞针”任务、基于论文摘要的问答以及代码仓库理解等场景。其经典使用方法是将各子集作为统一的评估框架,通过对多轮交互中模型对之前上下文信息的保持与利用程度进行量化打分,从而系统性地衡量模型在复杂、碎片化信息环境下的推理鲁棒性。研究者通常利用该数据集的单次或少样本设置,测试模型在缺乏显式记忆机制时能否准确回溯并整合分布在各轮对话中的相关信息,这一特性使其成为长序列理解研究的基石性测试平台。
衍生相关工作
基于multi-turn123数据集的设计理念,学界已衍生出若干具有影响力的后续工作。研究者们借鉴其多子集复合评测框架,开发了面向更大規模上下文窗口(如128K tokens)的升级版基准,用于测试模型在极长文本中的动态记忆衰减曲线。部分工作专注于过滤该数据集中“大海捞针”子集的干扰模式,旨在构建更具现实挑战性的对抗样本,以暴露主流模型在注意力机制上的盲点。在模型可解释性方面,有多篇论文利用其多字段问答与摘要子集作为分析平台,提出了基于信息流归因的改进方法,揭示了Transformer中头注意力在不同深度层的冗余与互补现象。此外,社区还通过扩充中文法律与医学长文档,形成了领域垂直版multi-turn123,有效促进了专业大模型在特定领域多轮问答任务中的优化与评估,形成了一条从通用评测到专业微调的完整研究路径。
数据集最近研究
最新研究方向
多轮对话与长文本理解能力的评估是当前大语言模型研究中的热点前沿。multi-turn123数据集整合了源自SCBench、QASPER和LongBench的多样化子集,包括多轮问答、多字段QA以及‘大海捞针’式长上下文检索等任务,旨在系统性地衡量模型在多轮交互中的记忆保持、信息定位与综合推理能力。随着检索增强生成(RAG)和超长上下文窗口技术的迅猛发展,该数据集为揭示模型在复杂多轮场景下的真实表现提供了标准化基准,其涵盖的多语言和多任务配置,尤其对于推动工业级对话系统与智能知识问答的落地具有深刻意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务