遇见数据集

moondream/mrc-synth-cot

收藏
Hugging Face2026-06-07 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是一个多任务问答数据集集合,包含多个子配置,如boolq(布尔问答)、dream(对话阅读理解)、drop(离散推理)、pubmedqa(医学问答)、quoref(引用理解)、race(阅读理解)、sciriff-yesno(科学推理是/否问答)、squad_v2(斯坦福问答数据集)、tabfact(表格事实检查)、vitaminc(事实验证)和wtq(维基表格问答)。每个子数据集都包含上下文、原始问题、完整问题、黄金答案、生成推理、生成答案等特征字段,用于训练和评估问答与推理模型。数据集仅包含训练集,总共有数十万条示例,覆盖多种问答类型和领域。

This dataset is a collection of multi-task question-answering datasets, including multiple sub-configurations such as boolq (Boolean question answering), dream (dialogue reading comprehension), drop (discrete reasoning), pubmedqa (medical question answering), quoref (reference understanding), race (reading comprehension), sciriff-yesno (scientific reasoning yes/no questions), squad_v2 (Stanford Question Answering Dataset), tabfact (table fact verification), vitaminc (fact verification), and wtq (WikiTable Questions). Each sub-dataset features fields like context, raw question, full question, gold answer, generated reasoning, generated answer, etc., designed for training and evaluating question-answering and reasoning models. The dataset includes only a training split with hundreds of thousands of examples, covering various question types and domains.

提供机构:
moondream
搜集汇总
数据集介绍
moondream/mrc-synth-cot 数据集图片
构建方式
mrc-synth-cot数据集是在多个经典机器阅读理解(MRC)数据集基础之上,通过大规模合成思维链(Chain-of-Thought)推理过程而构建的。具体而言,该数据集以BoolQ、DROP、RACE等十余个涵盖文本问答、多项选择、表格推理等多源异构任务的公开数据集为原始语料,利用大语言模型为每一条样本生成详细的推理步骤、最终答案以及简洁答案,并辅以奖励分数和推理努力程度等元信息。所有样本均经过一致性校验,确保生成答案与原始标注答案匹配后方才纳入,从而形成一个兼具高质量推理链条与丰富任务类型的训练资源。
特点
该数据集的核心特色在于其多维度的元信息标注与广泛的覆盖范围。每一条样本不仅包含了标准的问题、上下文和标准答案,还额外提供了由模型生成的完整推理过程(generated_reasoning)、结构化答案(concise_answer)以及衡量推理质量的奖励分数(reward)。此外,数据集中还记录了答案类型、是否为多项选择、选项数量以及模型完成推理的原因(finish_reason)等细粒度属性,使得研究者可以针对性地分析不同任务场景下的模型推理行为。其涵盖的11个配置项从Yes/No问答、段落抽取到表格验证,全面覆盖了主流MRC任务的多样化需求。
使用方法
使用mrc-synth-cot数据集时,用户可通过HuggingFace Datasets库按配置名称(如'boolq'、'drop')加载特定子集,每个子集仅提供训练划分。数据集中各字段可直接用于微调大语言模型,尤其是在需要显式推理能力的场景中。例如,可将'full_question'作为输入、'generated_reasoning'与'generated_answer'拼接后作为目标输出,从而训练模型学习逐步推理的过程。奖励分数可作为过滤低质量推理的依据,而'reasoning_effort'等字段则可用于分析模型在不同难度样本上的表现。该数据集特别适用于提升语言模型在复杂问答任务中的可解释性与鲁棒性。
背景与挑战
背景概述
mrc-synth-cot数据集是一个面向机器阅读理解(MRC)与推理能力增强的合成思维链(Chain-of-Thought)数据集,由多个知名MRC基准(如BoolQ、DROP、RACE、SQuAD v2等)的样本经大语言模型生成推理过程而构建。该数据集创建于大语言模型推理能力研究蓬勃发展的时期,旨在弥补传统MRC数据集仅提供答案而无中间推理步骤的缺陷,为训练模型具备显式推理能力提供大规模、多类型的高质量监督信号。其核心研究问题在于探索如何通过合成推理链数据提升模型在复杂问答、多步推理及跨领域迁移上的表现,对推动可解释问答系统与推理增强语言模型的发展具有重要影响。
当前挑战
该数据集所应对的领域核心挑战在于传统MRC任务仅关注答案匹配的准确性,忽视了模型理解文本并生成逻辑连贯推理的过程,导致模型在应对需要多步推理、常识整合或跨句推断的复杂问题时表现脆弱。在构建过程中,面临的挑战包括从异构数据源(如表格推理TabFact、科学文献PubMedQA、对话理解DREAM等)中统一生成高质量推理链的难度,以及如何确保合成推理逻辑忠实于原文、避免幻觉。此外,对生成推理链的有效性评估(如reward分数)及其与原始答案一致性的自动校验亦是技术难点。
常用场景
经典使用场景
在自然语言处理与机器阅读理解领域,mrc-synth-cot数据集通过融合BoolQ、DROP、RACE等十余个经典阅读理解基准,为模型提供了跨领域、多类型的合成推理链样本。其典型应用场景聚焦于指导语言模型在复杂文本中逐步生成逻辑连贯的中间推理步骤,从而提升对问题的理解与答案的精准度。研究人员常利用该数据集微调模型,使其在零样本或少样本设置下展现出更稳健的推理能力,尤其适用于需要多步推导的问答任务。
衍生相关工作
该数据集衍生了多个具有影响力的研究方向与工具包,如基于强化学习的推理链优化方法、多任务联合训练下的泛化推理框架,以及用于评估语言模型自我修正能力的基准测试。这些工作将mrc-synth-cot中蕴含的合成推理范式扩展至表格推理、事实查验等更广阔的应用领域,并催生了面向长文本、多跳推理的进阶数据集,持续推动着可解释人工智能与神经符号推理的融合进程。
数据集最近研究
最新研究方向
mrc-synth-cot数据集聚焦于机器阅读理解中的合成思维链生成,近期研究前沿在于利用大规模语言模型对多源阅读理解任务(如BoolQ、DROP、SQuAD等)进行推理过程合成,以增强模型的逻辑推演与可解释性。该数据集涵盖了事实性问答、多选推理、表格验证及科学文献理解等多元化场景,契合当前大语言模型在复杂推理链条建模上的热点探索。其通过引入奖励机制与推理努力度量,为评估和改善模型在开放域问答中的渐进式推理能力提供了关键基准,对推动可解释人工智能与知识密集型自然语言处理系统的演进具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务