moondream/mrc-synth-cot
收藏资源简介:
该数据集是一个多任务问答数据集集合,包含多个子配置,如boolq(布尔问答)、dream(对话阅读理解)、drop(离散推理)、pubmedqa(医学问答)、quoref(引用理解)、race(阅读理解)、sciriff-yesno(科学推理是/否问答)、squad_v2(斯坦福问答数据集)、tabfact(表格事实检查)、vitaminc(事实验证)和wtq(维基表格问答)。每个子数据集都包含上下文、原始问题、完整问题、黄金答案、生成推理、生成答案等特征字段,用于训练和评估问答与推理模型。数据集仅包含训练集,总共有数十万条示例,覆盖多种问答类型和领域。
This dataset is a collection of multi-task question-answering datasets, including multiple sub-configurations such as boolq (Boolean question answering), dream (dialogue reading comprehension), drop (discrete reasoning), pubmedqa (medical question answering), quoref (reference understanding), race (reading comprehension), sciriff-yesno (scientific reasoning yes/no questions), squad_v2 (Stanford Question Answering Dataset), tabfact (table fact verification), vitaminc (fact verification), and wtq (WikiTable Questions). Each sub-dataset features fields like context, raw question, full question, gold answer, generated reasoning, generated answer, etc., designed for training and evaluating question-answering and reasoning models. The dataset includes only a training split with hundreds of thousands of examples, covering various question types and domains.




