遇见数据集

dmayhem93/agieval-logiqa-zh

收藏
Hugging Face2023-06-18 更新2024-03-04 收录
官方服务:

资源简介:

该数据集取自https://github.com/microsoft/AGIEval,并按照该仓库中的方式进行处理。原始数据集来自https://github.com/lgw863/LogiQA-dataset。数据集的特征包括查询(query)、选项(choices)和正确答案(gold),并且只有一个测试分割。该数据集用于评估基础模型在逻辑推理任务上的表现。

This dataset is sourced from https://github.com/microsoft/AGIEval, and processed following the procedures outlined in that repository. The original dataset originates from https://github.com/lgw863/LogiQA-dataset. The dataset includes three core attributes: query, choices, and gold (correct answer), and contains only one test split. This dataset is used to evaluate the performance of foundation models on logical reasoning tasks.

提供机构:
dmayhem93
原始信息汇总

数据集概述

数据集名称

  • 名称: agieval-logiqa-zh

数据集特征

  • 特征:
    • query: 数据类型为字符串。
    • choices: 数据类型为字符串序列。
    • gold: 数据类型为整数序列。

数据集分割

  • 分割:
    • test: 包含651个示例,总字节数为694747。

数据集大小

  • 下载大小: 387024字节
  • 数据集大小: 694747字节

许可证

  • 许可证: CC BY-NC-SA 4.0
搜集汇总
数据集介绍
构建方式
该数据集源自微软AGIEval项目,是对LogiQA数据集的进一步处理与整合。LogiQA本身是一个专注于逻辑推理的中文机器阅读理解挑战数据集,其题目设计模仿了中国公务员考试中的逻辑推理题型。在构建过程中,研究者从原始LogiQA语料中提取了包含问题(query)、选项(choices)及正确答案(gold)的三元组结构,并采用与AGIEval基准一致的预处理流程,确保数据格式的统一性与可复现性。最终形成了包含651条测试样本的评估集,每条样本均以序列形式存储多个选项与对应索引,便于后续模型推理任务的加载与评测。
使用方法
使用该数据集时,研究者可直接通过HuggingFace Datasets库加载dmayhem93/agieval-logiqa-zh数据集,获取包含query、choices与gold字段的测试划分。典型应用场景包括对大型语言模型在中文逻辑推理任务上的零样本或少样本评估。加载后,模型需依据query内容,从choices列表中选择最符合逻辑的答案,并与gold中的正确索引进行比对以计算准确率。由于数据集已标准化处理,无需额外清洗,可无缝集成至现有评测管线中,适用于对比实验与模型推理能力诊断分析。
背景与挑战
背景概述
在自然语言处理领域,逻辑推理能力被视为评估基础模型认知水平的关键维度。AGIEval数据集由微软研究院的Wanjun Zhong、Ruixiang Cui等研究人员于2023年提出,旨在构建以人类为中心的基准测试,其子集agieval-logiqa-zh源自LogiQA数据集(由Liu等人于2020年在国际人工智能联合会议上发布)。该数据集聚焦于中文机器阅读理解中的逻辑推理任务,包含651条测试样本,每条样本由问题、选项及标准答案构成,核心研究问题在于检验模型能否像人类一样在复杂文本中捕捉隐含逻辑关系并做出正确推断。作为AGIEval框架的重要组成部分,该数据集推动了基础模型在逻辑推理维度的评估标准化,对后续模型改进与跨语言推理能力研究产生了深远影响。
当前挑战
agieval-logiqa-zh所解决的领域挑战在于,现有机器阅读理解模型多依赖表层语义匹配,而难以应对需要严谨逻辑链的推理任务,例如识别假设、因果与条件关系中的谬误。在数据集构建过程中,挑战主要体现在三个方面:其一,原始LogiQA数据源自中文逻辑考试题目,需确保问题与选项的翻译及文化适配性,避免语言歧义干扰逻辑结构;其二,标注过程中需严格界定逻辑推理的边界,排除常识或知识型问题的干扰,以保持评估的纯粹性;其三,样本规模有限(仅651条),如何在有限数据下设计出能有效区分模型推理能力的评估指标,同时避免过拟合或统计偏差,是构建过程中的核心难题。
常用场景
经典使用场景
在自然语言处理与逻辑推理的交叉领域,agieval-logiqa-zh数据集被广泛用作评估基础模型中文逻辑推理能力的基准。该数据集源自LogiQA,经过AGIEval项目标准化处理,专为机器阅读理解中的逻辑推理任务设计。其经典使用场景聚焦于测试模型在中文语境下对复杂逻辑关系(如演绎、归纳、溯因推理)的理解能力,通过多选问答形式衡量模型是否具备超越表面语义的深层推理水平。这一场景对于推动中文语言模型从简单模式匹配向真正认知推理的演进具有里程碑意义。
解决学术问题
该数据集着力解决了学术界长期存在的逻辑推理评估难题:即如何构建一个兼具挑战性与领域普适性的中文推理测试集。传统阅读理解数据集多关注事实检索或常识问答,而LogiQA-zh通过精心设计的逻辑谜题,填补了中文环境下系统性评估模型推理能力的空白。它揭示了当前大语言模型在形式逻辑推理上的显著短板,为研究者量化模型认知局限性、追踪推理能力提升轨迹提供了标准化工具,进而推动了可解释推理、神经符号融合等前沿方向的研究进展。
实际应用
在实际应用中,agieval-logiqa-zh所承载的推理能力评估框架,可直接服务于智能教育、法律辅助决策和自动化论证分析等场景。例如,在智能辅导系统中,借助该数据集训练的模型能够诊断学生逻辑思维缺陷并生成针对性训练;在法律领域,模型对逻辑链的解析能力可辅助合同条款矛盾检测或案件推理核查。此外,其评估范式还被迁移至中文对话系统的逻辑一致性校验,确保生成内容在复杂多轮交互中维持自洽,从而提升人机协同的可靠性。
数据集最近研究
最新研究方向
随着大语言模型在自然语言处理领域的迅猛发展,逻辑推理能力成为评估其智能水平的关键维度。dmayhem93/agieval-logiqa-zh数据集源自微软AGIEval基准和LogiQA挑战,专注于中文逻辑推理阅读理解,近年来被广泛用于前沿研究。当前热点方向集中在探索大模型在复杂逻辑任务中的泛化与鲁棒性,尤其是在跨领域推理、多步演绎和反事实推断等挑战性场景下。该数据集为衡量基础模型在人类认知层面的逻辑一致性提供了严谨标尺,其重要性在于推动AI从表面文本匹配向深层因果推理演进,对构建可信、可解释的智能系统具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务