遇见数据集

hails/agieval-gaokao-chinese

收藏
Hugging Face2024-01-26 更新2024-03-04 收录
官方服务:

资源简介:

该数据集名为agieval-gaokao-chinese,来源于AGIEval项目,具体是中国高考语文子任务的内容。数据集包含查询、选项和正确答案等特征,并且只有一个测试集,包含246个样本。

该数据集名为agieval-gaokao-chinese,来源于AGIEval项目,具体是中国高考语文子任务的内容。数据集包含查询、选项和正确答案等特征,并且只有一个测试集,包含246个样本。

提供机构:
hails
原始信息汇总

数据集概述

数据集信息

  • 特征:
    • query: 字符串类型
    • choices: 字符串序列
    • gold: 整数序列
  • 分割:
    • test: 包含246个样本,占用843664字节
  • 下载大小: 387530字节
  • 数据集大小: 843664字节

配置

  • 默认配置:
    • 数据文件:
      • test: 路径为data/test-*
搜集汇总
数据集介绍
构建方式
该数据集源自微软研究院发布的AGIEval基准测试,专注于评估基础模型在人类认知任务上的表现。具体而言,它抽取了AGIEval中高考语文子任务的内容,并遵循原始仓库的数据处理流程进行整理。数据集以HuggingFace格式存储,包含'query'(问题)、'choices'(选项列表)和'gold'(正确答案索引)三个字段,共246条测试样本,所有数据均来自官方提交的版本快照,确保了构建过程的严谨性与可追溯性。
特点
作为面向中文语言理解与推理的高难度评测集,该数据集继承了高考语文试题的典型特征,涵盖阅读理解、逻辑分析与知识应用等多维度能力考察。其独特之处在于将真实考试场景转化为模型评估任务,每个问题均配备多个选项,且答案由人工标注确保准确性。数据集规模虽小但质量精良,能够有效区分不同模型在复杂中文语义理解上的能力差异,是检验基础模型人文素养的重要标杆。
使用方法
使用该数据集时,研究者可直接通过HuggingFace的datasets库加载默认配置,调用'test'拆分进行模型评估。典型应用流程包括:将'query'字段作为输入,结合'choices'字段中的候选选项,让模型输出预测索引,并与'gold'字段中的标准答案对比计算准确率。该数据集适用于零样本或少样本评估场景,建议在论文中引用AGIEval原始文献及所涉及的具体子数据集来源,以符合学术规范。
背景与挑战
背景概述
在人工智能领域,大语言模型在自然语言处理任务中展现出卓越能力,但其在复杂推理与人类认知对齐方面的表现仍待深入探究。在此背景下,微软研究团队于2023年构建了AGIEval基准测试,旨在系统评估基础模型在人类标准化考试中的综合能力。作为该基准的重要组成部分,hails/agieval-gaokao-chinese数据集聚焦于中国高考语文科目,由Wanjun Zhong、Ruixiang Cui等学者联合开发,涉及246道涵盖现代文阅读、古诗文理解及语言运用等核心题型的测试样本。该数据集通过还原高考语文的真实考核场景,为衡量模型在中文语境下的语义理解、逻辑推理与文化常识掌握程度提供了关键标尺,其发布显著推动了中文自然语言处理领域模型评估体系的完善,并为后续研究如何弥合机器语言理解与人类认知水平的鸿沟奠定了重要基础。
当前挑战
该数据集所面临的挑战主要源于两方面。其一,在领域问题层面,高考语文试题不仅要求模型具备基础的文本理解能力,更需精准把握修辞手法、作者意图及文化典故,这对大语言模型在深层语义推理与跨文化知识迁移方面构成了严峻考验,现有模型常因缺乏对中文语境微妙差异的感知而出现偏差。其二,在构建过程中,数据集需严格还原真实高考题目的多维度考核标准,包括对主观题答案的客观化标注、选择题干扰项的合理设计,以及确保样本在难度与知识覆盖面上与真实考试高度一致,这些环节均需投入大量人工校验与专家审核,以避免因题目表述或答案标注的歧义性影响评估结果的可靠性。
常用场景
经典使用场景
在自然语言处理与基础模型评测领域,hails/agieval-gaokao-chinese数据集作为AGIEval基准的重要组成部分,经典使用场景集中于评估大语言模型在中文语境下的综合理解与推理能力。该数据集源自中国高考语文科目试题,涵盖现代文阅读、古诗文鉴赏、语言文字运用等多元题型,要求模型不仅具备扎实的语言基础,还需展现文化常识、逻辑推断与文本深层解析等高级认知技能。通过模拟人类教育体系中的高难度考试,研究者得以在贴近真实人类智力评估的情境下,系统性地检验模型的语义理解、知识迁移与多步推理水平,从而为模型能力的横向对比与纵向提升提供可靠标尺。
解决学术问题
该数据集有效回应了当前基础模型评测中缺乏高难度、多维度、文化特异性中文评测基准的学术困境。传统评测集如GLUE、SuperGLUE多聚焦于英文语境,且任务设计偏向单一技能;而AGIEval系列通过引入高考语文等人类标准化考试,解决了模型在复杂中文语境下综合能力评估的空白。研究者可利用此数据集探究模型在长文本理解、隐含意图捕捉、修辞手法识别以及跨学科知识融合等方面的短板,进而推动模型在少样本学习、常识推理与领域适应等前沿课题上的突破。该基准的提出促使学界重新审视模型能力评估的生态,倡导从简单任务准确率转向人类认知对齐的深度评测范式。
衍生相关工作
该数据集衍生了一系列具有深远影响的经典研究工作,其中最突出的是AGIEval基准的提出者Zhong等人基于该数据构建的“人类中心”评测框架,该框架系统性地整合了包括高考语文在内的多项标准化考试,推动了基础模型向人类智能对齐的评估转型。后续研究如基于GPT-4、Claude等大模型在AGIEval上的表现分析,揭示了模型在中文语文推理中相较于英文任务的性能落差,催生了针对中文文化知识增强的微调策略与提示工程方法。此外,数据集还被用于对比不同模型在古诗文理解、文言文翻译等子任务上的优劣,间接促进了跨语言迁移学习与多模态语文理解模型的发展,成为中文NLP领域衡量模型认知深度的标杆性资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务