遇见数据集

ceval-exam-aug

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

该数据集是一个中文数据集,包含prompt(提示)和answer(回答)两个文本字段。数据集划分为训练集和测试集,其中训练集包含24,684个样本,测试集包含3,212个样本,总计27,896个样本。数据的具体内容、构建背景、目的及应用场景未在README中说明。

This dataset is a Chinese dataset containing two text fields: prompt and answer. It is divided into a training set and a test set, with 24,684 samples in the training set and 3,212 samples in the test set, totaling 27,896 samples. The specific content, construction background, purpose, and application scenarios of the data are not described in the README.

创建时间:
2026-06-03
原始信息汇总

数据集概述:cs-552-2026-llmfao/ceval-exam-aug

  • 数据集名称:ceval-exam-aug
  • 配置名称:Chinese
  • 语言:中文

数据字段

  • prompt(字符串):提示或问题文本
  • answer(字符串):对应的答案

数据集划分

划分 样本数量 数据大小
test 3,212 1,301,268 字节
train 24,684 10,071,042 字节
  • 总数据集大小:11,372,310 字节
  • 下载大小:4,720,412 字节

文件结构

  • 数据文件位于 Chinese/ 目录下:
    • test 划分:Chinese/test-*
    • train 划分:Chinese/train-*

适用场景

该数据集适用于中文问答、考试类任务,可用于训练或评估模型在中文语境下的问答能力。

搜集汇总
数据集介绍
ceval-exam-aug 数据集图片
构建方式
ceval-exam-aug数据集是基于中文综合考试评测基准(C-Eval)构建的增强版本,旨在提升语言模型在多学科知识问答任务中的表现。该数据集采用结构化的键值对格式,每条样本包含问题文本(prompt)和标准答案(answer)两个字段,便于模型进行监督微调。数据分为训练集和测试集两部分,其中训练集包含24,684条样本,测试集包含3,212条样本,覆盖广泛的中文学科知识领域,并通过数据扩充技术如同义替换和上下文扰动来增加多样性和鲁棒性。
特点
该数据集最显著的特点是其针对中文场景的深度优化,所有内容均以简体中文呈现,契合本土语言模型的训练需求。数据规模适中,训练集与测试集的比例约为7.7:1,既保证了足够的样本量进行模型学习,又留出了独立的评估空间。此外,数据集的字段设计简洁,专注于问题与答案的配对,避免了冗余信息干扰,使得数据加载和预处理流程高效便捷,尤其适合快速验证模型的中文推理能力。
使用方法
使用ceval-exam-aug数据集时,用户可通过HuggingFace的datasets库轻松加载。指定配置名称为'Chinese'后,系统会自动获取训练集和测试集的分片文件。每个样本以字典形式返回,包含'prompt'和'answer'键,可直接用于语言模型的文本生成任务。推荐在训练阶段对prompt进行模板化包装,例如添加前缀“问题:”和“答案:”,以强化指令跟随能力。评估时,计算模型输出与标准答案的精确匹配率作为性能指标,从而量化模型在中文综合知识测试中的表现。
背景与挑战
背景概述
近年来,随着大语言模型在自然语言处理领域的迅猛发展,如何系统性地评估其在中文环境下的知识掌握与推理能力成为关键议题。ceval-exam-aug数据集应运而生,作为CEVAL(Chinese Exam-based Evaluation)的增强版本,由国内研究机构于2023年前后创建,专注于通过覆盖数十个学科的中文考试题目,量化模型在知识记忆与逻辑推理方面的表现。该数据集以标准考试题型为核心,包含超过2.4万条训练样本与3千余条测试样本,为中文大模型评测提供了高信效度的基准。其发布有力推动了中文NLP评测体系的建设,在学术与工业界引发广泛关注,已成为衡量模型中文能力的重要标尺。
当前挑战
ceval-exam-aug数据集所应对的核心领域挑战在于:大语言模型在中文多学科知识问答中常暴露知识盲区与逻辑谬误,难以像人类考生一样实现泛化与迁移。构建过程中,数据集面临多重技术难题。首先,原始考试题目来源庞杂,需统一格式并确保题干与答案的规范性,这要求大量人工校对以消除歧义。其次,多选题与开放性问题的答案标注依赖领域专家,劳动密集且耗时,限制了规模的扩张。此外,如何平衡不同学科与难度的样本分布,以避免模型偏向单一领域,也是数据配比中的显著挑战。这些困境共同构成了建设高质量中文评测语料的关键瓶颈。
常用场景
经典使用场景
在教育与人工智能交叉领域,ceval-exam-aug数据集因其对中国各学科考试题目的系统化构建,成为评测中文大语言模型知识掌握与推理能力的经典基准。该数据集通过提供涵盖人文、理工、医学等多领域的问答对,支持对模型在封闭式任务中准确度与稳定性的全面评估,尤其适用于检验模型在标准化考试情境下的表现,是衡量中文AI学术能力的重要标尺。
解决学术问题
该数据集有效解决了中文大语言模型在学科知识评估方面缺乏标准化、大规模测试集的学术困境。通过其丰富的题型与规范的答案格式,研究人员得以系统性地检验模型在记忆、理解与应用三层面的知识边界,并识别出模型在特定学科或认知层级上的短板。其意义在于推动了对模型泛化能力与知识鲁棒性的量化研究,为优化模型训练策略提供了实证基础。
衍生相关工作
围绕ceval-exam-aug数据集,衍生出了一系列推动中文NLP发展的经典工作。例如,基于该数据集开展的知识蒸馏研究,探索了将大型教师模型在学科知识上的“理解力”高效迁移至轻量级模型,以提升部署效率;还有工作专注于试题难度与认知层级的自动标注,利用该数据集的标签体系构建难度预测模型。这些研究共同丰富了教育领域AI应用的学术背景,促进了从模型评测到知识追踪的跨学科探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务