遇见数据集

ASAP dataset

收藏
arXiv2026-07-21 更新2026-07-23 收录
数据链接:
官方服务:

资源简介:

ASAP数据集是由Kaggle平台主办的自动学生评估竞赛所构建的英文作文评分基准数据集,由学术机构联合教育部门采集编纂。该数据集共包含12,978篇学生作文,涵盖议论文、源文本依赖型和叙事文三种写作类型,涉及八个不同的写作提示,每篇作文均附有人工评定的分数标签,作文平均长度在150至650词之间。数据集的构建过程通过标准化教育评估流程收集真实学生作文,并由专业评分员根据统一量规进行多维度评分。该数据集主要应用于教育技术领域的自动作文评分和反馈生成研究,旨在通过机器学习方法实现对学生写作能力的自动化评估,减轻教师批改负担并提供个性化学习指导。

The ASAP dataset is a benchmark dataset for English essay scoring developed for the Automated Student Assessment Prize (ASAP) competition hosted on the Kaggle platform, and it was collected and curated by a consortium of academic institutions and educational authorities. This dataset comprises 12,978 student essays in total, covering three writing categories: argumentative essays, source-text-dependent essays, and narrative essays, associated with eight distinct writing prompts. Each essay is equipped with manually annotated score labels, and the average length of the essays ranges from 150 to 650 words. The dataset is constructed by gathering real student essays via standardized educational assessment workflows, with professional raters performing multi-dimensional scoring based on unified rubrics. This dataset is primarily applied to research on automated essay scoring and feedback generation in the field of educational technology, with the goal of realizing automated assessment of students' writing abilities through machine learning methods, thus alleviating teachers' grading burden and providing personalized learning guidance.

创建时间:
2026-07-21
原始信息汇总

数据集概述

  • 项目名称:Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards
  • 论文地址:https://arxiv.org/abs/2607.19219
  • 当前状态:代码与数据集将在论文被接收后发布。
  • 引用格式:详见项目页面中的 BibTeX 引用信息。
搜集汇总
数据集介绍
ASAP dataset 数据集图片
构建方式
ASAP(Automated Student Assessment Prize)数据集源自2012年由Hewlett基金会发起的Kaggle竞赛,旨在推动自动作文评分技术的发展。该数据集汇集了12,978篇来自美国中学生的手写作文,覆盖论证型、源依赖型和叙事型三种写作类型,分属八个不同的写作提示。每篇作文均由经验丰富的评阅者依据详细的评分细则赋予整体性分数。数据集被划分为五个交叉验证折,确保评估的稳健性。在构建过程中,原始手写文本经过光学字符识别转换为电子文本,并对实体名称进行了匿名化处理,以保护学生隐私。数据集提供了从0到60不等的分数范围,以适应不同提示的评分标准。
使用方法
ASAP数据集的标准使用方式是基于提示特定的五折交叉验证。传统方法需要为每个提示分别训练模型,即8个提示×5折共40次训练。然而,在大型语言模型时代,研究者倾向于将所有提示的训练数据合并,训练一个统一的模型。在输入中同时提供作文内容和对应提示的评分细则,模型即可自适应处理不同的分数范围。评价指标采用二次加权卡帕系数,衡量模型预测与人工评分之间的一致性。该数据集还支持自动反馈生成任务的评估,利用提出的RFE框架对生成的反馈进行多维度细粒度评价,覆盖覆盖面、证据性、忠实性和安全性四个维度共166个二元指标。
背景与挑战
背景概述
自动作文评分与反馈生成是人工智能在教育领域中的核心应用,旨在减轻教师负担的同时为学生提供及时且个性化的写作指导。ASAP(Automated Student Assessment Prize)数据集由Hewlett基金会于2012年创建,包含12,978篇来自三种写作类型和八个写作提示的英语作文,已成为该领域最为广泛采用的基准测试。该数据集的核心研究问题在于如何让机器模型精准地预测作文分数,其影响力不仅体现在推动了从传统回归模型到深度学习乃至大语言模型(LLM)的技术演进,更在于为自动评分系统的公平性与有效性提供了标准化评估平台。围绕ASAP展开的研究持续推动着教育评估技术的边界,使得自动评分从纯粹的分数预测迈向包含高质量反馈生成的综合性能力优化。
当前挑战
ASAP数据集面临的挑战具有双重性。一方面,在领域问题上,纯粹基于提示工程或监督微调的LLM方法难以突破评分与反馈质量的双重瓶颈,尤其是反馈评估缺乏细粒度、可扩展的自动化标准,现有方法依赖昂贵的人工评判或粗粒度的语义相似度,无法捕捉反馈与作文之间的一致性。另一方面,在数据集构建过程中,官方材料中的教师反馈样本存在数量有限、缺乏修订建议或仅提供单一高层评估的问题,获取高质量的金标准反馈需经过LLM改写、人工校准和专家验证,而负面样本的构造也需要巧妙的扰动策略。此外,跨提示联合训练虽然简化了实验流程,但必须确保评分性能不出现显著退化,这对模型架构与训练策略提出了更高要求。
常用场景
经典使用场景
ASAP数据集是自动作文评分(AES)领域最具代表性的基准测试之一,广泛应用于评估模型对学生作文的评分准确性。该数据集包含来自三种写作类型、八个写作提示的12,978篇英文作文,覆盖论证型、源依赖型和叙事型等多种文体。研究者常以此数据集为平台,比较传统机器学习方法、深度学习模型以及大型语言模型在作文评分任务上的性能表现,尤其以二次加权卡帕系数(QWK)作为核心评价指标,衡量预测分数与人类评分之间的一致性。
解决学术问题
该数据集有效解决了自动作文评分研究中长期存在的可重复性评估与跨提示泛化能力验证的问题。通过提供标准化的训练-开发-测试划分和多提示联合训练协议,ASAP使得不同模型架构(从CNN、RNN到BERT及大型语言模型)的评分性能得以公平比较。同时,它推动了评分任务从简单的数值预测向序数分类、反馈生成等更复杂方向的拓展,为评估模型对细粒度质量差异的感知能力提供了可靠基准,极大促进了AES领域的学术研究进展。
实际应用
在实际教育场景中,ASAP数据集支撑了自动评分系统的大规模部署与优化。基于该数据集训练的模型可用于辅助教师评估学生作文,显著减轻人工批改负担,提高评分一致性与效率。此外,其多提示、多文体的特点使得系统能够灵活适应不同年级、不同写作类型的评估需求,为学生提供及时、个性化的写作诊断反馈,帮助识别薄弱环节并持续提升写作能力。这些系统已逐步融入在线教育平台和智能学习环境。
数据集最近研究
最新研究方向
基于强化学习的统一框架在自动作文评分与反馈生成中的联合优化
相关研究论文
  • 1
    Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards阿里巴巴集团·阿里云 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务