SEFORA (Student Essays with Feedback Corpus)
收藏资源简介:
SEFORA是由匹兹堡大学创建的学术写作反馈语料库,旨在为大规模生成高质量写作反馈提供真实数据基础。该数据集规模为564份学生论文草稿,总计包含8,240条教师标注,覆盖议论文、叙述性复述、说明文和共情写作四种大学写作体裁,数据来源于该校英语系多个本科课程的真实教学材料。其构建过程严格遵循伦理审查,通过收集多轮草稿、作业提示、评分量表和教师提供的锚定于文本片段的详细注释,并经过隐私化处理。该数据集主要应用于自然语言处理领域,特别是用于评估和提升大型语言模型生成教学反馈的能力,以解决在真实课堂环境中规模化提供个性化、可操作的写作指导这一核心挑战。
SEFORA is an academic writing feedback corpus developed by the University of Pittsburgh, designed to provide a realistic data foundation for large-scale generation of high-quality writing feedback. This dataset consists of 564 student essay drafts, totaling 8,240 teacher annotations, covering four college writing genres: argumentative essays, narrative retellings, expository essays, and empathetic writing. The data is derived from real teaching materials across multiple undergraduate courses in the university’s Department of English. Its construction strictly complies with ethical review requirements: it collects multiple rounds of drafts, assignment prompts, grading rubrics, and detailed teacher annotations anchored to specific text segments, followed by privacy treatment. This dataset is primarily used in the field of natural language processing, particularly for evaluating and improving the capability of large language models (LLMs) to generate instructional feedback, so as to solve the core challenge of delivering personalized, actionable writing guidance at scale in real classroom settings.
数据集概述
SEFORA(Student Essays with Feedback Corpus And LLM Feedback Evaluation Framework)是一个包含学生论文及教师反馈的语料库,同时提供了用于解析批注文档、生成LLM反馈以及评估LLM反馈质量的工具。
数据集规模与构成
- 论文数量:564篇学生撰写的论文草稿。
- 段落数量:共8,186个段落。
- 内联批注:包含5,684条教师内联批注。
- 反馈字数:每篇草稿平均包含147字的内联反馈,以及约100字的整体评估评论。
- 整体评估:包含基于量规的评分和文档级别的总结性评论。
目录结构
数据集采用层级目录结构组织,路径示例如下:
SEFORA/ ├── Batch_/ │ ├── Course_/ │ │ ├── Class_/ │ │ │ ├── Essay_/ │ │ │ │ ├── <Stage>/ │ │ │ │ │ ├── *.json │ │ │ │ ├── *.txt
- Stage:论文的草稿阶段(如提纲、修改、终稿),命名方式不统一。
- JSON文件:解析后的批注论文。
- TXT文件:作业提示和量规,通常位于每个
Essay_*目录下,部分情况存在于阶段或班级子目录中。 - 文件名格式:
Batch_<#>_Course_<#>_Class_<#>_Essay_<#>_<Stage>_ID<XXXX>.json,所有文件可展平至单一目录而不冲突。
JSON结构示例
每个JSON文件包含两个主要部分:
- paragraphs:段落数组,每个段落包含:
body:段落文本。annotations:批注数组,每项包含:type:批注类型(highlight / note / strikeout)。context_left/context_right:批注左右上下文。comment:教师评语。text:高亮或删除线文本(仅限highlight或strikeout类型)。color:高亮颜色(green / pink / yellow / generic,仅限highlight类型)。
- annotations:整体评估数组,包含:
grades:量规项目及其分数。comment:教师的总体评价。
工具与功能
- LLM反馈生成流水线:提供Jupyter Notebook和Python文件,支持选择提示模板(零样本/少样本、引导/未引导、直接/思维链、提示变体),对每个包含至少一条批注的段落生成LLM反馈。
- UniMatch评估框架:基于参考的评估方法,包括两个步骤:
- 分段:将LLM输出分割为“反馈单元”。
- 相似性匹配:计算LLM生成单元与教师反馈单元之间的成对语义相似性,通过匈牙利匹配算法计算soft精确率、召回率和F1分数。
- 为降低API成本,第二步骤采用缓冲方法,分为提交缓冲与API调用、检索结果并运行最大匹配算法两个阶段。
解析器
- PDF解析器:基于坐标位置提取文本块,识别高亮区域和便签批注,重构段落。
- DOCX解析器:解析ZIP归档中的
word/document.xml,按段落和文本运行组织内容。
数据声明与使用限制
- 内容警告:数据集中包含真实学生写作,可能包含粗俗或情绪化语言,未做掩盖。
- 隐私保护:所有姓名替换为一致的假名,公众人物名称保留;个人信息及链接已移除或修改。
- 观点声明:论文中的观点仅代表作者本人,不代表团队或所属机构。
许可与引用
- 许可:Creative Commons Attribution 4.0 International License (CC BY 4.0)。
- 引用:论文引用信息待完善,数据集及代码使用需引用相关论文。
联系方式
- 联系人:shayan.p@pitt.edu




