CFMS-34
收藏数据链接:
官方服务:
资源简介:
CFMS-34是一个由北京大学和北京师范大学合作构建的中文多维度作文评分数据集,包含951篇小学生限时完成的课堂作文。数据集由两位中文教育专家独立评分,依据34个细粒度子维度(涵盖内容、结构、表达和惯例四个维度)以及整体评分标准,评分范围0-5。创建过程严格遵循教学评估流程,确保评分一致性(整体评分QWK为0.57)。该数据集旨在填补中文细粒度多维度自动作文评分基准的空白,为跨语言评估和提升模型在复杂评分任务上的推理能力提供有力支持。
提供机构:
北京大学; 北京师范大学创建时间:
2026-08-28
原始信息汇总
HiFTS与CFMS-34数据集概述
基本信息
- 所属论文:A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring(发表于EMNLP 2026 Findings)
- 作者:Shihang Yang、Sanwoo Lee、Ningning Zhao、Yunfang Wu
- 开源许可证:CC BY 4.0
- 核心组件:HiFTS(Hierarchical Feedback-to-Score Reasoning)框架与CFMS-34数据集
CFMS-34数据集
- 规模与内容:包含951篇双评分的中国小学生作文,采用34个特质(trait)的评分标准
- 版本划分:
CFMS-34/full:包含全部34个标签CFMS-34/core:仅保留标记为hifts_core=1的20个核心特质
- 配套文档:具体划分方式与评分量表详见
CFMS-34/README.md
HiFTS框架
- 工作流程:
- 教师LLM生成层级化反馈,同时输出各特质评分与总体评分
- 学生模型先通过SFT(序列监督微调)预热,再使用GRPO进行对齐(PPO作为消融实验)
- 推理阶段,在系统提示前附加一个BERT整体先验分数
- 关键文件:学生提示词定义于
hifts/prompts.py - 使用命令:
python scripts/train_grpo.pypython scripts/infer.py --essay_file essay.txt
使用说明
- 环境依赖:通过
pip install -r requirements.txt安装依赖 - 框架依赖:SFT阶段使用LLaMA-Factory,需将
MODEL_PATH和LLM_PATH指向本地模型权重 - 未包含内容:ASAP++数据集(论文中使用的其他数据集)及基线方法代码均未随仓库发布
引用方式
如需引用请参考仓库中的BibTeX条目,标题为“A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring”,发表于EMNLP 2026 Findings(会议地点:布达佩斯,匈牙利)。
搜集汇总
数据集介绍

构建方式
CFMS-34数据集的构建依托严格的教育评估流程,汇集了951篇小学生在课堂考试中限时50分钟完成的作文。两位中文教育领域的专家依据详尽的评分指南独立评分,该指南将34个细粒度子特质划分为内容、结构、表达和规范四个高阶维度。每篇作文不仅获得总体分数,还获得34个子特质分数,评分范围均为0至5分。为保证评估的可靠性,测试集特意保留了总体评分上专家完全一致的样本,以降低标签噪声。数据按8:1:1比例划分为训练集、开发集和测试集,从而为多维度作文评分研究提供了严谨的基准。
使用方法
CFMS-34数据集适用于训练和评估多特质自动作文评分系统。研究人员可利用其丰富的评分信息,开发能够生成层级化、基于评分量规的反馈并同时预测特质级和总体分数的模型。具体使用时,可参照HiFTS框架,先通过教师模型生成层级化思维链反馈,再结合监督微调与基于组相对策略优化的强化学习,提升模型在评分准确性与反馈质量上的表现。推理阶段,可通过引入轻量级BERT模型的全局先验分数来引导生成过程,以增强稳定性。该数据集也可用于零样本评估前沿大型语言模型的中文写作评估能力,并作为跨语言多特质评分研究的测试平台。
背景与挑战
背景概述
CFMS-34数据集由北京大学与北京师范大学的研究人员于2026年构建,旨在填补中文多维度作文自动评分(AES)领域缺乏精细标注数据的空白。该数据集包含951篇小学生限时作文,由两位中文教育专家依据严格的评分标准,从内容、结构、表达和规范四个维度细分为34个子项进行双人独立评分,同时提供总体分数。研究团队提出HiFTS框架,通过层级思维链反馈生成与分数预测的统一自回归过程,提升评分准确性与可解释性。CFMS-34的发布为跨语言多维度作文评分研究提供了重要基准,推动了该领域从单一分数预测向反馈生成与评分一致性的方向发展。
当前挑战
CFMS-34数据集面临的挑战主要来自两方面。首先,在领域问题层面,多维度AES要求模型能够捕捉子项间的相互依赖关系,并生成与评分标准一致的细粒度反馈,而现有模型往往将反馈与评分分离或独立处理各维度,难以实现全局与局部评析的统一。其次,在数据集构建过程中,为确保评分可靠性,需对34个子项进行严格的双人标注,并保证评分一致性(总体QWK为0.57),过程耗时且成本高昂。此外,评估显示当前前沿大语言模型在CFMS-34上的最佳QWK仅0.436左右,表明该数据集对现有模型仍具挑战性。
常用场景
经典使用场景
CFMS-34数据集作为中文多维度作文自动评分领域的开创性资源,其经典使用场景聚焦于多维度作文评分与可解释反馈生成的联合建模研究。该数据集涵盖951篇小学生课堂限时作文,由两位中文教育专家依据包含内容、结构、表达和规范四个高阶维度的34项细粒度评分细则进行双重标注,为学术社区提供了兼具深度与广度的评估基准。研究者依托此数据集,可探索从整体到局部的层次化思维链推理、基于评分感知的强化学习对齐、以及轻量级全局先验引导的生成式评分等多种技术路径,从而有效推动多维度作文评分从单一分数预测向可解释、细粒度的智能化评估范式演进。
解决学术问题
CFMS-34数据集的构建有力填补了多维度作文自动评分领域跨语言基准缺失的学术空白。既有研究多在英文基准如ASAP++上验证模型效能,而中文环境下缺乏具备专家标注、双评者一致性检验及细粒度多维评分标签的公开数据集,导致跨语言评估难以开展。该数据集通过严格的评测流程与详细的评分细目,揭示了当前前沿大语言模型在中文多维作文评分任务中与人类评分者之间存在显著差距,为验证评分与反馈一致性、修正评分策略、提升跨语言泛化能力提供了关键实验载体,从而促进了可解释、多维度自动评分理论的深化与发展。
实际应用
在教育教学实践中,CFMS-34数据集为智能化作文辅导系统的构建提供了坚实的数据根基。基于该数据集训练的模型可应用于小学语文写作课堂的 formative assessment,自动生成遵循评分细则的层次化评语与各维度分数,辅助教师快速定位学生写作中的具体优势与不足,如选材新颖性、结构连贯性或修辞运用细腻度等方面,从而为个性化教学干预提供精准依据。此外,该数据集还支持大规模写作质量监测与跨校际评估,为教育研究者洞察学生写作能力发展轨迹、优化课程标准与评价体系提供数据驱动的决策支持,切实提升写作评价的客观性与反馈的实效性。
数据集最近研究
最新研究方向
CFMS-34数据集代表了多维度自动作文评分(AES)领域的最新前沿探索,填补了中文环境下细粒度评分基准的空白。该数据集由北京大学与北京师范大学联合构建,包含951篇小学生限时作文,由两位教育专家依据包含34个细粒度特质的评分量规进行双重标注,覆盖内容、结构、表达和规范四大维度。其研究意义不仅在于提供了当前大语言模型(如GPT-4.1、Gemini-3等)难以有效应对的挑战性基准(最佳QWK仅0.44),更在于推动了可解释性评分框架的发展。基于该数据集提出的HiFTS框架,通过分层思维链反馈生成与GRPO强化学习对齐,实现了评分准确性与反馈质量的双重提升,为跨语言多特质AES研究开辟了新路径,并促进了教育评估的透明性和建设性反馈的生成。
相关研究论文
- 1A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring北京大学; 北京师范大学 · 2026年
以上内容由遇见数据集搜集并总结生成



