FCGEC
收藏arXiv2025-09-30 收录
官方服务:
资源简介:
该数据集是从母语者文本中获取的,用于训练语法错误校正任务。这些资料涵盖了丰富的自然语言使用场景,为提高语法校正模型的准确性和泛化能力提供了有力支持。
This dataset is sourced from native speaker texts and is intended for training grammatical error correction tasks. It covers a diverse range of natural language usage scenarios, providing robust support for improving the accuracy and generalization capability of grammatical correction models.
搜集汇总
数据集介绍

构建方式
FCGEC数据集由浙江大学的科研团队构建,旨在解决中文语法错误纠正领域高质量数据匮乏的问题。数据主要来源于公立学校语文考试中的选择题,涵盖从小学到高中的语法纠错题目,同时从新闻聚合网站采集无语法错误的句子以平衡正负样本。原始句子经过去重、拼写修正和完整性检查后,最终保留41,340条。标注采用操作导向范式,基于插入、删除、修改和交换四种基本操作,由20名本科生和4名专家协同完成,每句话由2至4名标注者独立标注以获取多重参考,并通过专家审核和最小操作算法确保质量。
特点
FCGEC数据集具有三个显著特点。其一,提供多重参考标注,每句平均包含1.7个参考修正,通过同义词替换技术进一步丰富参考多样性。其二,包含大量语用层面错误,如逻辑矛盾、语义歧义等,使数据更具挑战性,区别于仅面向非母语学习者的其他中文GEC数据集。其三,采用细粒度的三层标注结构,包括检测层(二分类)、识别层(七类错误类型)和纠正层(操作序列),错误类型与纠正操作之间存在强相关性,为模型提供丰富的辅助信息。
使用方法
FCGEC支持三种任务:语法错误检测、错误类型识别和错误纠正。检测和识别任务可采用预训练语言模型(如BERT、RoBERTa)进行微调,输出二分类或多分类结果。纠正任务可使用作者提出的STG模型,该模型由交换、标记和生成三个模块组成,以流水线方式处理错误;也可采用Seq2Seq或Seq2Edit等主流框架。数据集提供标准训练、验证和测试划分,评估指标包括准确率、精确率、召回率、F1分数以及精确匹配和编辑级别的F0.5分数,代码和在线评估平台已公开。
背景与挑战
背景概述
中文语法纠错(Chinese Grammatical Error Correction, CGEC)作为自然语言处理领域的重要分支,在自动校对与教育辅助等场景中具有广泛应用前景。然而,相较于英文领域丰富的标注资源,中文语法纠错研究长期受限于高质量语料库的匮乏,尤其缺乏来自母语者真实语境的细粒度错误数据。为填补这一空白,浙江大学计算机科学与技术学院联合华为技术有限公司于2022年发布了FCGEC(Fine-Grained Corpus for Chinese Grammatical Error Correction)数据集。该数据集由Lvxiaowei Xu等研究人员主导构建,包含41,340条人工标注的句子,数据主要源自公立学校语文考试中的选择题,覆盖从小学到高中的母语者语料。FCGEC不仅提供了多参照修正标注,还设计了三级细粒度标签体系(检测、识别与修正),在语料规模、错误类型丰富度及语用数据比例上均显著超越此前的中文语法纠错数据集,为领域研究树立了新的基准。
当前挑战
FCGEC数据集所面临的挑战主要体现在两个层面。其一,在领域问题层面,中文语法纠错需同时应对词级(如搭配不当、成分残缺)、句法级(如结构混乱)及语用级(如歧义、不合逻辑)等多层次错误,其中语用错误因涉及常识与逻辑推理而尤为棘手;现有模型在歧义修正等任务上的表现与人类存在显著差距。其二,在数据集构建过程中,挑战包括:从母语者考试试题中爬取原始句子后,需通过人工标注与专家审核确保标注一致性,并设计基于操作导向(增、删、改、换)的标注范式以降低歧义;同时,为获得多参照修正,每句需分配2至4名标注者,并引入同义词替换技术以提升参照多样性,整个标注流程历时逾四个月,质量控制标准严苛。
常用场景
经典使用场景
FCGEC(细粒度中文语法纠错语料库)在自然语言处理领域中,最为经典的使用场景是作为中文语法错误检测、识别与修正的基准评测平台。该数据集收录了来自公立学校语文考试多选题及新闻聚合网站的41,340条句子,涵盖了从词汇搭配不当、成分残缺或冗余,到结构混乱、语序错误乃至逻辑矛盾与语义歧义等七类细粒度错误类型。研究者可基于其三级标注体系(检测、识别、修正),系统性地评估模型在语法纠错任务上的综合能力,从而推动该领域从粗粒度向细粒度的范式演进。
衍生相关工作
FCGEC的发布催生了一系列具有影响力的衍生研究工作。其中,最具代表性的是论文中提出的STG(Switch-Tagger-Generator)基线模型,该模型通过解耦字符排序、标签预测与字符生成三个模块,以非自回归方式高效完成纠错,在低资源场景下显著优于传统的Seq2Seq与Seq2Edit方法。此外,研究者基于该语料库探索了错误类型信息作为辅助任务(TTI)对修正性能的提升效果,验证了细粒度标签在模型训练中的增益价值。这些工作不仅巩固了FCGEC作为中文语法纠错基准的地位,也为后续结合预训练语言模型与多任务学习的纠错方法奠定了实验基础。
数据集最近研究
最新研究方向
在中文语法纠错领域,FCGEC数据集的出现标志着研究重心从非母语学习者语料向母语者语料的重要转移。该数据集聚焦于细粒度错误检测、识别与纠正,特别关注语用层面的逻辑矛盾、语义歧义等复杂错误类型,填补了现有中文GEC数据集在母语者高频错误覆盖不足的空白。其多参考标注范式与操作导向的纠错标签设计,为低资源场景下的序列编辑模型(如STG)提供了更具挑战性的训练与评估基准。当前前沿研究正围绕如何缩小模型与人类在语用错误处理上的显著差距展开,推动GEC系统向更贴近真实语言使用场景的方向演进。
相关研究论文
- 1FCGEC: Fine-Grained Corpus for Chinese Grammatical Error Correction浙江大学计算机科学与技术学院 · 2022年
以上内容由遇见数据集搜集并总结生成



