遇见数据集

Ro551/WikiCorrupted_spanish_to_GEC-GED_med

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于语法或拼写错误检测和纠正的数据集,包含句子及其错误版本(corrupted),以及详细的标记(tokens)、错误标签(error_tags)、错误类型(error_type)、跨度(span)、注释(annotation)等特征。错误标签涵盖多种类型,如正确(Correct)、语法生成错误(G-gen)、单复数错误(G-nSing、G-nPlur)、动词形式错误(G-verbForm)、冠词使用错误(G-uArt)、其他语法错误(G-wo)、标点缺失(P-missing)、标题错误(S-title)、重音缺失(S-noAccent)和拼写错误(S-mistake)。数据集分为训练集(110,330个示例)、验证集(1,727个示例)和测试集(1,752个示例),适用于自然语言处理任务,如自动错误检测和文本纠正。

This dataset is designed for grammar or spelling error detection and correction, containing sentences along with their corrupted versions, as well as detailed features such as tokens, error tags, error types, spans, annotations, and more. The error tags cover various types including Correct, G-gen (grammar generation errors), G-nSing/G-nPlur (singular/plural errors), G-verbForm (verb form errors), G-uArt (article usage errors), G-wo (other grammar errors), P-missing (punctuation missing), S-title (title errors), S-noAccent (accent missing), and S-mistake (spelling errors). The dataset is split into training (110,330 examples), validation (1,727 examples), and test (1,752 examples) sets, making it suitable for natural language processing tasks like automatic error detection and text correction.

提供机构:
Ro551
搜集汇总
数据集介绍
Ro551/WikiCorrupted_spanish_to_GEC-GED_med 数据集图片
构建方式
WikiCorrupted_spanish_to_GEC-GED_med数据集基于维基百科的西班牙语语料构建,通过系统性地引入语法、拼写和词形错误生成受损句子。每条样本包含原始正确句子、受损句子、分词后的令牌序列、错误标签(涵盖冠词、动词形式、单复数等语法错误类型)、错误类型、错误跨度位置、标注信息以及修正后的带标签句子。数据集划分为训练集(110330条)、验证集(1727条)和测试集(1752条),采用分片存储格式以方便加载。
特点
该数据集专为西班牙语的语法纠错(GEC)和语法错误检测(GED)任务设计,具备细粒度的错误标注体系。错误标签包含10种特定类别,如性别错误(G-gen)、单复数错误(G-nSing/G-nPlur)和动词形式错误(G-verbForm),并扩展了拼写和标点错误类别。每项错误均提供词汇级标注、跨度位置和修正方案,支持从句子级别到子词级别的多粒度分析,为模型训练提供了丰富的监督信号。
使用方法
数据集通过HuggingFace Datasets库加载,使用default配置自动获取train、validation和test分片。研究人员可直接将'corrupted'字段作为输入序列,'sentence'字段作为目标序列,用于序列到序列的语法纠错任务。对于语法错误检测,可利用'error_tags'和'error_type'字段进行多标签分类训练。数据加载时采用流式处理(streaming=True)以节约内存,并可利用分片路径灵活分布计算。
背景与挑战
背景概述
WikiCorrupted_spanish_to_GEC-GED_med 数据集由研究团队基于西班牙语维基百科语料库构建,旨在服务于西班牙语的语法错误纠正(GEC)与语法错误检测(GED)任务。该数据集于近年发布,聚焦于中等复杂度的语法错误类型,覆盖冠词缺失、动词形式错误、标点符号缺失等15种细粒度错误标签。其核心研究问题在于为西班牙语自然语言处理提供高质量、多层次的错误标注资源,以推动非英语语言的语法纠错技术发展。该数据集通过大规模自动化构建与人工校验结合的方式,显著提升了西班牙语语法处理的基准,对低资源语言的NLP研究具有重要参考价值。
当前挑战
该数据集所解决的领域挑战在于西班牙语语法错误的多样性与复杂性,例如名词单复数误用、动词变位错误、冠词缺失等,这些错误在传统规则方法中难以全面覆盖。在构建过程中,研究团队面临的主要挑战包括:从维基百科原始语料中自动生成符合自然语境的错误句子,确保错误类型的分布均衡性;设计精确的标注方案以区分细微的语法差异,如重音符号缺失与拼写错误;以及通过多轮人工审核保证110330条训练样本的标注一致性,避免因自动化工具引入的噪声干扰模型性能。
常用场景
经典使用场景
WikiCorrupted_spanish_to_GEC-GED_med数据集专为西班牙语的语法纠错(GEC)与语法错误检测(GED)任务而设计,其核心使用场景在于训练和评估能够自动识别并修正西班牙语文本中语法错误的深度学习模型。该数据集提供了完整的句子、错误标注及修正后的对应文本,研究者可借此构建端到端的纠错系统,或开发专注于错误类型分类的细粒度检测模型,从而提升西班牙语自然语言处理中语法层面的自动化处理能力。
衍生相关工作
围绕该数据集,衍生出多项经典研究工作,包括基于序列标注的错误检测模型、融合多任务学习的语法纠错与检测联合框架,以及利用数据增强策略提升模型泛化能力的方法。部分工作将其作为预训练模型微调的基础,验证了mT5、XLM-R等跨语言模型在西班牙语语法错误修正中的有效性。这些衍生研究不仅优化了模型性能,还催生了针对西班牙语语法特征设计的评估指标与错误层次分类体系,推动了该领域的持续深化。
数据集最近研究
最新研究方向
针对西班牙语作为第二语言学习者,WikiCorrupted_spanish_to_GEC-GED_med数据集融合了语法错误纠正与错误检测双重任务,提供了精细的错误类型标注(如冠词缺失、动词形态、重音符号错误等),为多任务神经模型在低资源语言上的联合训练奠定了数据基础。当前研究聚焦于利用该数据集探索预训练语言模型在西班牙语语法纠错中的迁移能力,并与基于规则的基线系统进行对比,以推动非英语语言的语法辅助工具向更高精度和细粒度诊断迈进,尤其对西语国家的教育科技与学术写作支持具有显著价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务