遇见数据集

IGED

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

IGED(印尼语语法纠错数据集)是一个大规模、公开可用的印尼语语法纠错数据集,包含1,345,096个句子对,是印尼语领域最大的语法纠错数据集。每个数据对由一个包含语法错误的源句子及其语法正确的目标句子组成。数据集覆盖印尼语三大主要错误类别:形态错误(包括词缀、构词和重叠错误)、句法错误(包括短语结构、介词和句子完整性错误)和语义错误(包括措辞、冗余和歧义错误)。数据来源于新闻语料(150,466篇文章)和学术语料(800篇本科论文),通过混合三阶段流程(60%规则生成、40%LLM驱动和统计搭配)注入语法错误,并经过自动过滤和人工验证(Cohens κ = 0.82)。数据集包含预分层的训练集(1,072,192个样本)、验证集(134,024个样本)和测试集(134,025个样本),每个样本包含源句子、目标句子、细粒度错误类别和数据集划分字段。该数据集专为语法纠错任务设计,支持错误类型分类研究,是CASTLE(上下文感知语义Transformer与知识图谱增强)模型的官方训练数据。数据集在新闻和学术领域表现良好,但未涵盖标点错误、语码转换及印尼语方言变体。

IGED (Indonesian Grammar Error Detection dataset) is a large-scale, publicly available Indonesian grammar error correction dataset containing 1,345,096 sentence pairs, making it the largest GEC dataset for the Indonesian language. Each data pair consists of a source sentence with grammatical errors and its grammatically correct target sentence. The dataset covers three main error categories in Indonesian: morphological errors (affixes, word formation, reduplication), syntactic errors (phrase structure, prepositions, sentence completeness), and semantic errors (wording, redundancy, ambiguity). The data is sourced from news corpora (150,466 articles) and academic corpora (800 undergraduate theses), with grammatical errors injected through a mixed three-stage process (60% rule-based generation, 40% LLM-driven, and statistical collocation), followed by automatic filtering and human validation (Cohens κ = 0.82). The dataset includes pre-stratified training set (1,072,192 samples), validation set (134,024 samples), and test set (134,025 samples), with each sample containing source sentence, target sentence, fine-grained error categories, and dataset split fields. It is designed specifically for grammar error correction tasks, supports error type classification research, and serves as the official training data for the CASTLE (Context-Aware Semantic Transformer with Knowledge Graph Enhancement) model. The dataset performs well in news and academic domains but does not cover punctuation errors, code-switching, or Indonesian dialectal variants.

创建时间:
2026-05-23
原始信息汇总

数据集总览

IGED(印尼语语法错误纠正数据集) 是一个大规模的印尼语语法错误纠正(GEC)数据集,包含 1,345,096 个句子对,是目前公开可用的印尼语 GEC 数据集中规模最大的。每个句子对由一个包含语法错误的源句子和对应的语法正确的目标句子组成。

该数据集覆盖印尼语中的三大错误类别:形态错误(词缀、构词、重叠)、句法错误(短语结构、介词、句子完整性)和语义错误(措辞、赘述、歧义)。

IGED 是 CASTLE 系统(一种结合知识图谱增强的上下文感知语义 Transformer,面向低资源语法纠正)的一部分,发表于 Expert Systems With Applications(2026)。

  • 许可证: CC BY 4.0
  • 语言: 印尼语(单语)
  • 任务: 文本到文本生成(语法错误纠正、错误类型分类)
  • 数据规模: 1M < n < 10M

数据集结构

数据字段

字段 类型 描述
src string 包含错误的源句子
trg string 语法纠正后的目标句子
category string 细粒度错误类别
split string 数据集划分:trainvaltest

错误类别

类别 类型 占比
afiksasi(词缀) 形态 19.8%
bentuk_kata(构词) 形态 12.3%
reduplikasi(重叠) 形态 6.7%
struktur_frasa / sintaksis_frasa(短语结构) 句法 19.0%
preposisi(介词) 句法 12.6%
kelengkapan_kalimat(句子完整性) 句法 11.9%
diksi(措辞) 语义 10.6%
ambiguitas(歧义) 语义 5.0%
pleonasme(赘述) 语义 2.0%

数据划分

划分 样本数
训练集 1,072,192
验证集 134,024
测试集 134,025
总计 1,345,096

划分已按错误类别预分层,应直接使用 split 列。

数据集来源与构建

数据来源

IGED 构建自两个印尼语文本语料库:

  1. 新闻语料库:来自 6 家主要印尼新闻网站的 150,466 篇文章。
  2. 学术语料库:来自 Universitas Nahdlatul Ulama Yogyakarta 的 800 篇本科毕业论文。

错误生成

采用三阶段混合流水线向正确句子中注入语法错误:

  1. 基于规则(60%):使用 Sastrawi 词干提取器、词性标注和 Wiktionary 白名单生成形态错误。
  2. 大语言模型驱动(40%):使用 DeepSeek R1 在受控提示下生成语义错误。
  3. 统计搭配:基于 PMI 的共现模式确保自然性。

验证

所有生成的句子对通过以下方式验证:

  • 自动过滤:Levenshtein 相似度阈值(θ=0.8)+ IndoBERT 余弦相似度 ≥ 0.6
  • 人工审查:由 1 位语言学讲师和 4 位语言学研究生审查 500 个随机样本
  • 标注者间一致性:Cohens κ = 0.82

数据统计

指标 数值
平均句子长度 21.3 词
平均字符长度 154.3 字符
平均编辑距离(src→trg) 12.10

平均编辑距离 12.10 显著高于同类 GEC 数据集,反映了印尼语形态和句法错误的复杂性与多样性。

使用方式

使用 datasets 库加载

python from datasets import load_dataset

dataset = load_dataset("syauqie/IGED")

train_ds = dataset["train"] # 1,072,192 个样本 val_ds = dataset["val"] # 134,024 个样本 test_ds = dataset["test"] # 134,025 个样本

按错误类别筛选

python semantic_cats = ["diksi", "ambiguitas", "pleonasme"] semantic_train = train_ds.filter(lambda x: x["category"] in semantic_cats)

使用 CASTLE 模型

bash git clone https://github.com/syauqiezjut/CASTLE-GEC.git cd CASTLE-GEC pip install -r requirements.txt python scripts/train_castle.py --config configs/castle_base.yaml

在 IGED 测试集上的预期结果:

  • F1 分数: 0.9629
  • BLEU: 92.72

局限性与偏差

  • 领域: 数据集来源于新闻文章和本科毕业论文,在其他领域(社交媒体、正式政府文件等)的性能可能有所差异。
  • 错误类型: 目前不涵盖标点错误或代码切换,这些在非正式印尼语文本中常见。
  • 错误注入: 错误为合成生成,虽经专家验证,其分布未必完全反映真实写作中的自然错误。
  • 语言变体: 覆盖标准印尼语,未涵盖区域方言变体。

引用

使用 IGED 时必须引用以下论文:

bibtex @article{marier2026castle, title = {{CASTLE}: Context-Aware Semantic Transformer with Knowledge Graph Enhancement for Low-Resource Grammar Correction}, author = {Marier, Syauqie Muhammad and {[co-authors]}}, journal = {Expert Systems With Applications}, volume = {299}, pages = {130233}, year = {2026}, publisher = {Elsevier}, doi = {10.1016/j.eswa.2025.130233}, url = {https://doi.org/10.1016/j.eswa.2025.130233} }

相关资源

搜集汇总
数据集介绍
IGED 数据集图片
构建方式
IGED数据集的构建依托于混合三阶段流水线,巧妙融合规则与深度学习方法。首先,从新闻语料库(150,466篇报道)与学术语料库(800篇本科论文)中筛选出语法正确的句子。随后,依托Sastrawi词干提取器、词性标注与维基词典白名单,以规则化方式生成60%的形态学错误(如词缀、构词与重叠)。剩余40%的语义错误(如用词不当、歧义与赘述)则由DeepSeek R1大语言模型在约束提示下驱动生成。为确保错误自然度,进一步引入基于PMI的统计搭配模型(窗口大小为3)进行微调。最终,经过自动过滤(Levenshtein相似度阈值0.8与IndoBERT余弦相似度≥0.6)与人工验证(500条样本由1位语言学讲师与4位语言学研究生审核,Cohen’s κ达0.82),生成1,345,096个高质量句对,覆盖形态、句法与语义三大误差范畴。
特点
IGED数据集以其规模宏大与范畴精细而著称,是当前最大的印尼语语法纠错公共资源。其核心特色在于细粒度的错误分类体系,囊括九种具体类别(如词缀误用、短语结构紊乱、句法残缺与语义含混等),且各类分布均衡,为针对性纠错研究提供了坚实基准。句对间平均编辑距离高达12.10,显著高于同类数据集,这折射出印尼语复杂的形态句法特性。此外,数据集已依据错误类别进行预分层划分,训练集含1,072,192条,验证集与测试集各约134,000条,方便研究者直接调用。尤为值得一提的是,该数据集与CASTLE上下文感知语义变换器相伴而生,在测试集上取得了F1值0.9629与BLEU值92.72的卓越表现。
使用方法
研究者可通过Hugging Face Datasets库便捷加载IGED数据集,调用方式简洁高效。只需执行`load_dataset("syauqie/IGED")`命令,即可获取预划分的`train`、`val`与`test`三个子集,每一样本均包含源句`src`、目标句`trg`及细粒度错误类别`category`。如需按错误类别进行专项训练,可利用`filter`方法高效筛选,例如仅提取语义错误样本以供研习。对于希望复现CASTLE论文成果的学者,可克隆官方代码仓库并执行训练脚本,模型配置文件已内置推荐超参数。需要注意的是,使用本数据集发表研究成果时,务必引用CASTLE论文以遵循CC BY 4.0许可协议。
背景与挑战
背景概述
IGED(Indonesian Grammar Error Correction Dataset)是由Syauqie Muhammad Marier及其合作者于2026年创建的大规模印尼语语法纠错数据集,包含超过134万组句子对,涵盖形态学、句法和语义三大类共九种细粒度错误类型。该数据集源自新闻语料与学术论文,通过规则与大型语言模型相结合的混合流水线自动生成错误,并经由语言学专家验证。作为CASTLE系统的核心训练数据,IGED显著推动了低资源语言语法纠错的研究进程,为印尼语自然语言处理领域提供了宝贵的基准资源。
当前挑战
IGED所应对的核心领域挑战是印尼语语法纠错的低资源困境,需在数据稀缺与错误类型多样性间取得平衡。构建过程中面临多重难点:一是基于规则的形态错误生成依赖Sastrawi词干分析器等工具,处理复杂词缀与重叠词时易出错;二是利用DeepSeek R1生成语义错误时需精心设计提示以确保合理性;三是统计搭配方法需精确选择共现窗口以避免生成非自然句子;此外,自动过滤与人工审核需在高通量下保持一致性,最终通过Levenshtein与IndoBERT双重阈值及专家评审达成0.82的Cohen's κ系数,体现了构建的严谨性与复杂性。
常用场景
经典使用场景
在自然语言处理领域,语法纠错任务一直是低资源语言的难点。IGED数据集专为印尼语语法错误纠正设计,包含超过134万对句子,覆盖形态、句法和语义三大类错误。经典使用场景是将错误的印尼语句子输入序列到序列模型,生成对应的正确句子,从而训练出能够自动纠正语法错误的系统。该数据集的大规模性和细粒度错误分类标签,使其成为评估和对比不同语法纠错模型的权威基准。
解决学术问题
IGED数据集的出现有效缓解了印尼语作为低资源语言在语法纠错研究中数据匮乏的困境。其显著贡献在于,通过系统性地覆盖形态层面的词缀与重叠、句法层面的短语结构与介词使用、以及语义层面的措辞与歧义等错误类型,为细粒度错误分析与针对性纠正提供了可能。该数据集推动了低资源场景下语法纠错技术的发展,为构建更鲁棒的语言模型奠定了数据基础。
衍生相关工作
IGED数据集作为CASTLE系统——一种结合知识图谱增强的上下文感知语义Transformer——的官方训练数据,直接催生了这一经典工作。CASTLE在IGED测试集上取得了F1值0.9629和BLEU值92.72的优异性能。此外,该数据集还支持针对特定错误类型的定制化研究,例如仅利用语义错误子集进行针对性纠错模型训练,为后续研究提供了灵活的数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务