IGED
收藏资源简介:
IGED(印尼语语法纠错数据集)是一个大规模、公开可用的印尼语语法纠错数据集,包含1,345,096个句子对,是印尼语领域最大的语法纠错数据集。每个数据对由一个包含语法错误的源句子及其语法正确的目标句子组成。数据集覆盖印尼语三大主要错误类别:形态错误(包括词缀、构词和重叠错误)、句法错误(包括短语结构、介词和句子完整性错误)和语义错误(包括措辞、冗余和歧义错误)。数据来源于新闻语料(150,466篇文章)和学术语料(800篇本科论文),通过混合三阶段流程(60%规则生成、40%LLM驱动和统计搭配)注入语法错误,并经过自动过滤和人工验证(Cohens κ = 0.82)。数据集包含预分层的训练集(1,072,192个样本)、验证集(134,024个样本)和测试集(134,025个样本),每个样本包含源句子、目标句子、细粒度错误类别和数据集划分字段。该数据集专为语法纠错任务设计,支持错误类型分类研究,是CASTLE(上下文感知语义Transformer与知识图谱增强)模型的官方训练数据。数据集在新闻和学术领域表现良好,但未涵盖标点错误、语码转换及印尼语方言变体。
IGED (Indonesian Grammar Error Detection dataset) is a large-scale, publicly available Indonesian grammar error correction dataset containing 1,345,096 sentence pairs, making it the largest GEC dataset for the Indonesian language. Each data pair consists of a source sentence with grammatical errors and its grammatically correct target sentence. The dataset covers three main error categories in Indonesian: morphological errors (affixes, word formation, reduplication), syntactic errors (phrase structure, prepositions, sentence completeness), and semantic errors (wording, redundancy, ambiguity). The data is sourced from news corpora (150,466 articles) and academic corpora (800 undergraduate theses), with grammatical errors injected through a mixed three-stage process (60% rule-based generation, 40% LLM-driven, and statistical collocation), followed by automatic filtering and human validation (Cohens κ = 0.82). The dataset includes pre-stratified training set (1,072,192 samples), validation set (134,024 samples), and test set (134,025 samples), with each sample containing source sentence, target sentence, fine-grained error categories, and dataset split fields. It is designed specifically for grammar error correction tasks, supports error type classification research, and serves as the official training data for the CASTLE (Context-Aware Semantic Transformer with Knowledge Graph Enhancement) model. The dataset performs well in news and academic domains but does not cover punctuation errors, code-switching, or Indonesian dialectal variants.
数据集总览
IGED(印尼语语法错误纠正数据集) 是一个大规模的印尼语语法错误纠正(GEC)数据集,包含 1,345,096 个句子对,是目前公开可用的印尼语 GEC 数据集中规模最大的。每个句子对由一个包含语法错误的源句子和对应的语法正确的目标句子组成。
该数据集覆盖印尼语中的三大错误类别:形态错误(词缀、构词、重叠)、句法错误(短语结构、介词、句子完整性)和语义错误(措辞、赘述、歧义)。
IGED 是 CASTLE 系统(一种结合知识图谱增强的上下文感知语义 Transformer,面向低资源语法纠正)的一部分,发表于 Expert Systems With Applications(2026)。
- 许可证: CC BY 4.0
- 语言: 印尼语(单语)
- 任务: 文本到文本生成(语法错误纠正、错误类型分类)
- 数据规模: 1M < n < 10M
数据集结构
数据字段
| 字段 | 类型 | 描述 |
|---|---|---|
src |
string |
包含错误的源句子 |
trg |
string |
语法纠正后的目标句子 |
category |
string |
细粒度错误类别 |
split |
string |
数据集划分:train、val或test |
错误类别
| 类别 | 类型 | 占比 |
|---|---|---|
| afiksasi(词缀) | 形态 | 19.8% |
| bentuk_kata(构词) | 形态 | 12.3% |
| reduplikasi(重叠) | 形态 | 6.7% |
| struktur_frasa / sintaksis_frasa(短语结构) | 句法 | 19.0% |
| preposisi(介词) | 句法 | 12.6% |
| kelengkapan_kalimat(句子完整性) | 句法 | 11.9% |
| diksi(措辞) | 语义 | 10.6% |
| ambiguitas(歧义) | 语义 | 5.0% |
| pleonasme(赘述) | 语义 | 2.0% |
数据划分
| 划分 | 样本数 |
|---|---|
| 训练集 | 1,072,192 |
| 验证集 | 134,024 |
| 测试集 | 134,025 |
| 总计 | 1,345,096 |
划分已按错误类别预分层,应直接使用 split 列。
数据集来源与构建
数据来源
IGED 构建自两个印尼语文本语料库:
- 新闻语料库:来自 6 家主要印尼新闻网站的 150,466 篇文章。
- 学术语料库:来自 Universitas Nahdlatul Ulama Yogyakarta 的 800 篇本科毕业论文。
错误生成
采用三阶段混合流水线向正确句子中注入语法错误:
- 基于规则(60%):使用 Sastrawi 词干提取器、词性标注和 Wiktionary 白名单生成形态错误。
- 大语言模型驱动(40%):使用 DeepSeek R1 在受控提示下生成语义错误。
- 统计搭配:基于 PMI 的共现模式确保自然性。
验证
所有生成的句子对通过以下方式验证:
- 自动过滤:Levenshtein 相似度阈值(θ=0.8)+ IndoBERT 余弦相似度 ≥ 0.6
- 人工审查:由 1 位语言学讲师和 4 位语言学研究生审查 500 个随机样本
- 标注者间一致性:Cohens κ = 0.82
数据统计
| 指标 | 数值 |
|---|---|
| 平均句子长度 | 21.3 词 |
| 平均字符长度 | 154.3 字符 |
| 平均编辑距离(src→trg) | 12.10 |
平均编辑距离 12.10 显著高于同类 GEC 数据集,反映了印尼语形态和句法错误的复杂性与多样性。
使用方式
使用 datasets 库加载
python from datasets import load_dataset
dataset = load_dataset("syauqie/IGED")
train_ds = dataset["train"] # 1,072,192 个样本 val_ds = dataset["val"] # 134,024 个样本 test_ds = dataset["test"] # 134,025 个样本
按错误类别筛选
python semantic_cats = ["diksi", "ambiguitas", "pleonasme"] semantic_train = train_ds.filter(lambda x: x["category"] in semantic_cats)
使用 CASTLE 模型
bash git clone https://github.com/syauqiezjut/CASTLE-GEC.git cd CASTLE-GEC pip install -r requirements.txt python scripts/train_castle.py --config configs/castle_base.yaml
在 IGED 测试集上的预期结果:
- F1 分数: 0.9629
- BLEU: 92.72
局限性与偏差
- 领域: 数据集来源于新闻文章和本科毕业论文,在其他领域(社交媒体、正式政府文件等)的性能可能有所差异。
- 错误类型: 目前不涵盖标点错误或代码切换,这些在非正式印尼语文本中常见。
- 错误注入: 错误为合成生成,虽经专家验证,其分布未必完全反映真实写作中的自然错误。
- 语言变体: 覆盖标准印尼语,未涵盖区域方言变体。
引用
使用 IGED 时必须引用以下论文:
bibtex @article{marier2026castle, title = {{CASTLE}: Context-Aware Semantic Transformer with Knowledge Graph Enhancement for Low-Resource Grammar Correction}, author = {Marier, Syauqie Muhammad and {[co-authors]}}, journal = {Expert Systems With Applications}, volume = {299}, pages = {130233}, year = {2026}, publisher = {Elsevier}, doi = {10.1016/j.eswa.2025.130233}, url = {https://doi.org/10.1016/j.eswa.2025.130233} }
相关资源
- 📄 论文: CASTLE (ESWA 2026)
- 💻 代码: syauqiezjut/CASTLE-GEC
- 🤗 模型: syauqiezjut/CASTLE




