遇见数据集

SIGHAN15

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个用于评估中文语法错误校正(CGEC)的基准数据集,其中包含2,339个样本用于训练,以及1,100个样本用于测试。它被广泛用作衡量模型性能的基准数据集。该数据集的规模为训练样本2,339个,测试样本1,100个,针对的任务是中文语法错误校正。

This dataset is a benchmark dataset for evaluating Chinese Grammatical Error Correction (CGEC), which contains 2,339 samples for training and 1,100 samples for testing. It is widely used as a benchmark to measure model performance. The dataset has 2,339 training samples and 1,100 test samples, targeting the task of Chinese Grammatical Error Correction.

搜集汇总
数据集介绍
SIGHAN15 数据集图片
背景与挑战
背景概述
SIGHAN15是SIGHAN 2015 Bake-off的中文拼写检查任务数据集,由国立台湾师范大学和国立台湾大学等机构组织,用于评估和推动中文拼写检查技术的研究。该数据集包含带黄金标准注释的数据和评估工具,公开可用但仅限于学术研究,需遵守非商业使用协议并引用相关论文。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务