汉语学习者文本多维标注数据集YACLC V1.0
收藏资源简介:
汉语学习者文本多维标注数据集(Yet Another Chinese Learner Corpus,YACLC)是一个大规模的、提供偏误多维标注的汉语学习者文本数据集。我们招募了百余位汉语国际教育、语言学及应用语言学等专业背景的研究生组成标注团队,并采用众包策略分组标注。每个句子由10位标注员进行标注,每位标注员需要给出0或1的句子可接受度评分,以及纠偏标注和流利标注两个维度的标注结果。本数据集可用于语法纠错、文本校对等自然语言处理任务,也可为汉语二语教学与习得、语料库语言学等研究领域提供数据支持。
The Multi-dimensional Annotated Dataset for Chinese Learner Texts (Yet Another Chinese Learner Corpus, YACLC) is a large-scale Chinese learner text dataset with multi-dimensional error annotations. We recruited over 100 graduate students with professional backgrounds in fields such as Teaching Chinese to Speakers of Other Languages, linguistics, and applied linguistics to form an annotation team, and adopted a crowdsourcing strategy for grouped annotation work. Each sentence is annotated by 10 annotators, who are required to provide a 0 or 1 acceptability score for the sentence, as well as annotation results from two dimensions: error correction and fluency annotation. This dataset can be applied to natural language processing tasks such as grammatical error correction and text proofreading, and can also provide data support for research areas including second language Chinese teaching and acquisition, and corpus linguistics.
数据集概述
数据集名称
汉语学习者文本多维标注数据集(Yet Another Chinese Learner Corpus,YACLC)V1.0
数据集描述
YACLC是一个大规模的汉语学习者文本数据集,提供偏误多维标注。数据集由多所高校团队共同发布,主要用于语法纠错、文本校对等自然语言处理任务,以及汉语二语教学与习得、语料库语言学等研究领域。
数据集构成
- 训练集:8,000条数据,每条包括原始句子及其多种纠偏标注与流利标注。
- 验证集:1,000条数据,每条包括原始句子及其全部纠偏标注与流利标注。
- 测试集:1,000条数据,每条包括原始句子及其全部纠偏标注与流利标注。
数据格式
每条数据包含以下信息:
- 句子id
- 学习者原句文本
- 篇章id
- 篇章标题
- 标注员数量
- 多维标注信息(包括标注维度、标注后的正确文本、修改操作数量、提供该标注的标注员数量)
数据集使用
- 提交结果需为文本文件,每行为一个修改后的句子,使用THULAC工具包分词。
- 评测指标为F_0.5,通过
eval.py脚本与标准答案文件test_gold_m2比较。
数据集获取
获取训练集数据,请联系数据研发团队(blcuicall@163.com)。数据资源仅限学术研究使用,商用需购买。




