CEFR, CLEC, CLOTH, NES, OSP, RACE
收藏资源简介:
我们使用了六个数据集进行可读性研究。源文件可以从百度云获取。CEFR是描述语言能力和水平的国际标准,根据不同难度的语言文本将六个级别划分为从初学者到专业水平。CLEC是基于学习者英语写作的语料库,包括五个级别的语料库,涵盖中学生、大学英语四六级、初级和高级专业英语。CLOTH是一个大规模的英语完形填空测试集,分为初中和高中两个年级。NES语料库由新闻文章组成,覆盖了从小学到高中的文章。OSP和RACE未提供详细描述。
We utilized six datasets for readability research. The source files can be obtained from Baidu Cloud. The CEFR (Common European Framework of Reference for Languages) is an international standard for describing language ability and proficiency, categorizing six levels from beginner to professional based on the difficulty of language texts. The CLEC (Chinese Learner English Corpus) is a corpus based on English writing by learners, including five levels of corpora that cover middle school students, college English levels four and six, as well as basic and advanced professional English. CLOTH is a large-scale English cloze test set, divided into junior and senior high school grades. The NES corpus consists of news articles, covering articles from elementary to high school levels. Detailed descriptions for OSP and RACE are not provided.
数据集概述
数据集名称
- Cross-corpus-readability-compatibility-assessment-for-English-texts
背景
- 本研究关注文本可读性评估的跨语料库兼容性,提出了一种新的评估框架CRCA。
- 涉及的语料库包括CEFR, CLEC, CLOTH, NES, OSP, RACE。
- 使用了GloVe词向量表示和融合特征。
- 分类模型采用机器学习方法(XGBoost, SVM)和深度学习方法(BiLSTM, Attention-BiLSTM)。
- 兼容性度量使用RJSD, RRNSS, NDCG。
数据集内容
语料库
- CEFR: 描述语言熟练度和级别的国际标准,分为六个级别。
- CLEC: 基于学习者英语写作的语料库,包含五个级别。
- CLOTH: 大型英语完形填空测试集,分为初中和高中两个级别。
- NES: 包含从2年级到12年级不同级别的新闻文章。
- OSP: 包含三个阅读难度级别,每个级别189篇文章。
- RACE: 来自中国中学英语考试的阅读理解材料,分为初中和高中两个级别。
特征
- 特征分为词汇特征、句法特征和语法特征。
- 具体特征包括平均音节数每词、平均字母数每词、困难词百分比等。
框架
- 提出的方法包括特征提取、词向量表示、特征融合、模型训练、可读性预测和可读性系统兼容性评估六个步骤。
模型
- 机器学习模型:XGBoost, SVM。
- 深度学习模型:Bi-LSTM, ATT-BI-LSTM。
结果
- 使用三种实验组合对六个语料库进行可读性评估。
- 使用RJSD, RRNSS, NDCG三种评估指标评估预测结果的兼容性。
- 展示了RJSD评估的部分结果,详细结果见论文。




