The University of Pittsburgh English Language Institute Corpus (PELIC)
收藏资源简介:
这是一个大型学习者语料库,包含书面和口头文本,收集于匹兹堡大学强化英语课程的学术英语环境中,历时七年,由具有广泛语言背景和熟练程度的学生制作。与大多数横断面学习者语料库不同,PELIC是纵向的,提供了在自然课堂环境中跟踪发展的更大机会。
This is a large learner corpus comprising both written and spoken texts, collected over seven years in an academic English context within the Intensive English Program at the University of Pittsburgh. It was produced by students with a wide range of linguistic backgrounds and proficiency levels. Unlike most cross-sectional learner corpora, PELIC is longitudinal, offering greater opportunities to track development in a natural classroom setting.
数据集概述
数据集名称
The University of Pittsburgh English Language Institute Corpus (PELIC)
版本
Version 1.1
作者
Alan Juffs, Na-Rae Han, Ben Naismith
联系方式
bnaismith@pitt.edu
数据集引用
Juffs, A., Han, N-R., & Naismith, B. (2020). The University of Pittsburgh English Language Corpus (PELIC) [Data set]. http://doi.org/10.5281/zenodo.3991977
数据集描述
PELIC是一个大型学习者语料库,包含书面和口语文本。这些文本是在匹兹堡大学强化英语课程的英语学术用途(EAP)背景下,由具有广泛语言背景和熟练程度的学生在七年内收集的。与大多数横断面学习者语料库不同,PELIC是纵向的,提供了在自然课堂环境中跟踪发展的更大机会。
数据集内容
数据集包含以下文件:
- answer.csv
- course.csv
- question.csv
- student_information.csv
- test_scores.csv
- PELIC_compiled.csv
数据集统计
- 学生数:1177
- 文本数:46230
- 令牌数:4250703
- 词类型数:39623
- 引理类型数:39307
数据集下载
建议使用GitHub和克隆整个仓库进行下载,需要使用git-lfs(Git Large File Storage)。
数据集处理
数据处理包括转换、清理、标准化、数据点筛选和匿名化。文本数据经过深度清理,包括格式化、字符转换和匿名化处理。此外,还进行了语言处理,包括令牌化、词性标注和词形还原。
数据集使用
数据集适用于语言学研究,特别是第二语言习得(SLA)领域。提供了多种工具和教程,以帮助研究人员访问和分析这些数据。




