Australian Corpus of English (ACE)
收藏资源简介:
澳大利亚英语语料库(ACE)是为了匹配1986年以来的澳大利亚数据与20世纪60年代的标准美国和英国语料库(Brown和LOB)而编制的。它包括100万个已发表文本的单词,涵盖500个样本,分为15个非虚构和虚构类别。
The Australian English Corpus (ACE) was compiled to align Australian English linguistic data from 1986 onwards with the canonical American Brown Corpus and British LOB Corpus from the 1960s. It contains one million words of published text, comprising 500 samples categorized into 15 genres spanning both non-fiction and fiction.
澳大利亚英语语料库(ACE)
概述
澳大利亚英语语料库(ACE)是为了匹配1986年的澳大利亚数据与20世纪60年代的标准美国和英国语料库(Brown和LOB)而编制的。它包括100万个单词的已发表文本,涵盖500个样本,分为15个非虚构和虚构类别。
关键词:澳大利亚英语,语料库语言学。
数据来源
原始数据集来自麦考瑞大学研究数据 - 澳大利亚英语语料库(ACE),并根据CC BY 4.0许可进行授权。
数据集结构
解压ACE.zip后,数据集包含在ACE目录下:
data目录包含1718个.txt文件,每个文档包括纯文本和原始两种格式。Manul目录包含18个.HTM文件,提供每个文档的来源字幕和作者信息。
下载
您可以直接从麦考瑞大学研究数据 - 澳大利亚英语语料库(ACE)下载。
您也可以通过在终端运行download.py来下载:
bash
$ python3 download.py --help
usage: download.py [-h] [--save_path SAVE_PATH] [--unzip]
下载文件并选择性解压。
选项: -h, --help 显示帮助信息并退出 --save_path SAVE_PATH 保存下载文件的路径 --unzip 如果是zip文件则解压
例如:
python3 download.py --save_path my_data --unzip将在my_data目录下下载并解压数据集ACE.zip。python3 download.py将仅在当前目录下下载。
许可
本仓库根据MIT许可进行授权。




