Alpha Modern Chinese Corpus (AMC Corpus)
收藏资源简介:
Alpha现代汉语语料库(AMC语料库)是一个包含“干净”现代汉语句子的语料库。所谓“干净”句子,是指语料库中的句子几乎没有数字、非中文字母或特殊符号。AMC语料库的数据主要来源于公开的在线数据,包含非虚构、虚构、科学文章和对话四种文本类型,适用于语言研究、汉语教学和自然语言处理等领域。
Alpha Modern Chinese Corpus (AMC Corpus) is a corpus containing "clean" Modern Chinese sentences. The term "clean" sentences here refers to sentences that contain almost no numerals, non-Chinese alphabetic characters or special symbols. The data of the AMC Corpus is primarily derived from publicly available online data, covering four text types: non-fiction, fiction, scientific articles and dialogues. It is applicable to fields including linguistic research, Chinese language teaching and natural language processing.
阿尔法现代汉语语料库(AMC语料库)
简介
阿尔法现代汉语语料库(The Alpha Modern Chinese Corpus,简称AMC语料库)是一个包含“干净”现代汉语句子的语料库。所谓“干净”的句子,是指该语料库中的句子尽可能少地包含数字、非汉字字母或特殊符号。
AMC语料库中的数据主要来源于公开的在线数据,这些数据受版权保护。为了避免版权问题,我们仅提供句子而不是完整文本。该语料库仅限于研究和教育用途,禁止用于任何商业目的。
AMC语料库涵盖四种类型的文本:非虚构文本、小说、学术论文和对话。
语料库大小
我们提供了四个不同大小的 AMC 语料库版本:迷你版、基础版、标准版和完整版。每个版本的 AMC 语料库包含的句子数量如下:
| 版本 | 非虚构 | 小说 | 学术文章 | 对话 |
|---|---|---|---|---|
| 迷你版 | 100K | 100K | 100K | 100K |
| 基础版 | 500K | 500K | 200K | 500K |
| 标准版 | 1M | 1M | 500K | 1M |
| 完整版 | 2M | 2M | 800K | 2M |
| 总计 | 3.6M | 3.6M | 1.6M | 3.6M |
语料库开发
为了开发AMC语料库,我们从源数据中提取数据,并通过以下步骤进行清理:
- 下载数据;
- 使用 Python 工具:hanzidentifier 删除繁体中文行/句;
- 删除包含敏感词的行/句,尤其是包含色情/成人内容的句子;
- 删除重复的行/句;
- 按照表格1所述的句子数量进行抽样;
- 随机打乱句子顺序。
数据来源
非虚构文本
非虚构文本的数据由chinese_clean_passages_80m 数据集中抽样的句子组成,该数据集本身是从ClueCorpus 2020数据集中抽样所得。
小说
小说部分包括三种体裁的文本:中国作者的小说、外国作者的译著以及中国作者的网络小说。数据来源于在线资料和“中文网络小说”数据集。
学术论文
学术论文部分的数据来自于“中文学术文献”数据集,该数据集包含了来自各个学科的摘要句子。
对话
对话部分的数据取自“大规模清洁中文对话”数据集(LCCC),该数据集中的原始对话数据来自于微博和其他自发对话。
应用
AMC语料库的应用范围包括:
- 语言学研究:分析汉语的细微差别。
- 语言教学:为第二语言/外语学习者提供真实的汉语教学材料。
- 自然语言处理:训练和评估文本生成和情感分析等任务的算法。




