遇见数据集

CCAE

收藏
arXiv2023-10-09 更新2024-06-21 收录
官方服务:

资源简介:

CCAE(Corpus of Chinese-based Asian Englishes)是由北京科技大学创建的多品种语料库,包含六种基于中文的亚洲英语变体,总计3.4亿词,来源于44.8万份网络文档。该数据集旨在为亚洲英语(尤其是中文英语)研究提供首个公开可访问的资源,支持特定语言模型的构建和下游任务,如语言变体识别和词汇变异识别。创建过程中,研究团队通过定制的数据收集和清洗流程确保数据质量,同时维护文档来源的可追溯性,以符合GDPR规定。CCAE的应用领域广泛,包括语言模型训练、自动语言变体识别等,旨在深入理解世界英语的多样性和复杂性。

CCAE (Corpus of Chinese-based Asian Englishes) is a multivarietal corpus developed by the University of Science and Technology Beijing. It comprises six Chinese-based Asian English varieties, with a total size of 340 million words sourced from 448,000 web documents. This dataset aims to provide the first publicly accessible resource for Asian English (especially Chinese English) research, supporting the construction of targeted language models and downstream tasks such as language variety identification and lexical variation recognition. During its development, the research team ensured data quality through customized data collection and cleaning workflows, while maintaining traceability of document sources to comply with GDPR regulations. CCAE has a wide range of application scenarios, including language model training, automatic language variety identification and others, with the goal of gaining in-depth insights into the diversity and complexity of World Englishes.

提供机构:
北京科技大学
创建时间:
2023-10-09
搜集汇总
数据集介绍
CCAE 数据集图片
构建方式
CCAE的构建遵循了覆盖广度、地域准确性与领域多样性三大原则。研究团队从COCA语料库中抽取高频三词词组作为种子查询,利用Google高级搜索限定区域,分别针对中国大陆、香港、澳门、台湾、马来西亚及新加坡六个地区进行网页爬取。通过Selenium与ChromeDriver模拟用户行为,并结合2captcha服务绕过验证码,收集了逾44万条URL。最终下载的原始WARC文件经JusText工具提取正文,经过去重、过滤短文本与不当内容,并以JSON格式存储,每条记录包含文本ID、时间、词数、语域、URL、标题及内容等结构化字段。
特点
该数据集是全球首个面向中文及华语圈亚洲英语变体的大规模开放网络语料库,覆盖六种变体,总计3.4亿词元与44.8万篇文档。其显著特点在于高质量的数据清洗与文档级去重,保障了后续任务的可靠性。每篇文档均保留原始URL信息,支持溯源与合规撤回,符合GDPR要求。此外,语料库提供了丰富的元数据,如时间戳与领域标签,便于进行历时语言变化分析与领域适应研究。相较于GloWbE等现有语料库,CCAE在解析与清洗质量上表现更优,且采用开放许可发布,极大促进了世界英语研究的可复现性与可扩展性。
使用方法
CCAE可直接用于语言变体建模与自动变体识别等下游任务。在语言建模方面,研究者可使用GPT-2等预训练模型在六种变体数据上进行零样本评估或微调,实验表明针对性微调能显著降低困惑度。在自动变体识别任务中,可利用Longformer等长文档分类器对语料进行训练,借助元数据中的变体标签作为监督信号,实验已取得超过73%的加权平均F1分数。语料库以Hugging Face数据集格式发布,支持直接加载与拆分,用户可根据自身需求选择带词性标注的版本,或按变体、时间、领域等条件筛选子集进行定制化研究。
背景与挑战
背景概述
在全球语言变异研究领域,世界英语(World Englishes)已成为一个蓬勃发展的学术方向,学者们致力于揭示英语在不同社会文化环境中的本地化特征。然而,基于预训练语言模型(PLMs)的现代自然语言处理技术在这一领域的应用仍处于萌芽阶段,尤其是针对华语圈英语变体的系统性语料资源极为匮乏。在此背景下,北京科技大学的刘洋、秦晓辉、王龙和黄超等研究人员于2023年构建了CCAE(Chinese-based Asian Englishes)语料库,这是首个面向中文基础亚洲英语变体的大规模、开放获取的网络语料库。该语料库整合了来自中国大陆、香港、澳门、台湾、马来西亚和新加坡六个地区的约3.4亿词元,涵盖44.8万篇网页文档,旨在为亚洲英语变体研究提供坚实的数据基础设施,并推动基于NLP的世界英语研究范式。CCAE的发布填补了扩展圈英语(Expanding Circle English)尤其是中国英语(Chinese English)领域缺乏公开可用语料库的空白,对语言模型的多变体适应性和下游任务(如变体识别、词汇变异分析)具有重要的学术价值。
当前挑战
CCAE语料库的构建与研究所面临的挑战主要体现在两个层面。在领域问题层面,当前预训练语言模型对英语变体的细粒度差异捕捉能力有限,尤其在零样本场景下,模型对中国英语(CHE)和澳门英语(MCE)等变体的困惑度显著偏高(例如MCE的零样本困惑度高达32.2),表明多变体语言建模存在内在复杂性;自动变体识别(AVI)任务中,少数类样本(如MCE仅94条验证样本)的F1值低至70.17,凸显了数据不平衡对模型泛化能力的制约。在构建过程层面,数据收集需克服Google搜索的反爬虫机制(如reCAPTCHA验证),并依赖第三方服务2captcha进行绕过,同时需通过人工标注确保域名多样性;数据清洗中,尽管采用JusText工具提取正文并过滤不完整句子,但仍有约65%的URL无法通过互联网档案馆获取准确发布日期,导致时间元数据缺失;此外,部分URL因Google索引策略的微小误差被错误关联至其他地区,需人工校正,这增加了构建成本与维护难度。
常用场景
经典使用场景
在语言变异与全球英语研究的交叉领域中,CCAE语料库作为首个面向中文基础亚洲英语的多变体网络语料库,其经典应用场景集中于预训练语言模型在多变体环境下的语言建模与自动变体识别。研究者利用该语料库中涵盖中国大陆、香港、澳门、台湾、马来西亚及新加坡六种英语变体的海量文本,通过GPT-2等模型进行零样本与微调实验,揭示了不同变体在词汇、句法层面的独特语言特征,为理解亚洲英语的本地化演变提供了数据驱动的实证基础。
衍生相关工作
CCAE语料库的发布催生了一系列衍生研究工作,主要聚焦于变体感知语言模型的构建与低资源变体的增强学习。例如,研究者基于该语料库探索了域适应技术在亚洲英语变体间的迁移效果,开发了针对澳门英语等小样本变体的数据增强策略。此外,该语料库还启发了将世界英语研究框架与多任务学习相结合的探索,推动了如词汇变异检测、句法结构对比分析等下游任务的标准化评估基准建立,形成了计算语言学界与英语语言学界的跨学科研究新范式。
数据集最近研究
最新研究方向
CCAE数据集的最新研究方向聚焦于利用预训练语言模型探索亚洲英语变体的语言建模与自动变体识别,这标志着自然语言处理技术与世界英语研究范式的深度融合。在全球化与多语接触日益频繁的背景下,该数据集首次为汉语及汉语影响的亚洲英语变体(如中国大陆英语、香港英语、新加坡英语等)提供了大规模、高质量且可追溯的网络语料资源。前沿研究通过GPT-2和Longformer等模型在CCAE上进行零样本与微调实验,揭示了不同英语变体在语言模型中的困惑度差异与识别挑战,尤其凸显了小样本变体(如澳门英语)的建模难度。这一工作不仅填补了扩展圈英语语料库的空白,更为推动去偏见、文化多样性的语言模型发展奠定了数据基础,对世界英语研究与多语言NLP应用具有重要的学术价值与实践意义。
相关研究论文
  • 1
    CCAE: A Corpus of Chinese-based Asian Englishes北京科技大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务