遇见数据集

MU-NLPC/czech_corpus_authorship_recognition

收藏
Hugging Face2026-06-16 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是捷克作者识别语料库(Kala),由Adam Kala在硕士论文中创建,专注于捷克文本的自动作者识别。它包含从五个公开可用的捷克新闻门户网站(Echo24、Stisk online、Deník Referendum、Deník.cz、Aktuálně.cz)收集的新闻文本,用于作者归属、作者验证和作者聚类等任务。数据集包括524位作者的17,213个文档,每个作者有15到50个文档,并经过预处理,过滤掉短文本(如少于1800字符或300单词),最终保留至少1500字符或250单词的文本,并进行清理和标准化。数据集主要用于风格测量、作者识别、文本分类和捷克自然语言处理研究,但有限制:每个作者仅来自一个来源,且仅包含新闻文本。使用时应尊重原始来源的条款和版权,仅用于研究目的。

The dataset is the Czech Authorship Recognition Corpus (Kala), created by Adam Kala for a masters thesis focused on automatic authorship recognition of Czech texts. It contains Czech journalistic texts collected from five publicly available online sources (Echo24, Stisk online, Deník Referendum, Deník.cz, Aktuálně.cz), prepared for tasks such as authorship attribution, authorship verification, and authorship clustering. The dataset includes 17,213 documents from 524 authors, with each author having between 15 to 50 documents. Preprocessing involved filtering out short texts (e.g., less than 1800 characters or 300 words), and only texts meeting at least one condition (1500 characters or 250 words) were retained in the final cleaned version, with further cleaning and normalization per source. It is intended for research in stylometry, authorship recognition, text classification, and natural language processing for Czech, with limitations: each author comes from only one source portal, and the dataset consists solely of journalistic texts. Legal and ethical notes require respecting the terms of the original sources and copyright, and it is published for research purposes.

提供机构:
MU-NLPC
搜集汇总
数据集介绍
MU-NLPC/czech_corpus_authorship_recognition 数据集图片
构建方式
Czech Authorship Recognition Corpus(由Kala构建)是一个专为捷克语文档作者识别任务设计的语料库,源自五家捷克主流新闻门户(Echo24、Stisk online、Deník Referendum、Deník.cz、Aktuálně.cz)的公开在线文本。在数据采集过程中,项目严格过滤了长度低于1800字符或300词的文本;在清洗与最终构建阶段,仅保留满足至少1500字符或250词条件的文档,并依据来源渠道进行分别的清洗与标准化处理。最终语料库涵盖524位作者、共计17213篇文档,每位作者贡献的文本数量介于15至50篇之间,确保了每位作者样本量的均衡性与多样性。
特点
该数据集的核心特点在于其专为捷克语作者识别研究设计,支持文本作者归属、作者验证及基于作者风格的聚类三大任务。语料库中的每位作者均仅来源于单一新闻门户,有效控制了主题与文体风格的外部干扰。数据集内部结构清晰,分为原始未处理文本和清洗后实验用文本两个子目录,便于研究者根据实验需求灵活选用。此外,其作者数量丰富且每作者文档数分布均匀,为统计分析提供了坚实的样本基础,特别适用于小样本或跨领域作者识别方法的评估。
使用方法
该数据集主要面向风格计量学、作者识别、文本分类及捷克语自然语言处理等领域的研究。使用者可直接加载清洗后的文本进行特征提取,如n-gram频率、句法结构或词向量表示,进而构建分类或验证模型。对于作者归属任务,可按照标准文本分类流程划分训练集与测试集;对于作者验证任务,则需配对文档并判断是否出自同一作者。由于数据集格式为纯文本且无特定标签结构,研究者应依据原始文献中的实验设置自行设计评估协议,并在引用时注明出处(Kala, Adam. Automatické rozpoznání autorství. Diplomová práce, Masarykova univerzita)。
背景与挑战
背景概述
捷克语作者身份识别语料库(Czech Authorship Recognition Corpus)由Adam Kala于其硕士论文中创建,研究机构为捷克马萨里克大学信息学院。该数据集专注于解决捷克语文本的作者识别问题,涵盖作者归属、作者验证和作者聚类三大核心任务。通过收集来自Echo24、Stisk online、Deník Referendum、Deník.cz和Aktuálně.cz五个公共新闻门户的524位作者的17,213篇文档,每位作者至少提供15篇、至多50篇文本,构建了一个规模适中、结构规范的多源语料库。数据集为捷克语自然语言处理领域的计算风格学与作者身份识别研究提供了重要的基准资源,尤其推动了低资源语言在此方向上的方法论探索与实验验证。
当前挑战
该数据集所面临的领域挑战主要来自文本作者身份识别本身的复杂性:同一作者在不同主题或时间背景下的写作风格可能存在显著变异,而不同作者间风格的高度相似性又增加了区分难度。此外,捷克语作为形态丰富语言,其语法、词汇和句法特征对传统统计方法与深度神经网络均构成适配障碍。在语料库构建过程中,需克服多源数据格式不一致、文本长度差异大(最短文本需满足1500字符或250词的双重门槛)以及数据清洗与归一化处理的标准化难题。同时,每位作者仅对应单一新闻来源的设计虽简化了实验条件,但也限制了跨领域泛化能力的评估,成为实际应用部署的重要约束。
常用场景
经典使用场景
在计算语言学与数字人文学科的交汇地带,捷克作者身份识别语料库(Czech Authorship Recognition Corpus,简称CARC)为捷克语文本的作者归属分析提供了坚实的数据基础。该数据集旨在服务于三大经典任务:作者身份归属(authorship attribution)、作者身份验证(authorship verification)以及作者身份聚类(authorship clustering)。研究者通常基于该语料库中经过精细清洗与标准化的新闻报道文本,训练分类模型以判别给定文本的作者身份,或通过特征提取检测文本之间的风格相似性,从而为捷克语语境下的文体计量学探索提供标准化的实验平台。
实际应用
在实际应用层面,CARC所支撑的技术可被部署于数字取证、信息安全与内容审核等关键领域。例如,在法庭语言学中,司法调查人员可借助基于该数据集训练的作者验证模型,比对匿名威胁信与已知嫌疑人的写作风格,辅助证据链构建;在新闻出版业,编辑机构能够利用自动作者归属工具,检测跨平台的内容剽窃或虚假信息生成;而在社交媒体监控中,风格聚类算法能够识别同一用户在不同虚拟账号下的匿名活动,从而帮助反欺诈系统追踪网络水军。这些应用场景均受益于CARC提供的、经系统清洁的捷克语新闻文本资源。
衍生相关工作
CARC的发布催生了多项后续研究工作。在其基础上,计算机科学研究者们探索了基于深度神经网络的文体特征编码,如将预训练语言模型(如BERT的捷克语变体RobCzech或SlavicBERT)应用于作者归属任务,并以此评估了Transformer架构在跨主题、跨领域的泛化能力。此外,部分工作聚焦于作者聚类任务的改进,提出了结合句法树与词汇韵律特征的混合模型。在公开评测中,CARC经常被用作基准语料库,与英语(如PAN系列数据集)、德语等语种的作者识别结果进行比较,由此推动了多语种文体计量学中的可迁移性研究,并启发了面向低资源语言的跨语言作者识别框架设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务