遇见数据集

Roaoch/CyberClassic_True.False

收藏
Hugging Face2024-07-21 更新2024-07-06 收录
官方服务:

资源简介:

该数据集包含两列:文本和标签。文本列包含单句文本,标签列包含浮点数类型的标签。数据集总共有18826行,其中13048行是来自陀思妥耶夫斯基(F.M. Dostovesky)作品的真实句子,5771行是来自库普林(A.I. Kuprin)作品和RuGPT3生成的虚假句子。真实句子来自陀思妥耶夫斯基的《罪与罚》、《穷人》、《白痴》、《群魔》和《卡拉马佐夫兄弟》。虚假句子来自库普林的《坑》。

This dataset contains two main features: text and labels. text is of string type and contains single sentences; labels is of float64 type and represents labels. The dataset is divided into a training set and a test set, containing 16943 and 1883 samples respectively. The dataset is primarily used for text classification and text generation tasks, with the language being Russian. The dataset is named cyberclassic, with a size between 10K and 100K. The description of the dataset mentions that the text column contains single sentences from the texts of Dostovesky F.M., as well as single sentences from the texts of Kuprin A.I. and sentences generated with RuGPT3.

提供机构:
Roaoch
原始信息汇总

数据集概述

基本信息

  • 许可证: MIT
  • 数据集名称: cyberclassic
  • 任务类别:
    • 文本分类
    • 文本生成
  • 语言: 俄语
  • 数据集大小: 10K < n < 100K

数据集结构

特征

  • text: 字符串类型
  • labels: 浮点数类型

数据分割

  • 训练集:
    • 样本数量: 16943
    • 字节数: 4079811.5814830554
  • 测试集:
    • 样本数量: 1883
    • 字节数: 453419.4185169446

数据文件

  • 配置名称: default
    • 训练集路径: data/train-*
    • 测试集路径: data/test-*

数据来源

True label

  • 数据量: 13048行
  • 来源:
    • 《罪与罚》 - 陀思妥耶夫斯基
    • 《穷人》 - 陀思妥耶夫斯基
    • 《白痴》 - 陀思妥耶夫斯基
    • 《群魔》 - 陀思妥耶夫斯基
    • 《卡拉马佐夫兄弟》 - 陀思妥耶夫斯基

False label

  • 数据量: 5771行
  • 来源:
    • 《坑》 - 库普林
    • 使用RuGPT3生成的句子
搜集汇总
数据集介绍
Roaoch/CyberClassic_True.False 数据集图片
构建方式
该数据集名为Roaoch/CyberClassic_True.False,专为文本分类与生成任务而设计,聚焦于俄语文学语料的判别。其构建方式别具匠心:正例(True)标签的句子全部源自陀思妥耶夫斯基的五部经典著作,包括《罪与罚》《穷人》《白痴》《群魔》与《卡拉马佐夫兄弟》,共计13048条独立语句;负例(False)标签则包含库普林的小说《陷阱》中的句子,以及由RuGPT3模型生成的语句,总计5771条。数据被划分为训练集(16943条)与测试集(1883条),以平衡模型学习与评估的需求。
特点
该数据集的核心特点在于其独特的正负例构建逻辑,不仅捕捉了陀思妥耶夫斯基文学语言的风格精髓,还引入了库普林的文本与机器生成语句作为对比,形成了鲜明的语义与风格对立。这种设计使得数据集在细粒度文本风格识别上具有高度区分性,适用于检测文学语言与合成文本的差异。此外,数据集规模适中(约1.8万条样本),兼顾了训练效率与模型泛化能力,且标签为连续浮点数,可能隐含了置信度或概率信息,增强了任务的灵活性。
使用方法
使用该数据集时,用户可直接通过HuggingFace的datasets库加载,默认配置包含训练与测试分片。对于文本分类任务,可将'text'列作为输入,'labels'列作为目标,利用预训练语言模型(如RuBERT)进行微调,以识别句子是否源自陀思妥耶夫斯基的作品。在文本生成场景中,该数据集可作为风格迁移或文学仿写的训练语料,通过条件生成模型学习正例的文学特征。建议在加载后对标签进行归一化处理,并根据任务需求调整数据划分比例。
背景与挑战
背景概述
在自然语言处理与文学文本分析的交叉领域中,区分不同作者的语言风格与识别生成文本的真伪成为重要研究课题。Roaoch/CyberClassic_True.False数据集应运而生,由研究者于近期创建,旨在探索古典文学文本与机器生成文本的二元分类问题。该数据集以俄罗斯文学巨匠陀思妥耶夫斯基的五部经典作品(如《罪与罚》《卡拉马佐夫兄弟》)中的句子作为正样本,同时以库普林作品及RuGPT3模型生成的句子作为负样本,构建了一个包含约1.7万条训练样本和1883条测试样本的标注语料库。其核心研究问题聚焦于如何利用机器学习方法精准识别文学文本的原创性,为数字人文领域中的作者身份验证、文本真实性检测以及语言风格量化分析提供了关键基准资源,对推动计算语言学与文学研究的深度融合具有显著影响力。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:文本分类任务需区分人类文学创作与机器生成文本,然而陀思妥耶夫斯基与库普林的语言风格差异虽显著,但RuGPT3生成的句子可能刻意模仿文学语体,导致类别边界模糊,且正负样本数量不均衡(正样本13048条,负样本5771条),易引发模型对多数类的偏好。在构建过程中,挑战源自文本预处理与标注的严谨性:从多部文学作品中提取单句需确保语义完整性与上下文独立性,而RuGPT3生成文本的真实性需通过人工校验以避免噪声混入;此外,跨作者文本的选取需平衡文学流派与时代背景差异,以防模型学习到非目标特征。这些挑战共同要求模型具备细粒度语义理解与鲁棒泛化能力。
常用场景
经典使用场景
在自然语言处理与计算文体学领域,Roaoch/CyberClassic_True.False数据集为文本的文学风格归属与真实性鉴别提供了精妙的实验平台。该数据集精心整合了陀思妥耶夫斯基经典著作(如《罪与罚》《白痴》《卡拉马佐夫兄弟》)的语句作为正例,同时以库普林作品与RuGPT3生成的句子构成负例,从而构建出一个二元分类任务。研究者可借此深入探索作者风格表征的量化方法,检验深度学习模型在捕捉19世纪俄国文学语体细微差异方面的能力,尤其适用于训练和评估基于Transformer架构的文本分类器。
衍生相关工作
围绕该数据集已衍生出一系列富有启发性的研究工作,包括基于对比学习的少样本作者风格迁移方法,以及融合句法树与注意力机制的文体特征提取框架。部分学者利用其构建了跨语种的文学风格对比基准,将陀思妥耶夫斯基的俄语原文与翻译文本进行风格一致性验证。更有团队在此基础上提出风格扰动对抗训练策略,以提升分类器对风格化生成文本的鲁棒性。这些工作共同拓展了计算文体学与生成文本检测交叉领域的研究图景。
数据集最近研究
最新研究方向
该数据集聚焦于俄语文学文本的语义真实性鉴别与生成文本检测的前沿方向。通过整合陀思妥耶夫斯基(True标签)与库普林及RuGPT3生成文本(False标签)的单句语料,为古典文学风格建模与人工智能生成内容(AIGC)的溯源研究提供了高对比度基准。在生成式大模型引发文本真实性危机的当下,该数据集为探索19世纪经典文学的语言特征向量化、作者风格指纹提取以及机器生成文本的语义异常检测开辟了新路径,尤其助力于斯拉夫语系数字人文领域的文本真伪鉴定与文学遗产保护研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务