遇见数据集

caine-dataset

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

该数据集旨在用于训练Caine模型,以支持通用的创意写作任务。其内容主要来源于网络上的各类叙事性和百科类文本,具体包括同人小说(Fanfiction)、情色文学(Erotica)、维基百科页面(Wikipedia)以及类似性质的资料。数据来源广泛,涵盖了多个知名平台和社区,例如Wattpad、Literotica、Rtenzo、Creepypasta、Nightscribe和Fandom等。数据集规模在10万到100万样本之间,语言为英语,主要适用于文本生成任务,尤其侧重于故事创作、同人小说和特定类型叙事内容的生成。

This dataset is designed for training the Caine model to support general creative writing tasks. Its content primarily consists of narrative and encyclopedic texts sourced from the internet, specifically including fanfiction, erotica, Wikipedia pages, and similar materials. It draws from a wide range of well-known platforms and communities, such as Wattpad, Literotica, Rtenzo, Creepypasta, Nightscribe, and Fandom, among others. The dataset contains between 100,000 and 1,000,000 English samples, and is primarily intended for text generation tasks, with a particular focus on story creation, fanfiction, and the generation of narrative content across specific genres.

创建时间:
2026-06-20
原始信息汇总

数据集概述

  • 数据集名称:Caine Dataset
  • 许可证:MIT
  • 任务类别:文本生成
  • 语言:英语
  • 数据规模:100,000 至 1,000,000 条样本
  • 标签:故事、rtenzo、同人小说、情色文学

数据内容

该数据集用于训练面向一般创意写作的 Caine 模型,包含以下类型的内容:

  • 同人小说
  • Wattpad 平台内容
  • Literotica 平台内容
  • Rtenzo 平台内容
  • Creepypasta 恐怖故事
  • Nightscribe 平台内容
  • Wikipedia 页面
  • Fandom 平台内容
  • 其他类似内容
搜集汇总
数据集介绍
caine-dataset 数据集图片
构建方式
该数据集旨在为创意写作领域的大语言模型训练提供高质量的文本资源,其构建过程系统性地整合了来自多个网络平台的多样化叙事文本。数据来源涵盖了大型同人小说社区如Fanfiction与Wattpad、成人文学站点Literotica与Rtenzo、恐怖故事集Creepypasta与Nightscribe,以及百科全书性质的Wikipedia与Fandom等。通过爬取与筛选,从这些平台中提取了百万级规模的英文故事、同人创作、情色文学及百科条目,形成了覆盖广泛叙事风格与主题的文本语料库。
特点
caine-dataset的显著特点在于其内容的丰富性与题材的包容性。它不仅包含传统的创意写作素材如同人小说与恐怖故事,还纳入了情色文学与百科全书条目,为模型学习不同叙事结构与情感表达提供了独特视角。该数据集规模适中(10万至100万条),聚焦于英文文本,避免了多语言混杂带来的噪声,同时其标签体系涵盖了stories、fanfic、erotica等核心类别,便于针对性训练。这种多元化构成使得模型在生成具有情感张力和情节复杂性的文本时表现更为自然流畅。
使用方法
该数据集主要适用于文本生成任务,尤其是创意写作场景下的模型微调。用户可直接通过HuggingFace平台加载数据集,利用其提供的text-generation任务标签进行训练。使用时建议将数据划分为训练集与验证集,并结合英文分词器进行预处理。鉴于内容包含情色题材,在部署生成模型时应考虑内容过滤与伦理审查。开发者可根据具体需求,依据数据集中的标签(如fanfic或erotica)选择性提取子集,以训练特定风格的写作模型。该数据集以MIT许可证发布,支持学术与商业用途的灵活调用。
背景与挑战
背景概述
创意写作作为自然语言生成领域的重要分支,长期以来受限于高质量、多样化的训练语料匮乏。caine-dataset正是在这一背景下应运而生,由相关研究团队于近期构建,旨在为创意写作模型提供涵盖同人小说、情色文学、维基百科及各类小众叙事文本的数据资源。该数据集整合了Wattpad、Literotica、Rtenzo等多种平台上的内容,突破了传统语料库在叙事风格与主题多样性上的局限,为生成更具想象力和风格特色的文本模型奠定了数据基础,对推动创意写作AI的发展具有启发性意义。
当前挑战
该数据集所解决的领域核心挑战在于创意写作中模型对非正式、多风格、低资源文本的生成能力不足,现有语料多偏重新闻或学术文本,难以捕捉同人创作与情色文学中的独特语境与表达。构建过程中面临的主要挑战包括:1)从不同来源爬取内容时需处理版权与隐私边界,确保合法合规;2)对情色内容进行伦理筛选,避免有害或极端材料;3)多种叙事类型混杂增加了数据清洗与标注的难度,需平衡语料丰富度与模型可控性之间的关系。
常用场景
经典使用场景
在创意写作与叙事生成领域,caine-dataset凭借其多元化的语料来源——涵盖同人小说、Wattpad、Literotica、Creepypasta等平台,成为训练大型语言模型(LLM)进行文本生成任务的经典数据集。其核心场景聚焦于引导模型学习非正式、情感丰富且风格多样的叙事结构,尤其是在长文本连贯性、角色对话塑造及情节发展逻辑上提供训练支撑。研究者常以此数据集为基础,微调如GPT、Llama等模型,使其能够生成符合特定社区文化语境的故事,例如模仿同人创作中的角色互动或恐怖短篇的悬疑氛围,从而推动生成式AI在个性化写作辅助与娱乐内容自动创作中的应用。
实际应用
实际应用中,caine-dataset训练的模型广泛服务于创意产业的内容生产流程。例如,小说写作平台可借助微调后的模型为作者提供续写灵感或风格化段落建议;自媒体与游戏开发团队利用其生成剧情大纲、角色对话或世界观设定,显著降低人力创作成本。此外,该数据集在交互式小说(如AI Dungeon类游戏)中扮演关键角色,使模型能够根据用户输入实时生成与目标体裁(如恐怖、浪漫、奇幻)一致的文本,提升沉浸式体验。教育领域亦有所涉足,用于开发写作辅助工具,帮助学生通过模仿经典网络文学结构来提升叙事技巧。
衍生相关工作
caine-dataset衍生了一系列聚焦创意写作的模型与基准测试工作。例如,以该数据集为基础微调的‘Caine’系列模型专门优化了长篇故事生成能力,其架构设计强调上下文窗口扩展与情感连贯性控制。后续研究进一步构建了如StoryBench等评测基准,专门评估模型在情节合理性、角色一致性等维度的表现。部分工作还探索了将数据集中的同人小说与文学理论结合,训练具备风格感知的生成模型,推动‘可控制写作’领域的发展。此外,该数据集促使学者重新审视网络文本中潜在的偏见与伦理问题,衍生出关于安全生成、版权规避的讨论,为负责任的AI创作研究提供了案例支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务