遇见数据集

dsg-state-continuation

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

DSG State-Continuation 是一个用于图条件长篇小说生成的数据集,旨在训练模型在给定前序章节的叙事状态和当前章节的一句话简介后,生成该章节的文本。数据集基于 215 部来自 Project Gutenberg 的英文公版小说(主要是 19 至 20 世纪作品),按章节分割,共包含 6,876 个样本。每个样本包含:小说标识、标题、作者、章节编号、前序章节的图状态(作为有界事实摘要,因果性地构建并维护,区分 ELABORATE、SUPERSEDE、REVISE 三种操作)、当前章节的一句话简介、参考章节文本(平均约 4,100 字符)及其长度。约 3.2% 的样本(第一章)状态为空。该数据集专门用于微调语言模型,使其能够利用并维护叙事状态,而非仅在上下文中包含状态。其局限在于:仅涵盖英语公共领域小说,风格受限于特定时代;状态由模型提取且未经过人工标注,可能存在噪声;章节分割基于启发式规则;训练时需按书划分,避免跨章节信息泄露。

DSG State-Continuation is a dataset for graph-conditioned long-form novel generation, designed to train models to generate the text of a chapter given the narrative state of previous chapters and a one-sentence summary of the current chapter. The dataset is based on 215 English public domain novels from Project Gutenberg (mainly works from the 19th and 20th centuries), segmented by chapter, containing a total of 6,876 samples. Each sample includes: novel identifier, title, author, chapter number, the graph state of previous chapters (as a bounded factual summary, causally constructed and maintained, distinguishing three operations: ELABORATE, SUPERSEDE, REVISE), a one-sentence summary of the current chapter, the reference chapter text (average ~4,100 characters), and its length. Approximately 3.2% of samples (first chapters) have an empty state. This dataset is specifically used for fine-tuning language models to utilize and maintain narrative states, rather than merely including states in the context. Its limitations include: covering only English public domain novels, with styles restricted to a specific era; states are extracted by a model without human annotation, potentially introducing noise; chapter segmentation is based on heuristic rules; training requires splitting by book to avoid cross-chapter information leakage.

创建时间:
2026-09-04
原始信息汇总

数据集概述:DSG State-Continuation

DSG State-Continuation 是一个用于图条件长篇虚构小说生成任务的训练数据集。其核心任务是:给定读者在阅读第1至t-1章后所持有的叙事状态,以及第t章的一句话简介,模型需要生成第t章的完整文本。该数据集旨在训练模型利用维护叙事状态,而非仅仅在上下文中存储信息。

数据规模与来源

  • 数据量:包含 6,876 个示例
  • 基础语料:来自 215 部公有领域英文小说(来源于 Project Gutenberg),并按章节进行切分。
  • 语言:英文。
  • 文本长度:每章目标文本的平均长度约为 4,100 个字符。

数据构建核心:因果状态机制

该数据集的核心创新在于其叙事状态的构建方式,该状态并非简单的摘要或检索索引,而是一个因果构建、修订感知的断言存储库

  • 因果性:在生成第t章时,状态仅包含读者从第1至t-1章所能获知的信息。
  • 更新演算:通过显式的演算规则维护状态,并区分三种操作,以处理不同性质的文本更新:
操作 使用场景 效果
ELABORATE 后续文本对先前模糊之处进行细化说明 原地精炼,不撤回任何信息
SUPERSEDE 故事世界本身发生变化(如新事件发生) 关闭旧信息的有效区间,但保留其作为历史记录
REVISE 读者先前理解有误(事实从未成立) 撤回该信息及其所有派生信息

这种对 SUPERSEDEREVISE 的区分,在操作层面体现了叙事学中“故事事件”与“讲述披露”的差异。该判定基于一个可检查的词表(如谓词可变性、证据来源、揭示标记),不使用语言模型进行决策

质量验证:在一项对28部小说的注释测试中,通过该演算机制构建的状态存储,其自我矛盾率为 0.0% ,而传统追加式存储的矛盾率为 37–42%(该结果在1.5B、3B、7B等不同模型规模下均保持稳定)。

数据字段

数据集包含以下字段:

字段 描述
book_id, title, author 来源(古腾堡计划)信息
chapter 章节编号(从1开始)
state 第1至t-1章后的图状叙事状态摘要
beat 第t章的一句话内容简介
target 第t章的真实文本
target_chars 目标文本的字符长度

特别说明:所有行中,有 3.2% 的样本其状态为空,这些样本对应的是每本小说的第一章(即冷启动情况)。

预期用途与局限性

  • 预期用途:微调写作模型,使其能够**“使用”**持续更新的叙事状态,而非仅仅在上下文中拥有该状态。其核心优势在于扩展性——状态摘要的大小不会随故事增长而膨胀,而完整的对话记录则会。
  • 主要局限性
    1. 语料风格:基于英文公有领域小说构建,主要为19世纪至20世纪初的作品,因此其散文风格和人名命名规范具有明显的时代特征。
    2. 状态质量:叙事状态为自动提取(由 Qwen2.5-7B-Instruct 生成)并经符号化协调,并非人工标注。因此可能含有提取噪声,包括虚构的谓词或偶发的错误属性指认。
    3. 章节切分:章节分割采用启发式规则(主要依据标题,并设有段落块回退方案),无法保证绝对精确。
    4. 数据划分建议:训练集划分应按书进行,而非按行进行。因为来自同一部小说的不同章节共享叙事状态,若随机划分会导致数据泄漏,影响评估的公平性。

许可与标签

  • 许可协议:cc0-1.0(公共领域贡献)。
  • 任务类别:文本生成。
  • 数据集标签:叙事、长文生成、知识图谱、故事生成。
搜集汇总
数据集介绍
dsg-state-continuation 数据集图片
构建方式
该数据集源自215部公有领域英文小说,按章节切分后共得6,876个训练实例。其核心构建机制在于一种因果性的叙事状态维护策略:针对每部小说的第t章,系统基于前t-1章内容提炼出读者应持有的叙事状态,并以结构化图形式存储。这一状态并非简单的摘要或检索索引,而是通过一个显式更新演算来维护,该演算区分了三种操作——细化、取代与修正,用以精准处理叙事进展中信息的演变、世界状态的变更及读者认知的纠偏。所有状态由Qwen2.5-7B-Instruct模型提取,并经符号逻辑校验,确保不依赖语言模型进行主观判断,进而保障状态的一致性与可靠性。
特点
数据集独树一帜之处在于其状态维护的精确性。在28部人工标注的小说上,该演算机制使得状态槽的自相矛盾率维持在0.0%,远低于单纯追加式存储模型37%至42%的矛盾率,且此优势在不同规模模型(1.5B、3B、7B)下均稳定存在。此外,数据集通过3.2%的空状态行处理章节冷启动问题,同时明确划分取代与修正的语义界限,完美对齐叙事学中故事事件与叙述披露的理论分野。所有状态均附带词法依据,可审计、可解释,为长篇幅虚构文本的条件生成提供了坚实的结构支撑。
使用方法
数据集旨在赋能模型在生成过程中主动运用维护良好的叙事状态,而非仅将其作为上下文背景。应用时,需按书籍而非单行进行训练数据划分,以避免章节间因共享状态而导致的信息泄露。每个样本包含结构化的状态图、下一章的一句话概要及真实章节文本,适配序列到序列或纯文本生成模型的微调。由于状态摘要大小不随故事情节增长,该方法可有效应对超长文本生成中的规模挑战。使用时需注意数据集内容限于19至20世纪初的英文公有领域小说,风格与命名具有时代特征,且提取状态可能存在噪声,需在后处理或评测时予以考虑。
背景与挑战
背景概述
该数据集由Dynamic Story Graph项目于近年创建,旨在推动图条件式长篇虚构文本生成的研究。其核心问题在于,如何使生成模型在长篇小说写作中,能够利用并维护一个随剧情演进、因果一致且结构化表达的故事状态。团队基于Project Gutenberg的215部公共领域英文小说,经章节切分与状态构建,产出6,876条训练实例。该数据集通过区分ELABORATE、SUPERSEDE与REVISE三种状态更新操作,实现了对事件时间线与叙述披露的严谨建模,显著降低了故事状态的自相矛盾率,为长文本生成中的上下文管理提供了新范式,对叙事智能领域具有重要参考价值。
当前挑战
数据集面临的挑战首要在于长篇小说生成中维持连贯且无矛盾的叙事状态,传统追加式上下文随故事增长而膨胀,且易导致状态冲突——试验显示追加存储的自相矛盾率高达37–42%。构建过程中,状态由语言模型自动抽取,伴随提取噪声,包括虚构谓词与错误指认,且需避免随机切分引发的书籍间数据泄漏,训练须按书划分。此外,状态构建依赖人工设计的可变性词典,如何推广至多语言或现代文本,仍是一大难点。
常用场景
经典使用场景
DSG State-Continuation数据集的核心应用场景在于图条件的长篇虚构文本生成,即基于读者在阅读前序章节后所持有的叙事状态,结合给定章节的简要提示,生成后续章节的连贯文本。该数据集为训练模型理解并利用持久化的叙事状态而非仅依赖上下文窗口提供了丰富的语料基础,从而支持在长篇故事中保持情节一致性和角色动态变化。其设计理念在于通过状态摘要实现跨章节的因果推理,使模型能够处理远超上下文限制的故事长度。
实际应用
该数据集的实际应用可与叙事驱动的交互式系统、辅助写作工具、以及自动生成适应读者状态的长篇虚拟世界内容相结合。例如,在游戏或交互叙事中,系统可根据玩家当前已搜集到的事实状态动态生成下一个情节分支,确保故事线不因用户的个性化路径而产生逻辑漏洞。此外,模型还能被微调为写作助手,协助作者维护复杂故事的连续性,自动识别和修订不一致的叙述要素,从而提升创作效率。
衍生相关工作
由该数据集衍生的相关工作包括基于动态状态更新的神经故事生成器,以及将叙事状态建模为知识图谱的跨文档情节规划方法。研究者在此基础上发展出对比学习框架以训练模型区分新增事实、被取代事实和错误修正,进一步提升生成文本的可信度。同时,该数据集也启发了对叙事时间线一致性评估指标的设计,推动了自动评估故事逻辑性的基准测试发展。相关代码与评估工具已在Dynamic Story Graph项目中开源,为后续研究提供了可复现的实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务