dsg-state-continuation
收藏资源简介:
DSG State-Continuation 是一个用于图条件长篇小说生成的数据集,旨在训练模型在给定前序章节的叙事状态和当前章节的一句话简介后,生成该章节的文本。数据集基于 215 部来自 Project Gutenberg 的英文公版小说(主要是 19 至 20 世纪作品),按章节分割,共包含 6,876 个样本。每个样本包含:小说标识、标题、作者、章节编号、前序章节的图状态(作为有界事实摘要,因果性地构建并维护,区分 ELABORATE、SUPERSEDE、REVISE 三种操作)、当前章节的一句话简介、参考章节文本(平均约 4,100 字符)及其长度。约 3.2% 的样本(第一章)状态为空。该数据集专门用于微调语言模型,使其能够利用并维护叙事状态,而非仅在上下文中包含状态。其局限在于:仅涵盖英语公共领域小说,风格受限于特定时代;状态由模型提取且未经过人工标注,可能存在噪声;章节分割基于启发式规则;训练时需按书划分,避免跨章节信息泄露。
DSG State-Continuation is a dataset for graph-conditioned long-form novel generation, designed to train models to generate the text of a chapter given the narrative state of previous chapters and a one-sentence summary of the current chapter. The dataset is based on 215 English public domain novels from Project Gutenberg (mainly works from the 19th and 20th centuries), segmented by chapter, containing a total of 6,876 samples. Each sample includes: novel identifier, title, author, chapter number, the graph state of previous chapters (as a bounded factual summary, causally constructed and maintained, distinguishing three operations: ELABORATE, SUPERSEDE, REVISE), a one-sentence summary of the current chapter, the reference chapter text (average ~4,100 characters), and its length. Approximately 3.2% of samples (first chapters) have an empty state. This dataset is specifically used for fine-tuning language models to utilize and maintain narrative states, rather than merely including states in the context. Its limitations include: covering only English public domain novels, with styles restricted to a specific era; states are extracted by a model without human annotation, potentially introducing noise; chapter segmentation is based on heuristic rules; training requires splitting by book to avoid cross-chapter information leakage.
数据集概述:DSG State-Continuation
DSG State-Continuation 是一个用于图条件长篇虚构小说生成任务的训练数据集。其核心任务是:给定读者在阅读第1至t-1章后所持有的叙事状态,以及第t章的一句话简介,模型需要生成第t章的完整文本。该数据集旨在训练模型利用并维护叙事状态,而非仅仅在上下文中存储信息。
数据规模与来源
- 数据量:包含 6,876 个示例。
- 基础语料:来自 215 部公有领域英文小说(来源于 Project Gutenberg),并按章节进行切分。
- 语言:英文。
- 文本长度:每章目标文本的平均长度约为 4,100 个字符。
数据构建核心:因果状态机制
该数据集的核心创新在于其叙事状态的构建方式,该状态并非简单的摘要或检索索引,而是一个因果构建、修订感知的断言存储库:
- 因果性:在生成第t章时,状态仅包含读者从第1至t-1章所能获知的信息。
- 更新演算:通过显式的演算规则维护状态,并区分三种操作,以处理不同性质的文本更新:
| 操作 | 使用场景 | 效果 |
|---|---|---|
ELABORATE |
后续文本对先前模糊之处进行细化说明 | 原地精炼,不撤回任何信息 |
SUPERSEDE |
故事世界本身发生变化(如新事件发生) | 关闭旧信息的有效区间,但保留其作为历史记录 |
REVISE |
读者先前理解有误(事实从未成立) | 撤回该信息及其所有派生信息 |
这种对 SUPERSEDE 与 REVISE 的区分,在操作层面体现了叙事学中“故事事件”与“讲述披露”的差异。该判定基于一个可检查的词表(如谓词可变性、证据来源、揭示标记),不使用语言模型进行决策。
质量验证:在一项对28部小说的注释测试中,通过该演算机制构建的状态存储,其自我矛盾率为 0.0% ,而传统追加式存储的矛盾率为 37–42%(该结果在1.5B、3B、7B等不同模型规模下均保持稳定)。
数据字段
数据集包含以下字段:
| 字段 | 描述 |
|---|---|
book_id, title, author |
来源(古腾堡计划)信息 |
chapter |
章节编号(从1开始) |
state |
第1至t-1章后的图状叙事状态摘要 |
beat |
第t章的一句话内容简介 |
target |
第t章的真实文本 |
target_chars |
目标文本的字符长度 |
特别说明:所有行中,有 3.2% 的样本其状态为空,这些样本对应的是每本小说的第一章(即冷启动情况)。
预期用途与局限性
- 预期用途:微调写作模型,使其能够**“使用”**持续更新的叙事状态,而非仅仅在上下文中拥有该状态。其核心优势在于扩展性——状态摘要的大小不会随故事增长而膨胀,而完整的对话记录则会。
- 主要局限性:
- 语料风格:基于英文公有领域小说构建,主要为19世纪至20世纪初的作品,因此其散文风格和人名命名规范具有明显的时代特征。
- 状态质量:叙事状态为自动提取(由 Qwen2.5-7B-Instruct 生成)并经符号化协调,并非人工标注。因此可能含有提取噪声,包括虚构的谓词或偶发的错误属性指认。
- 章节切分:章节分割采用启发式规则(主要依据标题,并设有段落块回退方案),无法保证绝对精确。
- 数据划分建议:训练集划分应按书进行,而非按行进行。因为来自同一部小说的不同章节共享叙事状态,若随机划分会导致数据泄漏,影响评估的公平性。
许可与标签
- 许可协议:cc0-1.0(公共领域贡献)。
- 任务类别:文本生成。
- 数据集标签:叙事、长文生成、知识图谱、故事生成。





