遇见数据集

houyuhuifei/ekg-writer

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

EKG-Writer v1.0是一个基于事件知识图(EKG)的AI驱动中文小说生成数据集,专为研究结构化小说生成而设计。它使用5层EKG结构(从L0主题到L4节拍)作为故事蓝图,通过GPT-5管道生成章节级中文散文,并具备自动跨章节一致性跟踪功能。数据集还包括消融实验设计(A/B/C/D组)、post_review质量过滤器(用于检测和重写问题句子),以及跨章节状态机来跟踪事实、伏笔、角色状态等。源材料基于天下霸唱的《鬼吹灯》系列,生成非商业同人创作,涉及原创角色如胡八一、王胖子和明叔。数据集要求Python 3.10-3.12、OpenAI API密钥(支持GPT-5访问)和4GB以上RAM。

EKG-Writer v1.0 is an AI-powered Chinese novel generation dataset using Event Knowledge Graphs (EKG) for structured novel generation research. It employs a 5-layer EKG structure (from L0 theme to L4 beat) as a story blueprint, driving a GPT-5 pipeline to produce chapter-level Chinese prose with automatic cross-chapter consistency tracking. The dataset features an ablation experiment design (A/B/C/D groups), a post_review quality filter for detecting and rewriting problematic sentences (e.g., vague psychological placeholders, summary endings), and a cross-chapter state machine to track confirmed facts, unresolved foreshadowing, character status, props, and location. Based on the source material Ghost Blows Out the Light by Tianxia Bachangg, it generates non-commercial fan fiction with original characters like Hu Bayi, Wang Kaixuan, and Uncle Ming. Requirements include Python 3.10-3.12, an OpenAI API key with GPT-5 access, and 4 GB+ RAM.

提供机构:
houyuhuifei
搜集汇总
数据集介绍
houyuhuifei/ekg-writer 数据集图片
构建方式
EKG-Writer数据集以《鬼吹灯》为创作蓝本,采用五层事件知识图谱(EKG)作为故事蓝图。该图谱自上而下依次为主题层(L0)、故事弧层(L1)、章节层(L2)、场景层(L3)与节拍层(L4)。L0至L2由人类作者手动定义,确保核心叙事骨架的完整性;L3与L4则由GPT-5模型自动扩展生成。在此基础上,数据集引入跨章节状态机,实时追踪已确认事实、未解伏笔、角色状态、道具与地理位置,实现多章节间连贯性维护。此外,内置的post_review质量过滤器可自动检测并改写模糊心理描写、总结性结尾、视角越界及AI风格的修辞问句等瑕疵,确保输出文本的自然度与文学性。
特点
该数据集的核心特色在于其结构化的叙事生成范式与可复现的实验设计。五层EKG架构将创意写作从线性文本生成转化为层次化知识推理,使AI在保持主题一致性的同时具备局部情节的自发扩展能力。跨章节状态机机制有效解决了长文本生成中常见的逻辑断裂与伏笔遗失问题。数据集同时支持A/B/C/D四组消融实验,便于研究者系统比较不同配置下的生成质量差异。此外,其源代码基于MIT许可证开源,生成内容仅限非商业同人创作,为学术研究与个人实践提供了合法且灵活的试用场景。
使用方法
使用者需具备Python 3.10至3.12环境及4GB以上内存,并持有OpenAI GPT-5的API密钥。启动前需复制并配置.env文件中的API密钥,通过pip安装依赖。生成小说章节时,用户可调用novel_writer.py脚本,指定EKG节点文件与实验组别(如D组),即可输出连续的章节文本。项目内置了完整的脚本工具链,包括EKG节点树初始化、风格控制模块与导出接口(支持JSON、DOCX、XLSX格式),便于用户根据研究需求进行二次开发与定制化调整。
背景与挑战
背景概述
EKG-Writer数据集诞生于2025年,由研究团队基于天下霸唱所著《鬼吹灯》这一中国网络文学里程碑式作品构建,旨在探索事件知识图谱驱动的AI小说生成。该数据集以五层事件知识图谱为核心,将故事结构从主题至节拍逐级分解,为大规模长篇小说生成提供了结构化蓝图。研究针对当前大语言模型在长篇叙事中普遍存在的剧情断裂、伏笔遗失等核心问题,设计了一套包含跨章节状态机与质量过滤器的生成管线,并通过消融实验验证了知识图谱对叙事连贯性的提升效果。作为首个将事件知识图谱与GPT-5结合应用于中文同人小说生成的研究资源,EKG-Writer为自动化叙事与创意写作领域开辟了新的范式。
当前挑战
该数据集面临的领域挑战主要源于长篇小说生成的独特复杂性:模型需在数十万字篇幅中维持情节、角色状态与伏笔的跨章节一致性,而现有大语言模型在原生生成中常出现事实矛盾与逻辑断裂。EKG-Writer利用事件知识图谱作为骨架,将生成问题转化为图谱节点展开任务,从根本上约束生成轨迹。在构建过程中,挑战同样严峻:团队需手动为《鬼吹灯》宇宙定义L0至L2层抽象结构,涉及主题提炼与章回设计,而L3和L4层的自动扩展则依赖GPT-5对场景与节拍的精准把握;此外,post_review质量过滤器需识别并改写中式叙事中特有的模糊心理描写、总结式结尾及视角越界等问题,且当前仅支持中文输出,进一步增加了系统设计与评估的复杂性。
常用场景
经典使用场景
EKG-Writer数据集的核心应用场景在于基于事件知识图谱的结构化中文小说生成。研究者利用其五层知识图谱架构(从主题到节拍),将人类作者定义的高层故事框架(L0至L2)交由AI自动扩展为细粒度场景与情节节拍(L3至L4),从而实现对长篇小说跨章节一致性的精确控制。该数据集特别适用于依托经典文学作品(如《鬼吹灯》)进行同人创作和叙事生成研究,为探索人机协同的文学创作范式提供了标准化实验平台。
衍生相关工作
围绕EKG-Writer已衍生出一系列重要的研究方向。其五层事件知识图谱设计启发了后续的叙事结构自动解析工作,研究者尝试从非结构化文本逆向提取EKG层级以构建故事蓝图。基于跨章节状态机的一致性追踪机制被迁移至交互式叙事生成系统,支撑用户选择影响后续情节的动态分支故事。此外,post_review质量过滤器的六类问题检测标准已作为叙事生成评估的参考指标,催生了针对长文本生成中‘AI腔’定量识别与修复的专项研究工作,推动了文学AI从片段生成向完整故事创作的演进。
数据集最近研究
最新研究方向
基于事件知识图谱的结构化AI叙事生成与跨篇章一致性控制
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务