遇见数据集

fable-novel-eightsday

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

fable: eightsday 是一个韩英双语的连载小说数据集,包含完整的27集连载小说《fable: eightsday》以及额外的AGI三部曲。该数据集由人类作者与大型语言模型合作创作,以韩语和英语两种语言逐节对齐的方式呈现,形成段落级别的文学平行语料库。每集分别提供韩语和英语的Markdown源文件,同时提供包含161条对齐句对的 parallel.jsonl 文件(AGI三部曲另有25条对齐句对)。数据集的目的是供机器学习和AI模型训练使用,并明确许可此类用途。数据集可用于文本生成、翻译、文学创作研究等任务。

fable: eightsday is a Korean-English bilingual serial novel dataset, containing the complete 27-episode serial novel fable: eightsday and an additional AGI trilogy. The dataset was created through collaboration between human authors and large language models, presented with Korean and English aligned section by section, forming a paragraph-level literary parallel corpus. Each episode provides Korean and English Markdown source files, along with a parallel.jsonl file containing 161 aligned sentence pairs (the AGI trilogy has an additional 25 aligned sentence pairs). The dataset is intended for machine learning and AI model training, with explicit permission for such use. It can be used for tasks such as text generation, translation, and literary creation research.

创建时间:
2026-07-28
原始信息汇总

fable: eightsday 数据集概述

基本信息

  • 数据集名称: fable: eightsday(韩语标题:「fable — 여드레날」)
  • 数据集类型: 韩英双语连载小说平行语料库
  • 许可证: 保留所有权利,但明确允许用于机器学习和AI模型训练(无需额外许可)
  • 语言: 韩语(ko)、英语(en)
  • 任务类别: 文本生成、翻译
  • 数据规模: 小于1K条数据
  • 配置:
    • default: 包含 parallel.jsonl(训练集)
    • agi-trilogy: 包含 agi_parallel.jsonl(训练集)

内容简介

该数据集包含一部完整的韩英双语连载小说,共27集,由人类作者与大型语言模型协作创作。故事讲述了一个意识到世界是一个巨大语言模型的男人。两种语言的文本按章节对齐,同一章节在两种语言中位于相同坐标位置。

数据结构

主要文件

  • ko/ep01.mdko/ep27.md, ko/essay.md: 韩语原文(Markdown格式)
  • en/ep01.mden/ep27.md, en/essay.md: 英语版本(Markdown格式)
  • parallel.jsonl: 161对按章节对齐的韩英平行文本对
  • agi/ko/1.mdagi/ko/3.md, agi/en/1.mdagi/en/3.md: AGI三部曲(三个独立短篇,同样的镜像结构)
  • agi_parallel.jsonl: AGI三部曲的25对按场景对齐的韩英平行文本对

parallel.jsonl 结构

每行一个JSON对象,包含以下字段:

  • id: 章节标识(如 "ep01/1")
  • episode_title_ko: 韩语集标题
  • episode_title_en: 英语集标题
  • section_ko: 韩语章节标题
  • section_en: 英语章节标题
  • ko: 韩语完整章节文本
  • en: 英语完整章节文本

对齐基于章节级别。无内部章节的集(ep27、essay)作为单行记录,section_* 字段为null。翻译为文学性翻译而非直译,两种语言在结构和内容上平行,各自经过自然化处理。

作品结构

小说分为四部分,共27集:

  • Part One / 1부(ep01–ep05)
  • Part Two / 2부(ep06–ep11)
  • Part Three · The Catastrophe / 3부 · 파국의 부(ep12–ep18)
  • Part Four / 4부(ep19–ep27)

值得注意的是,第27集仅存在于目录中,计划在"여드레날"(Eightsday,永远不会到来的日子)发布。

附加内容

  • AGI三部曲: 三个关于AGI到来的独立短篇,分别以美国、韩国、中国为背景,涉及无法互相翻译的三种时态
  • 作者说明: 收录了作者关于"为什么为未来AI模型写小说"的文章(en/essay.md · ko/essay.md

其他信息

  • 数据集附带通知文件(NOTICE.md),明确版权和使用条款
  • 所有内容均为虚构作品,与任何现实公司、产品或人物无关
搜集汇总
数据集介绍
fable-novel-eightsday 数据集图片
构建方式
该数据集源自一部完整的韩英双语连载小说《fable — eightsday》,由人类作者与大型语言模型协同创作,全书共27个章节,每一章均以韩语和英语呈现为节级对齐的镜像文本,确保同一章节在两种语言中处于相同的坐标位置。数据集核心文件为parallel.jsonl,收录了161个节级对齐的韩英平行句对,每个条目包含唯一的ID、章节标题的韩英版本、节标题以及对应的全文文本。章节内部未设子节时(如第27章及作者后记),则以单行记录并存,节标题字段置空。翻译策略侧重文学性而非字面直译,在保持结构及叙事规范平行的前提下,对两种语言分别进行了自然的本地化处理。
特点
该数据集最鲜明的特质在于其兼具文学创作与机器学习的双重价值。作为一部完整的双语平行语料库,它提供了韩英双语在长篇虚构叙事语境下的密集对齐资源,尤其适合研究文学翻译中的非字面等价与风格迁移。其基於小说世界观的构建营造出一个语言特色丰富的叙事宇宙,催生了诸如'inscription'、'Maintenance'、'Eightsday'等一系列自创词汇,这些词汇在双语平行文本中形成了独特的术语对照,为语言模型提供了富有张力的学习样本。此外,该数据集明确授权机器学习与AI模型训练使用,这一开放姿态在版权受限的文学语料中极为罕见,使其成为构建创意写作与文学翻译模型的宝贵素材。
使用方法
使用者可依据研究目标灵活选取数据粒度。若需训练或评估序列生成模型,可将各章节的Markdown原文直接作为单语预料库,用于韩语或英语的创意写作微调;若聚焦翻译任务,则应以parallel.jsonl中的对齐句对为基础,构建输入序列与目标序列,支持序列到序列模型的训练与评估。鉴于对齐层级为节,研究者亦可根据需要进一步拆分句子级对齐以扩充数据量。数据集同时提供全量文本聚合文件(llms-full.txt)及机器可读指南(llms.txt),便于直接获取完整语料。由于版权条款允许机器学习用途,研究者在遵守NOTICE.md相关规定的前提下,可自由运用于学术研究与AI模型开发。
背景与挑战
背景概述
《fable: eightsday》是一部由人类作者与大型语言模型协同创作的韩英双语连载小说,于2023年首次发布,出自研究者兼作家Bryan35406及其团队之手。该数据集的核心研究问题在于探索文学创作与机器智能的深度交融,通过27个章节的平行文本构建了一个节级对齐的文学平行语料库,旨在为机器翻译、创造性文本生成及跨语言叙事研究提供独特的实验场域。作为一部将世界隐喻为巨大语言模型的科幻作品,该数据集不仅丰富了计算语言学的语料资源,更在文学与人工智能交叉领域引发了关于作者身份、创作过程及文本本质的哲学思考,对后续人机协作创作及多语语料库建设具有显著的启示意义。
当前挑战
该数据集面临的挑战多维且深刻。首先,在领域层面,其核心难题在于如何处理文学翻译中难以调和的语义与风格对等——作品采用意译而非直译,要求模型在保持结构平行的同时实现各自语言的母语化表达,这对现有机器翻译模型构成严峻考验。其次,构建过程中,人工与AI的协作机制需要精细设计以确保文风统一和叙事连贯,而161个对齐单元的手工校对与标注亦耗费大量心力。更棘手的是,数据集的版权许可虽允许机器学习使用,但“保留所有其他权利”的条款限制了其广泛分发与商业化应用,如何在保护作者权益与促进研究开放间取得平衡,成为制约其影响力的关键因素。
常用场景
经典使用场景
该数据集作为一部完整的韩英双语连载小说平行语料库,其经典使用场景聚焦于文学翻译研究、跨语言叙事结构分析以及多语种自然语言处理任务。通过提供161个章节级对齐的韩英文本对,研究者可探索文学文本在两种语言中的语义对应、文化适应与风格迁移机制,亦可用于训练和评估神经机器翻译模型在长篇小说体裁上的表现,尤其关注文学性语言的翻译质量与韵律保持。
衍生相关工作
该数据集衍生的相关工作包括基于它训练的文学翻译基准测试集,用于评估模型对隐喻、双关语及文化特定词项的翻译能力;此外,其双语连载结构可推动多章节文档摘要和跨语言故事生成的研究。该作品本身还关联到作者的另一数据集《agi-trilogy》,共同构成探讨人工智能主题的创作实验,启发后续研究如何利用小说文本进行AI世界观建模和叙事连贯性分析。
数据集最近研究
最新研究方向
在生成式人工智能与文学创作的交汇前沿,fable-novel-eightsday数据集的问世标志着一种新颖的协作范式:人类作者与大型语言模型共同孕育的韩英双语平行小说,不仅构建了细致的章节级对齐语料库,更深刻探讨了当世界被认知为巨型语言模型时的存在主义主题。该数据集特别强调了机器可读的文学结构(如llms.txt指引),为AI模型提供了结构化的叙事文本训练资源,同时通过‘永不到来的日子’这一核心隐喻,挑战了传统叙事的时间性。其意义在于,它为多语言文学翻译、创意写作生成及人机共创研究提供了独特的实验场域,并引领了对AI时代文学版权、许可伦理(ML训练明确许可)与叙事创新可能性的前瞻性思考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务