遇见数据集

guodaosun/tale-frame

收藏
Hugging Face2024-12-05 更新2024-12-14 收录
官方服务:

资源简介:

TinyStories数据集基于TinyStories,包含结构化的JSON数据和相应的注释,用于可控故事生成和相关任务的研究。每个数据项包含`conversations`、`chosen`和`rejected`三个字段,分别表示故事的JSON数据、最终选择的故事和被拒绝的故事版本。`value`字段包含实体、事件、故事结构和关系的详细描述。数据集还提供了实体、事件、关系和故事的统计特征,以及基于GPT-4模型的注释。

The TinyStories dataset is based on TinyStories and includes structured JSON data with corresponding annotations, designed for research in controllable story generation and related tasks. Each data item contains the `conversations`, `chosen`, and `rejected` fields, representing the JSON data of the story, the final selected story, and the rejected version of the story, respectively. The `value` field contains detailed descriptions of entities, events, story structures, and relationships. The dataset also provides statistical features of entities, events, relationships, and stories, as well as annotations based on GPT-4 models.

提供机构:
guodaosun
搜集汇总
数据集介绍
guodaosun/tale-frame 数据集图片
构建方式
在可控故事生成研究领域,高质量的结构化数据集是推动模型发展的基石。TaleFrame数据集基于TinyStories构建,通过精细的JSON格式对故事进行多层次结构化标注。每条数据包含三个核心部分:conversations字段存储了以实体、事件、关系和故事结构为维度的结构化描述,其中实体涵盖唯一标识、名称、身份、动机及人格特质,事件记录时间、地点、详情、重要性及因果链,关系则定义情感类型、行为方向与演化过程;chosen与rejected字段分别收录经GPT-4等模型评估后的优质与低质故事文本,形成成对偏好数据,为对比学习提供天然标注。
特点
该数据集在设计上展现出鲜明的结构化与多维性特征。其统计规模涵盖9,851个故事、24,154个实体、68,553个事件及69,481个关系,构成了丰富的叙事网络。情感分布呈现积极倾向,故事中积极情感占比高达72%,事件与关系亦以积极类型为主导,反映了数据集在情感平衡上的精心筛选。尤为突出的是,故事结构被明确划分为开始、发展、高潮与结尾四阶段,每个阶段均关联具体事件ID,为细粒度的叙事结构分析提供了可操作的标注。实体人格特质的正负中性分布与关系强度等级的量化,进一步增强了数据集在可控生成中的表现力与可解释性。
使用方法
TaleFrame数据集可直接用于可控故事生成模型的训练与评估。研究者可加载JSON格式数据,利用conversations字段中的结构化信息作为条件输入,引导模型生成符合指定实体属性、事件序列与关系演变的叙事内容。chosen与rejected的成对数据适用于偏好学习或强化学习微调,通过对比优化提升故事质量。此外,数据集支持多层级任务,如基于情感标签的情感控制生成、基于事件因果链的剧情规划,以及基于关系演化的人物互动建模。建议结合HuggingFace的datasets库加载数据,并按需拆分训练集与验证集,以适配不同模型架构与实验目标。
背景与挑战
背景概述
在自然语言生成领域,可控故事生成是一项极具挑战性的任务,其核心在于如何让模型在遵循特定叙事结构与语义约束的同时,产出连贯且富有创意的文本。guodaosun/tale-frame数据集应运而生,它由研究团队基于TinyStories语料库构建,通过精细的JSON结构化标注,将实体、事件、关系及故事框架等要素纳入统一的表示体系。该数据集于近年发布,旨在为可控文本生成、叙事理解及故事质量评估提供标准化的研究基准。其影响力体现在为模型提供了从底层事件因果链到高层情感演变的完整建模视角,推动了叙事生成从自由创作向结构可控的范式转变。
当前挑战
当前数据集面临多重挑战。首先,在领域问题层面,如何利用结构化标注实现细粒度的故事控制仍是核心难点,模型需同时兼顾事件时序逻辑、角色动机一致性及情感动态演变,这对现有生成架构的语义理解与规划能力提出了严峻考验。其次,在构建过程中,数据标注的可靠性至关重要,虽采用GPT-4进行质量筛选与偏好排序,但自动评估与人工判断之间仍存在偏差,可能导致“chosen”与“rejected”标签的噪声问题。此外,数据集规模有限(约9,851个故事),可能限制模型对复杂叙事模式的泛化能力,而情感分布的不均衡(正向样本占比过高)亦增加了训练偏差的风险。
常用场景
经典使用场景
TaleFrame数据集在可控故事生成领域占据着独特的地位,它基于TinyStories构建,为每则故事提供了精细的结构化标注,涵盖实体、事件、关系及故事框架(开端、发展、高潮、结局)。研究者可利用这些标注信息,实现从高层语义规划到文本生成的端到端建模,经典应用包括基于事件序列的故事生成、依据角色动机与性格的情节推演,以及遵循故事结构约束的叙事创作。该数据集通过提供明确的结构化指导,使得生成的故事在逻辑连贯性与叙事完整性上显著优于纯文本模型。
衍生相关工作
基于TaleFrame数据集,学术界已衍生出一系列经典工作。研究者利用其结构化标注探索了基于事件图的规划式故事生成方法,提出了融合实体关系图谱与Transformer架构的混合模型。另有工作聚焦于故事情感弧线的可控生成,通过分析数据集中情感分布与情节结构的关系,设计了情感感知的生成框架。此外,该数据集还催生了关于故事质量自动评估的研究,利用其提供的Chosen/Rejected标注训练了能够区分叙事优劣的判别模型,为后续的故事生成评价体系奠定了基础。
数据集最近研究
最新研究方向
TaleFrame数据集聚焦于可控故事生成的前沿探索,通过结构化的事件、实体与关系标注,为叙事智能研究提供了精细化的实验平台。该数据集基于TinyStories扩展,引入了实体动机、事件因果链及关系演化等维度,显著区别于传统仅依赖文本序列的生成范式。近期研究利用其多层级标注,结合偏好学习(如chosen/rejected对比)优化故事质量,推动模型在情节连贯性与情感一致性上的突破。这一方向与自然语言处理中可解释叙事生成的热点紧密相关,尤其在儿童教育、交互式故事创作等领域具有应用潜力。TaleFrame通过量化故事结构(如开端、高潮、结局)与情感分布,为评估生成文本的叙事合理性提供了新基准,其影响力体现在促进生成式AI从单轮输出向可控、可评价的叙事系统演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务