Aiwensile2/StorySeed
收藏资源简介:
StorySeed是一个专门设计用于训练和评估文本生成模型在儿童图画书创作领域性能的数据集。它包含4376个精心策划的提示-响应对,涵盖九大主题类别:教育、情商与社交技能、冒险故事、自然科学、民间故事与神话、日常生活、幽默故事、睡前故事以及其他不特定主题的图画书故事。每个数据对包括一个提示和一个响应,提示总结了一个独特的图画书故事创意,响应则是基于提示生成的完整图画书故事,严格遵循儿童图画书的标准格式,包括封面、内容页和封底。数据集的构建涉及两个模型,GPT-4-Plus和Claude-3-Opus,并根据使用的模型分为两个主要类别,分别命名为“Claude-3_gen-data”和“GPT-4_gen-data”。每个主要类别进一步细分为九个子类别,根据所涵盖的图画书故事主题定义。数据集的价值在于其规模、质量以及对儿童图画书多个主题领域的全面覆盖,从启蒙教育到情商发展,从激发想象力到塑造价值观,StorySeed为研究人员和从业者提供了丰富的材料,以探索AI在儿童文学创作中的巨大潜力。
StorySeed是一个专门设计用于训练和评估文本生成模型在儿童图画书创作领域性能的数据集。它包含4376个精心策划的提示-响应对,涵盖九大主题类别:教育、情商与社交技能、冒险故事、自然科学、民间故事与神话、日常生活、幽默故事、睡前故事以及其他不特定主题的图画书故事。每个数据对包括一个提示和一个响应,提示总结了一个独特的图画书故事创意,响应则是基于提示生成的完整图画书故事,严格遵循儿童图画书的标准格式,包括封面、内容页和封底。数据集的构建涉及两个模型,GPT-4-Plus和Claude-3-Opus,并根据使用的模型分为两个主要类别,分别命名为“Claude-3_gen-data”和“GPT-4_gen-data”。每个主要类别进一步细分为九个子类别,根据所涵盖的图画书故事主题定义。数据集的价值在于其规模、质量以及对儿童图画书多个主题领域的全面覆盖,从启蒙教育到情商发展,从激发想象力到塑造价值观,StorySeed为研究人员和从业者提供了丰富的材料,以探索AI在儿童文学创作中的巨大潜力。
数据集概述
数据集名称
StorySeed
许可
cc-by-nd-4.0
任务类别
- 文本生成
标签
- 艺术
数据规模
- 1K<n<10K
语言
- 英语
数据集描述
StorySeed 是一个专门为训练和评估儿童图画书创作领域中文本生成模型性能而设计的数据集。它包含 4376 个精心挑选的提示-响应对,涵盖九大主题类别:教育、情感智能和社会技能、冒险故事、自然科学、民间传说和神话、日常生活、幽默故事、睡前故事以及其他非特定主题的图画书故事。
每个数据对包括两个元素:提示和响应。提示以简洁创意的句子概括一个独特的图画书故事想法,设定输出格式标准。响应是基于相应提示生成的完整图画书故事,严格遵循儿童图画书的标准格式,包括封面、内容页和封底。封面和封底仅以文本形式描述插图的图像,而内容页的每一页包括两个方面:引人入胜的故事文本和与情节相对应的插图描述。部分响应还包括一个简短的总结,以进一步强调故事的主题或寓意。
数据集的构建涉及两个模型,GPT-4-Plus 和 Claude-3-Opus,并根据使用的模型分为两大类,分别命名为 "Claude-3_gen-data" 和 "GPT-4_gen-data"。每个主要类别进一步细分为九个子类别,根据涵盖的图画书故事主题定义。
数据集的价值不仅在于其规模和质量,还在于其全面覆盖了儿童图画书的多个主题领域。从启蒙教育到情感智能发展,从激发想象力到塑造价值观,StorySeed 提供了丰富的语料库,帮助研究人员和从业者探索人工智能在儿童文学创作中的巨大潜力。无论是开发自动图画书创作工具还是研究计算机如何讲述引人入胜的故事,StorySeed 数据集都是一个关键资源。




