遇见数据集

stories

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

stories数据集是一个包含1,712个英文故事的系统生成集合,专为微调较小的自回归语言模型而设计,特别适用于连贯故事写作类任务,建议与其他数据结合使用以增强效果。其主要动机是作为后续处理(例如,将句子翻译成德语、乌尔都语等其他语言)的基础语料,从而辅助训练专注于翻译任务的小型语言模型。数据由六个不同的对话/指令微调自回归语言模型生成,包括:meta-llama/Llama-3.1-8B-Instruct、meta-llama/Llama-3.3-70B-Instruct、google/gemma-4-31B-it、openai/gpt-oss-120b、zai-org/GLM-4.7和Qwen/Qwen3.5-27B。生成过程通过脚本系统性地覆盖了九种故事叙述组合,涉及三种时态组(过去时、现在时、现在+将来时)和三种叙述视角(第一人称“I”、第三人称单数“He/She”、第三人称复数“They”)。数据规模的控制通过统计句子终结符(., !, ?)来近似估算每个组合的句子总量。生成后对数据进行了清理:移除了模型原生推理功能可能产生的推理内容以保持简洁,并将一些过度拟合的UTF标点符号(如弯引号“”和特定连字符‐)替换为标准ASCII字符(直引号"和减号-)。生成工作由Cerebras Systems Inc.和Groq提供的免费、高效推理服务支持,耗时约一周完成,且模型未进行量化处理。数据集采用Apache License, Version 2.0许可发布,并可通过提供的Python脚本示例便捷访问。

The stories dataset is a systematically generated collection of 1,712 English stories, designed to provide resources for fine-tuning smaller autoregressive language models, particularly suitable for coherent story writing tasks, and it is recommended to be used in combination with other data for enhanced effectiveness. Its primary motivation is to serve as a foundational corpus for subsequent processing (e.g., translating sentences into other languages such as German, Urdu), thereby assisting in training small language models focused on translation tasks. The data is generated by six different conversational/instruction-tuned autoregressive language models, including: meta-llama/Llama-3.1-8B-Instruct, meta-llama/Llama-3.3-70B-Instruct, google/gemma-4-31B-it, openai/gpt-oss-120b, zai-org/GLM-4.7, and Qwen/Qwen3.5-27B. The generation process systematically covers nine story narrative combinations through scripts, involving three tense groups (past, present, present+future) and three narrative perspectives (first-person I, third-person singular He/She, third-person plural They). Data scale control is not directly based on story count but approximated by counting sentence terminators (., !, ?) to estimate the total number of sentences per combination. After generation, the data was cleaned: removing reasoning content that may arise from the models native inference capabilities to maintain conciseness, and replacing some overfitted UTF punctuation marks (such as curly quotes “ ” and specific hyphens ‐) with standard ASCII characters (straight quotes " and hyphens -). The generation work was supported by free and efficient inference services provided by Cerebras Systems Inc. and Groq, taking about a week to complete, and the models were not quantized. The dataset is released under the Apache License, Version 2.0, and can be conveniently accessed via provided Python script examples.

创建时间:
2026-07-14
原始信息汇总

数据集概述

数据集名称:stories

许可协议:Apache-2.0

任务类别:文本生成(text-generation)

语言:英语(en)

标签:合成数据(synthetic)、故事(story)、文本(text)

数据规模:1,000 至 10,000 条样本(实际包含 1,712 条故事)

数据集描述

该数据集包含 1,712 条系统生成的故事,由多种自回归语言模型生成,所有故事均使用英语表达。数据集采用 Apache License 2.0 许可发布,推荐用于微调较小的自回归语言模型,特别是在连贯故事写作等任务上,若结合更多数据效果更佳。生成该数据集的目的还在于进一步处理,将所有句子翻译成其他语言(如德语)和低资源语言(如乌尔都语)。

下载与使用

可通过编程语言(如 Python 及其 requests 库)轻松下载数据并选取特定样本。以下是一个最小示例:

python from requests import get

data: list[str] = get("https://huggingface.co/datasets/hamzah0asadullah/stories/raw/main/data.json").json()

len(data) -> 1712

print(data[int(1712 / 2)])

生成方式

使用六种不同的对话模型生成文本,生成脚本由 Python 编写。脚本遍历了三种时间时态(过去、现在、现在+未来)和三种故事叙事人称(我、他/她、他们(指一群人))的所有九种组合。对于每种组合,脚本通过统计字符 .!? 的数量来近似估算所有故事包含的句子总数。

使用的生成模型

生成细节

  • 当模型原生支持推理时,该功能被启用,但推理内容被剥离以保持数据简洁。
  • 某些模型上过拟合的 UTF 字符被替换为正常的 ASCII 对应字符,例如将 替换为 ",将连字符()替换为简单减号(-)。
  • 模型未进行量化处理,提供推理服务的机构为 Cerebras Systems Inc.Groq,这使得数据集能够在约一周内免费快速生成。
搜集汇总
数据集介绍
stories 数据集图片
构建方式
该数据集名为stories,由1712条系统生成的故事构成,所有故事均以英文书写。构建过程依托六种不同的自回归语言模型,包括Meta的Llama系列、Google的Gemma、OpenAI的GPT-OSS、智谱的GLM以及阿里通义千问的Qwen系列。生成脚本采用Python编写,系统遍历了三种时态(过去、现在、现在与未来)与三种叙事人称(第一人称‘我’、第三人称‘他/她’、复数‘他们’)的九种组合。对于每种组合,脚本通过统计句子结束字符来估算故事数量,而非直接计数。推理功能在模型原生支持时被启用,但推理内容被剥离以保持数据简洁。此外,部分模型过拟合的UTF字符被替换为标准的ASCII对应字符,并消除了生成过程中的财务成本与量化影响。
特点
该数据集的核心特点在于其结构化的构建理念与潜在的跨语言应用价值。故事生成覆盖了多种时态与叙事视角的组合,为研究叙事结构提供了丰富的语料基础。数据集规模适中,共计1712条样本,采用Apache 2.0许可协议发布,特别推荐与更多数据联合使用,用于微调较小规模的自回归语言模型,尤其是在连贯故事写作任务上。尤为独特的是,该数据集的设计初衷并非止步于英语文本,而是计划通过将全部句子翻译为德语、乌尔都语等低资源语言,进一步拓展其应用场景,为小规模翻译模型的微调提供有力支持。
使用方法
使用该数据集时,可借助Python与requests库轻松实现下载与样本选取。通过访问数据集原始JSON文件链接,直接获取全部1712条故事文本列表,并可通过索引灵活访问特定样本。推荐将该数据集用于微调自回归语言模型,尤其是面向连贯故事生成或叙事结构学习的场景。若需进行跨语言处理,可对数据集中的英文句子进行批量翻译,以构建多语言训练语料。数据集的JSON格式简洁明了,便于与各类深度学习框架集成,适用于学术研究或工业应用中的文本生成任务探索。
背景与挑战
背景概述
在自然语言处理领域,文本生成任务尤其是连贯故事写作,长期以来依赖于大规模预训练语言模型,但针对较小模型在特定语言和文化背景下的微调需求日益凸显。stories数据集由研究者在2025年间利用Cerebras Systems Inc.和Groq等机构提供的计算资源,通过六种不同的自回归语言模型系统生成,共包含1,712个英文故事。该数据集由个人研究者hamzah0asadullah创建,核心研究问题在于探索合成数据对小型语言模型在故事连贯性写作任务上的微调效果,并计划进一步将其翻译为德语及如乌尔都语等低资源语言,以推动多语言机器翻译研究。该数据集以Apache-2.0许可发布,为小型语言模型的领域适应和低资源语言处理提供了宝贵的训练资源。
当前挑战
该数据集面临的挑战包括:首先,解决的是小型自回归语言模型在连贯故事写作任务中数据匮乏的领域问题,由于高质量、多样化的故事语料稀缺,模型难以生成逻辑清晰且风格多变的叙事文本。其次,构建过程中的挑战体现在:利用六种不同模型生成故事时,需平衡生成质量与效率,并在混合时间时态(过去、现在、现在+未来)与三种叙事人称(第一人称、第三人称单数、第三人称复数)的九种组合下稳定生成;同时,需处理模型原生支持的推理内容以保持数据简洁,并替换过拟合的UTF字符为标准ASCII字符,确保数据一致性与可用性。
常用场景
经典使用场景
在自然语言处理与文本生成领域中,stories数据集常被用于微调自回归语言模型,以提升其在连贯叙事生成任务上的表现。该数据集包含1,712条由多种先进语言模型系统生成的故事,覆盖过去、现在及现在将来三种时态,并采用第一人称、第二人称复数及第三人称等多种叙事视角,结构丰富多样。研究者通常将其作为补充训练数据,结合其他语料库,以增强小规模模型在故事生成、情节规划与情感表达等复杂语言任务中的泛化能力,尤其适用于资源受限场景下的文本创造研究。
衍生相关工作
stories数据集的衍生工作主要体现在跨语言语料扩展与低资源翻译模型优化方面。研究者基于该数据集的英语故事部分,通过机器翻译生成了德语、乌尔都语等多语言版本,进而微调小规模序列到序列模型,探索跨语言故事生成与译后编辑的可行性。此外,数据集中不同时态与视角的系统化组合,催生了针对叙事结构可控生成的研究,如基于条件变分自编码器的故事规划模型,以及融合情感一致性的情节生成框架,这些工作进一步验证了高质量合成语料在推动文本生成技术发展中的核心价值。
数据集最近研究
最新研究方向
在自然语言生成领域,Stories数据集的问世为小规模自回归语言模型的微调开辟了新颖路径,尤其聚焦于连贯故事生成的跨语言迁移任务。当前前沿研究将关注点置于利用LLaMA、Gemma及Qwen等六大先进对话模型合成的高质量英语故事语料,结合其精细的时态与叙事视角控制机制,探索在低资源语言(如乌尔都语)翻译场景中的应用潜力。该数据集的意义在于通过系统化合成策略,打破对昂贵人工标注的依赖,为多语言故事生成与机器翻译的融合研究提供可复现的基准,尤其推动了非英语小模型在语义连贯性与文化适应性上的突破。这一方向有望加速边缘场景下语言技术的民主化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务