遇见数据集

minicpm5-sft3-3turn

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集名为 minicpm5-sft3-3turn,是用于英文小说三回合故事写作任务的训练与验证数据。它属于 baiango/minicpm5-ul4b-story 模型的 sft3 微调阶段,所有故事文本均通过从更强的教师大语言模型进行知识蒸馏生成。数据集共有两个配置:data3 包含1637条训练样本和40条验证样本,总故事字数约300万词(字数范围1503-2099,中位数1781),每条记录包括一个模板化的写作指令,以及三段连续的故事段落(pieces),并附带每轮计划的词数(turn_words)和记录的总词数(words);data3r_mix 包含258条训练样本和40条验证样本(验证集与data3相同),是RAFT实验的混合数据,包含54条来自拒绝采样的三段式故事以及150条来自DAgger流程的原始数据,额外有奖励分数(R)和层级(tier)。指令模板基于一个参数网格:34种体裁 × 第一/二/三人称 × 过去/现在时 × 两个风味标签,并使用6种不同的措辞变体呈现。数据完全合成,无人工筛选,适合用于训练故事写作模型;但需注意POV(视角)遵循不完美,且data3中记录的总词数与实际段落词数略有偏差(最大约280词)。数据集以CC0 1.0许可发布。

The dataset is named minicpm5-sft3-3turn, designed for three-turn story writing tasks in English fiction. It belongs to the sft3 fine-tuning stage of the baiango/minicpm5-ul4b-story model, with all story texts generated via knowledge distillation from stronger teacher LLMs. It has two configurations: data3 contains 1,637 training samples and 40 validation samples, with a total story word count of approximately 3 million words (word count range 1503-2099, median 1781). Each record includes a templated writing instruction and three consecutive story pieces, along with planned word counts per turn (turn_words) and total word count (words). data3r_mix contains 258 training samples and 40 validation samples (same validation set as data3), which is a mixed dataset for RAFT experiments, including 54 triple-story pieces from rejection sampling and 150 original data from the DAgger pipeline, with additional reward scores (R) and tiers (tier). The instruction template is based on a parameter grid: 34 genres × first/second/third person × past/present tense × two flavor tags, and presented in 6 different wording variants. The data is fully synthetic without human filtering, suitable for training story writing models; but note that POV (point-of-view) adherence is imperfect, and the recorded total word counts in data3 deviate slightly from actual paragraph word counts (up to ~280 words). The dataset is released under CC0 1.0 license.

创建时间:
2026-09-30
原始信息汇总

minicpm5-sft3-3turn 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/baiango/minicpm5-sft3-3turn
  • 别名:MiniCPM5 SFT3 3-Turn Story Writing Data
  • 许可证:CC0 1.0(公有领域奉献)
  • 任务类别:文本生成(text-generation)
  • 语言:英语(en)
  • 规模类别:小型(small)
  • 标签:creative-writing、fiction、story-writing、synthetic、distillation

数据集用途

该数据集是 baiango/minicpm5-ul4b-story 模型背后 3 轮写作阶梯(stage sft3 diet)的训练/验证数据。每条记录包含一个模板化的写作指令,以及由更强的教师 LLM 蒸馏生成的三段式故事(英语虚构作品)。

配置与数据划分

  • 配置名:data3
  • 训练集:train_3turn.jsonl,1637 条记录
  • 验证集:valid_3turn.jsonl,40 条记录
  • 所有划分共享统一的 schema

数据规模统计

  • 总故事词数(data3):约 3.0M
  • 训练集(data3):
    • 行数:1637
    • 词数:最小值 1503 / 中位数 1781 / 最大值 2099
    • 总词数:2,934,795
    • 每轮中位词数(实际):534
  • 验证集:40 条记录(1581–2003 词)

Prompt 模板

指令共享一个轴网格 —— 34 种体裁 × 第一/第二/第三人称 × 过去/现在时态 × 成对风格标签 —— 以六种轮换措辞渲染(所有划分中每类约 300 行):

  • Write a short story in the {genre} genre, in {pov} person, {tense} tense. Draw on the flavors of {f1} and {f2}.
  • …; incorporate elements of {f1} and {f2}.
  • Write a {genre} story, in {pov} person, {tense} tense, that leans on {f1} and {f2} for atmosphere.
  • Write a complete {genre} short story, in {pov} person, {tense} tense, with {f1} and {f2} woven into the setting.
  • Write a short story in the {genre} genre, in {pov} person, {tense} tense. Let {f1} and {f2} shape its world.
  • Compose a {genre} short story, in {pov} person, {tense} tense. Let {f1} and {f2} inform the premise.

Schema(字段结构)

字段 类型 说明
instruction string 3 轮写作任务(上述模板)
pieces list[string] ×3 故事分段,每轮一段(均为散文)
turn_words list[int] ×3 教师为三轮预生成的词数计划(总和约等于 words)
words int 记录的总词数 —— 在编辑前记录,因此与 pieces 总和有少量偏差(尾部最多约 280 词)

分段长度说明

分段长度与 turn_words 计划的比例(data3 训练集,实际/目标比):

  • 第 1 轮中位数 1.00(p10–p90 0.99–1.00)
  • 第 2 轮中位数 1.71(1.43–1.96)
  • 第 3 轮中位数 0.27(0.06–0.60)

这是存储产物,而非教师未按计划生成 —— 已组装的故事在段落边界处按照接近累计计划目标的位置重新切分为三段。除第 1 轮外,各轮长度应视为近似值。

使用方法

python from datasets import load_dataset ds = load_dataset("baiango/minicpm5-sft3-3turn", "data3")

生成过程与局限

  • 完全合成:指令由模板组装;故事文本由更强的教师 LLM 蒸馏。教师的偏差会延续到数据中。
  • 仅英语;仅虚构作品。指令约束(体裁/时态)在总体上可靠,但底层数据中的 POV(人称视角)依从性不完美。
  • 除自动化质量门外无人为策展;不打算作为阅读语料库。
搜集汇总
数据集介绍
minicpm5-sft3-3turn 数据集图片
构建方式
在叙事生成模型的监督微调实践中,指令数据的构造策略直接影响生成文本的风格可控性。该数据集采用全合成蒸馏范式,首先通过34种文学体裁、三种人称视角、两种时态以及成对风格标签构成的笛卡尔积网格,以六种轮换句式生成约三百条指令模板;随后由更强的教师大语言模型依据指令及预生成词数规划,蒸馏产出三段式英文短篇故事,并将组装后的完整叙事按接近累积计划目标的段落边界重新切分为三个片段,最终形成1637条训练记录与40条验证记录。
特点
该数据集的显著特征在于其高度结构化的指令模板与分轮次叙事蒸馏相结合,覆盖体裁、人称、时态与风格标签的多维组合,训练集总词数约293万,单条记录词数中位数为1781。记录字段包括指令、三段故事片段、教师预生成词数规划及记录总词数,其中第二段实际长度中位数为计划目标的1.71倍,第三段则为0.27倍,此长度分布系存储时依据段落边界重切所致,除首轮外各轮长度宜视为近似值。
使用方法
使用者可通过HuggingFace数据集库以配置名data3加载该数据,调用方式为load_dataset("baiango/minicpm5-sft3-3turn", "data3"),获得包含训练与验证两个划分的字典对象。数据适用于文本生成任务的监督微调,每条记录的instruction字段可直接作为模型输入,pieces字段提供对应三轮回应的参考输出。需注意该数据集为纯合成英文小说语料,指令中的体裁与时态约束在整体层面可靠,但人称视角的遵循度在底层数据中并不完美,且未经人工精读筛选,不宜作为阅读语料使用。
背景与挑战
背景概述
在生成式语言模型迅猛发展的背景下,高质量指令微调数据成为提升模型写作能力的关键资源。MiniCPM5 SFT3 3-Turn Story Writing Data 由研究者 baiango 构建,旨在支持 MiniCPM5 系列模型的三轮故事写作训练。该数据集聚焦英语虚构叙事,采用模板化指令与强教师模型蒸馏生成的故事片段,涵盖34种体裁、三种人称与两种时态,总词量约300万。其核心研究问题在于通过结构化多轮生成任务,探索语言模型在长篇创作中的连贯性与可控性,为轻量级模型的故事生成能力提升提供了可复用的训练配方,对创意写作与指令微调研究具有参考价值。
当前挑战
该数据集所对应的领域问题在于如何让语言模型在长篇虚构写作中保持体裁、人称、时态的一致性并实现多轮连贯叙事,这要求模型具备深层的语义规划与风格控制能力。在构建层面,挑战主要源于数据完全由强教师模型蒸馏生成,其固有偏见与指令遵循的不完美性被继承,尤其是人称视角的遵循在底层数据中并不可靠;同时,故事片段在重新切分后导致后续轮次实际长度与预设词数计划出现显著偏差,影响了长度信号的准确性。此外,数据仅覆盖英语虚构文本,缺乏人工精编,限制了其在跨语言与多题材场景下的泛化能力。
常用场景
经典使用场景
在生成式人工智能的叙事创作领域,指令微调数据的质量与结构直接决定模型的故事生成能力。该数据集的经典使用场景聚焦于多轮故事续写与风格控制的监督微调训练,每条样本以统一模板指令引导模型在指定体裁、人称、时态及氛围标签约束下分三段铺陈叙事,使模型习得从情节发端到高潮再到收束的连贯组织能力。其三轮切分机制特别适用于训练模型处理长程叙事结构,让每一轮生成均能承接前文语境并保持风格一致,从而在受控故事生成任务中发挥基准微调语料的作用,为叙事连贯性与指令遵循能力的联合优化提供标准化训练素材。
实际应用
在实际应用层面,该数据集主要用于支撑轻量化故事生成模型的监督微调与效果验证,可服务于互动小说引擎、写作辅助工具以及创意内容自动化生产等场景。开发者借助其统一的指令模板与三段落结构,能够快速构建具备体裁切换与视角控制能力的生成系统,用于批量产出短篇故事草稿或为创作者提供多风格灵感素材。该数据集亦适合作为教育场景中叙事写作示范语料,辅助语言学习者观察不同人称与时态下的行文差异。其小体量特征使其成为资源受限环境下开展故事生成实验与模型对比的理想选择。
衍生相关工作
围绕该数据集衍生的工作主要体现为以其为训练食谱所发布的minicpm5-ul4b-story模型,验证了该三轮写作阶梯数据在小规模模型故事生成上的蒸馏效果。后续研究可能沿两个方向展开:其一是在此模板化指令体系基础上扩展更多体裁维度与语言种类,构建跨语种叙事微调数据集;其二是利用其分段词数规划记录,探索故事长度控制与篇章结构预测的联合建模方法。该数据集的合成管线与质量门控流程亦为同类创意写作数据集的构建提供了可借鉴的范式,推动叙事生成数据向结构化与可控化方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务