遇见数据集

plottwist-movies

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

PlotTwist Movies (synthetic) v2 是一个包含 10,000 条合成电影记录的数据集,由预训练的指令微调大语言模型 Qwen/Qwen2.5-1.5B-Instruct 通过结构化提示和受控变化生成,覆盖 genre × decade × tone 的网格。每条记录包含 id、title、genre(16 个规范类型)、logline(1-2 句前提,12-60 词)、tagline(简短营销语,≤16 词)、decade(7 个规范时代)、tone(10 个规范基调)。所有分类字段均采用规范词汇表并经过验证。数据集专为 PlotTwist 应用设计:给定一个电影创意,应用推荐 3 个相似的 logline(基于嵌入向量和 FAISS)并生成一个新的原创 logline。适用任务包括文本检索(基于嵌入向量的相似推荐)、文本生成(logline 生成)、电影创意辅助、结构化数据质量控制研究。

PlotTwist Movies (synthetic) v2 is a dataset containing 10,000 synthetic movie records, generated by a pre-trained instruction-tuned large language model Qwen/Qwen2.5-1.5B-Instruct through structured prompting and controlled variation, covering a grid of genre × decade × tone. Each record includes fields: id, title, genre (16 canonical types), logline (1-2 sentence premise, 12-60 words), tagline (short marketing tagline, ≤16 words), decade (7 canonical decades), tone (10 canonical tones). All categorical fields use controlled vocabularies and are validated. The dataset is designed for the PlotTwist application: given a movie idea, it recommends 3 similar loglines (based on embedding vectors and FAISS) and generates a new original logline. It is suitable for tasks including text retrieval (embedding-based similarity recommendation), text generation (logline generation), movie idea assistance, and structured data quality control research.

创建时间:
2026-08-06
原始信息汇总

PlotTwist Movies (synthetic) — v2 数据集概述

基本信息

  • 许可证:MIT
  • 任务类型:文本检索、文本生成
  • 语言:英文
  • 标签:电影、合成数据、loglines、LLM生成
  • 数据规模:10K < n < 100K(实际10,000条记录)
  • 配置文件:默认配置,训练集数据文件为 plottwist_movies_v2.parquet

数据集简介

该数据集包含10,000条原创的合成电影记录,由预训练的指令微调LLM(Qwen/Qwen2.5-1.5B-Instruct)通过结构化提示和受控变化生成。生成过程基于类型 × 年代 × 基调的网格进行。该数据集服务于PlotTwist应用:用户提供电影创意后,应用嵌入模型(FAISS)推荐3条相似的loglines,并生成1条新的原创logline。

数据模式(Schema)

字段 描述
id 稳定标识符(mv_00000 等)
title 原创虚构标题
genre 16种标准类型之一
logline 1-2句话的前提描述(12-60词)
tagline 简短营销语(≤16词)
decade 7个标准年代之一
tone 10种标准基调之一

标准词表(超出将被拒绝)

  • 类型(16种):科幻、奇幻、恐怖、爱情、惊悚、喜剧、剧情、动作、悬疑、冒险、犯罪、动画、纪录片、西部、音乐剧、战争
  • 年代(7种):1980s、1990s、2000s、2010s、2020s、近未来、远未来
  • 基调(10种):黑暗、喜剧、暖心、讽刺、史诗、坚韧、奇想、悬疑、忧郁、充满希望

生成方法

  • 系统提示:要求模型仅创作原创电影,禁止使用真实电影标题,禁止以特定陈词滥调开头,仅输出有效JSON数组
  • 用户提示:每个(类型, 年代, 基调)网格单元生成8部电影,要求严格匹配给定字段值
  • 解码参数do_sample=True, temperature=0.9, top_p=0.95,批量生成,含两个少样本示例
  • 后处理:输出经稳健JSON解析、验证、去重(标题+logline哈希归一化)、检查点保存至磁盘

数据质量修复(v1→v2)

v1版本仅限制genre字段,导致模型在其他字段上产生幻觉/漂移。v2版本通过枚举验证和过滤修复了以下问题:

v1中测量到的缺陷 数量 v2修复方式
非标准decade值(如1993cyberpunk utopia 162个不同值(应为7个) 枚举验证并拒绝
非标准tone值(如bittersweet-noir 1,302个不同值(应为10个) 枚举验证并拒绝
类型大小写漂移(Sci-Fi vs Sci-fi 17个变体(应为16个) 标准标题大小写
陈词滥调开头(“In a world where…”等) 706条(约7%) 提示中禁止+验证时拒绝
Logline少于12词(截断/低质量) 14条 词数门槛

EDA摘要(v2,全部10,000行)

  • 完整性:0缺失值、0空字符串、0重复ID
  • 重复性:0完全重复行;0条loglines在TF-IDF余弦相似度≥0.80时接近重复(高多样性)
  • Logline词数:最少12词,中位数约23词,均值约23词,最大60词
  • Taglines:10,000条中约9.7k条唯一(无模式坍缩)
  • 覆盖率:类型、年代、基调在受控网格上分布均衡

文件内容

  • plottwist_movies_v2.parquet — 干净的v2数据集(推荐使用)
  • plottwist_movies.parquet — 原始v1数据集(保留用于前后对比)
  • Part1_Synthetic_Data_Generation_v2.ipynb — 生成代码(提示、网格、验证、检查点)
  • Part2_EDA_v2.ipynb — 探索性分析与可视化

下游应用

推荐系统在模型编写的pitch→logline对基础上微调all-mpnet-base-v2,并使用非循环recall@k评估(基础版 vs 微调版)。微调嵌入器 + FAISS索引 + 目录已发布至:https://huggingface.co/razsarusi/plottwist-embedder-ft

搜集汇总
数据集介绍
plottwist-movies 数据集图片
构建方式
本数据集通过预设的生成网格(genre × decade × tone)与结构化提示,利用预训练的指令微调语言模型Qwen2.5-1.5B-Instruct进行合成数据生成。在每一个网格单元中,模型被要求生成8部原创电影记录,涵盖标题、类型、梗概、标语、年代与基调等字段。生成过程采用温度0.9、top_p 0.95的采样策略,并辅以少量示例引导,确保输出符合要求。生成结果经过严格的JSON解析、字段枚举验证、词数门控与重复检测,并采用断点续存机制保障数据完整性。v2版本在v1基础上,针对模型漂移问题(如年代与基调的离群值、陈词滥调开头)进行了系统性修复,最终构建出规模达10,000条的高质量合成电影数据集。
特点
该数据集的核心特点在于其严格的枚举约束与内容多样性。所有类别字段(类型、年代、基调)均限定在规范词表内,且拼写采用标准格式,彻底杜绝了模型漂移现象。数据完整性极高,无缺失值、无重复项,且通过TF-IDF余弦相似度检测,确保梗概间的高度差异化。梗概长度控制在12至60词之间,中位数约23词,既保证信息量又避免冗余。标题与标语均保持原创性,标语多样性强,未出现模式崩溃。此外,数据集的构建过程体现了迭代式探索分析(EDA)的严谨性,从v1到v2的改进有据可查,为合成数据生成的质量控制提供了实证案例。
使用方法
该数据集适用于文本检索与文本生成任务,尤其适合作为电影推荐系统的训练与评估数据。用户可加载parquet文件直接用于监督微调,例如构建梗概-嵌入模型以提升语义检索的准确性。建议结合嵌入模型(如all-mpnet-base-v2)与FAISS索引构建推荐管线,实现基于输入电影想法检索相似梗概并生成新梗概的功能。数据集规模适中(10K),便于快速迭代实验,且规范化的字段结构简化了预处理流程。使用时需注意其合成性质,避免与真实电影数据混淆,且应在模型训练中防止过拟合于生成模式。
背景与挑战
背景概述
PlotTwist Movies 数据集由 Raz Sarusi 与 Tomer Dariel 于近期创建,旨在为电影创意推荐应用 PlotTwist 提供合成数据支持。该数据集利用预训练指令模型 Qwen2.5-1.5B-Instruct,通过结构化提示和受控变异,在类型、年代与基调的交叉网格上生成了 10,000 条原创电影记录。其核心研究问题在于如何高效生成高质量、多样化的电影梗概(logline),并确保数据的规范性与一致性。该数据集不仅服务于推荐系统的嵌入微调与检索评估,还通过迭代式探索性数据分析(EDA)流程,展示了合成数据生成中质量控制的系统性方法,对计算创意领域的数据构建实践具有参考价值。
当前挑战
该数据集所面临的挑战主要分为领域问题与构建问题。领域方面,电影梗概生成需兼顾创意性与结构化,既要避免重复和陈词滥调,又要维持类型、年代、基调等属性的严格可控,同时满足下游检索任务对数据多样性和非循环评估的需求。构建过程中,v1 版本暴露了模型在非约束字段上的严重漂移,例如年代值出现 162 种变异、基调值多达 1,302 种,以及 7% 的梗概以陈词滥调开头。为解决这些问题,v2 引入了严格的枚举验证、规范化处理和规则过滤,成功将漂移消除,并保持数据的完整性与多样性,最终实现了完全受控的生成流程。
常用场景
经典使用场景
PlotTwist Movies数据集是电影创意生成与检索领域的宝贵资源,为文本生成和语义检索任务提供了大规模、结构化的合成数据。其典型的应用场景包括基于logline的电影推荐系统、创意写作辅助工具以及多模态内容生成的研究。数据集精心设计了genre、decade、tone等可控属性,使得研究者能够在特定维度上进行精细的实验,例如在给定电影类型和时代背景下生成连贯且富有创意的故事前提。此外,该数据集也广泛用于嵌入模型的微调和评估,通过对比基础嵌入模型与微调后的模型在召回率上的表现,来验证领域自适应语义表示的有效性。
解决学术问题
该数据集针对合成数据生成中的一致性和有效性难题,提供了经过严格清洗和验证的解决方案。它通过枚举约束和模板过滤,消除了模型漂移、词汇重复和模板化开头等常见生成缺陷,从而确保了数据的质量和多样性。在学术上,它解决了如何利用大型语言模型生成大规模、可控且无偏见的训练数据的问题,为后续的文本生成和检索研究提供了可靠的数据基础。其严谨的验证流程和迭代优化过程也为数据集的构建方法论提供了宝贵的参考,推动了合成数据在自然语言处理研究中的可信应用。
衍生相关工作
该数据集直接衍生了两个关键的工作:一是经过微调的文本嵌入模型,它利用模型生成的pitch-logline对进行训练,并在非循环的召回率评估中展示了显著的性能提升,为领域自适应检索提供了基线;二是配套的FAISS索引和电影目录,构成了一个完整的推荐系统基础设施,被后续研究广泛用作电影创意生成的基准。数据集的生成流程和验证代码以开源形式发布,也催生了后续关于可控文本生成、数据质量评估和合成数据ETL流程的进一步研究,成为相关领域探索的起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务