遇见数据集

SL-AI/openprose

收藏
Hugging Face2026-07-19 更新2026-07-22 收录
官方服务:

资源简介:

OpenProse是一个专注于写作的数据集,从5个来源编译而成,旨在最大化大型语言模型的创意写作技能。使用的数据集包括:enPurified/smoltalk-creative-writing-enPurified-openai-messages、Dampfinchen/Creative_Writing_Multiturn、ChaoticNeutrals/Creative_Writing-ShareGPT、nothingiisreal/Reddit-Dirty-And-WritingPrompts和andrewelawrence/writingPrompts-merged。方法论基于Reddit上真实人类创作的内容,确保数据质量。数据集经过清理并整合为ShareGPT风格,便于使用。

OpenProse是一款聚焦写作任务的数据集,由5个独立数据源编译整合而成,旨在最大化大语言模型(Large Language Model)的创意写作能力。所采用的数据源包含:enPurified/smoltalk-creative-writing-enPurified-openai-messages、Dampfinchen/Creative_Writing_Multiturn、ChaoticNeutrals/Creative_Writing-ShareGPT、nothingiisreal/Reddit-Dirty-And-WritingPrompts以及andrewelawrence/writingPrompts-merged。其构建方法论以Reddit平台上的真实人类创作内容为核心依据,以保障数据质量;数据集已完成规范化清洗与格式整合,统一为ShareGPT风格的结构,便于下游使用。

提供机构:
SL-AI
搜集汇总
数据集介绍
SL-AI/openprose 数据集图片
构建方式
OpenProse数据集专为提升大语言模型的创意写作能力而设计,其构建方式体现了多元数据融合与精细清洗的智慧。该数据集整合了来自五个不同来源的文本资源,包括专注于创意写作的Smoltalk、多轮交互式写作内容、ShareGPT格式的创作对话,以及源自Reddit社区的真实人类写作提示与回应。通过将这些来源统一转换为ShareGPT格式,数据集实现了标准化与易用性的平衡,为模型提供了丰富而真实的写作范例。
特点
OpenProse数据集的核心特点在于其内容的多样性与真实性。它既包含纯净的创意写作指令,也涵盖混合了敏感与非敏感内容的真实对话,确保了模型在复杂语境下的适应能力。数据均源自人类创作者的实际产出,尤其是Reddit上的写作提示与互动,赋予了数据集独特的生活质感与表达张力。这种设计不仅提升了模型对叙事结构与情感脉络的理解,也为其处理开放式、多轮次写作任务奠定了坚实基础。
使用方法
OpenProse数据集适用于文本生成任务的微调与评估,尤其专注于创意写作领域。使用时,可直接加载其ShareGPT格式的对话样本,通过标准的指令跟随模式进行模型训练。建议将其作为单轮或多轮对话生成任务的训练数据,以增强模型在故事创作、角色对话和场景描述等场景下的输出质量。用户需注意数据集包含部分成人内容,应根据应用场景进行必要的过滤与适配。
背景与挑战
背景概述
OpenProse数据集诞生于大型语言模型(LLMs)在创意写作领域迅速发展的背景下,由多位独立研究人员基于公开社区数据整合而成,发布时间约为2024年。该数据集的创建旨在解决当前LLMs在生成多样化、富有文学性的长篇文本时表现不足的问题,其核心研究问题聚焦于如何通过高质量、由人类作者创作的写作样本提升模型的风格模仿与情节构建能力。通过融合来自Reddit等平台的真实人类创作内容,OpenProse为模型提供了丰富的叙事范例,对推动LLMs在创意写作、角色对话和虚拟叙事等应用中的进步具有重要影响力,成为连接社区原创内容与前沿AI技术的一道桥梁。
当前挑战
OpenProse所应对的领域挑战是提升大语言模型在创意写作任务中的生成质量与多样性,尤其是克服模型输出趋于模板化、缺乏真实人类写作中独特的语气和情感深度的局限。在构建过程中,数据整合面临显著障碍:需从五个来源中剔除重复内容与低质量样本,并统一转换为ShareGPT格式;此外,处理红迪社区中混合的NSFW及敏感内容,需在不损害数据集多样性的前提下进行恰当分类与标注,确保模型训练的伦理合规性与鲁棒性。
常用场景
经典使用场景
OpenProse数据集专为提升大语言模型的创意写作能力而设计,其典型应用场景包括多轮对话生成、故事续写、角色扮演以及基于提示的文本创作。通过整合来自Reddit等平台的真实人类写作数据,该数据集能够有效训练模型掌握叙事结构、情感表达和风格模仿,从而在生成具有连贯情节和丰富细节的文学作品时表现更佳。研究者可将其作为微调基础,使模型在开放域写作任务中产出更具创造力和自然性的内容。
解决学术问题
该数据集旨在解决大语言模型在创意写作领域面临的泛化能力不足与风格单一化问题。传统训练数据多源自新闻或百科,缺乏对文学性、幽默感及情感张力的支持。OpenProse通过汇集多来源、多风格的真实写作样本,为模型提供了丰富的叙事范例,有助于突破机械式文本生成的局限,推动对语言创造力、叙事逻辑一致性及跨文体适应性的研究。其开源属性也为对比实验和基准测试提供了标准化资源。
衍生相关工作
OpenProse的出现促进了多个衍生研究方向,包括基于真人写作数据集的风格迁移模型、多轮对话与长文本生成的联合优化方法,以及针对创意写作的细粒度评估指标开发。其数据整合方式也启发了后续工作,如构建分层写作知识图谱或设计对抗训练策略以增强模型对隐含意图的理解。此外,该数据集常与其他指令微调数据联合使用,以探索写作能力与常识推理的协同提升路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务