遇见数据集

selene

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

Selene是一个专门用于创意写作的法语指令微调数据集,涵盖短篇故事、场景、对话和世界观构建等任务。该数据集旨在支持从原始基础模型开始,通过监督微调训练出具备指令跟随能力、法语语言基础以及文学风格表达的模型。其核心特点是“虚构内容未经审查”,即数据集中不包含模型拒绝请求或进行道德说教的内容,从而确保模型能够遵循包括黑暗或成熟主题在内的各类虚构创作指令。数据集结构上,采用ChatML风格的对话格式,以JSON Lines文件存储,每条记录包含唯一标识符、消息列表(用户与助手交替)、数据来源、层级(指令或创意)、语言标识等字段。数据规模方面,共包含134,954个示例,来源于12个不同的数据源,其中指令层示例127,228个(占94.3%),创意层示例7,726个(占5.7%)。创意层数据主要源自法语公共领域文学作品(如Project Gutenberg和Wikisource),并通过指令反翻译技术生成对应的用户指令;指令层数据则整合了多个法语指令数据集,并进行了拒绝回答和语言过滤等处理。数据集适用于训练面向法语创意写作、故事生成、角色扮演等场景的文本生成模型。

Selene is a French instruction fine-tuning dataset specifically designed for creative writing, covering tasks such as short stories, scenes, dialogues, and world-building. The dataset aims to support training from raw base models through supervised fine-tuning to develop models with instruction-following capabilities, French language proficiency, and literary style expression. Its core feature is uncensored fictional content, meaning the dataset does not include content where the model rejects requests or provides moral preachings, ensuring the model can follow various fictional creation instructions, including dark or mature themes. Structurally, the dataset uses a ChatML-style dialogue format stored in JSON Lines files, with each record containing fields like a unique identifier, message list (alternating user and assistant), data source, level (instruction or creative), and language identifier. In terms of scale, it comprises 134,954 examples from 12 different data sources, with 127,228 instruction-level examples (94.3%) and 7,726 creative-level examples (5.7%). The creative-level data primarily comes from French public domain literary works (e.g., Project Gutenberg and Wikisource) and generates corresponding user instructions through instruction back-translation; the instruction-level data integrates multiple French instruction datasets and undergoes processing such as rejection filtering and language filtering. The dataset is suitable for training text generation models for French creative writing, story generation, role-playing, and similar scenarios.

创建时间:
2026-07-22
搜集汇总
数据集介绍
selene 数据集图片
构建方式
Selene数据集专为法语创意写作的指令微调而设计,其构建遵循从原始基座模型直接训练指令模型的路线。数据集由两个互补层次融合而成:通用指令层与创意写作层。通用指令层整合了French-Alpaca、oasst2、OpenHermes的翻译版本、CFP及Aya等法语指令来源,旨在建立指令遵循能力并保持法语流畅性。创意写作层则主要利用来自Project Gutenberg和法语维基文库的公有领域文学作品,通过指令反向翻译技术——即让语言模型为已有的文学段落生成对应的写作指令,而非反过来生成回复——将纯文学散文转化为指令/回复对。此外,v2版本新增了多轮对话链,通过连接同一部作品的连续章节片段,构建了真正的连续叙事对话。所有来源均统一为ChatML格式,并经过严格的去污、过滤与平衡处理,最终以JSON Lines格式存储。
特点
Selene数据集最显著的特点在于其面向虚构创作的无审查设计。通过精心策划,数据集中不包含任何拒绝回答或道德说教的样本,确保模型在遵循虚构类指令时(包括黑暗或成人主题)始终服从,而非以道德理由拒绝。数据集以法语(fr)构建,包含约13.5万条样本,其中通用指令层占94.3%,创意写作层占5.7%,但构建脚本可调整至约55%指令与45%创作的平衡配比。每条样本包含唯一的id、消息列表(支持多轮对话)、来源标识与层次字段(instruct或creatif),便于在训练时灵活调整比例。特别地,创意写作层样本的指令均从不包含原文专有名词或措辞,确保了指令与回复之间的解耦与多样性。
使用方法
使用Selene数据集时,用户可直接加载HG数据集仓库中的selene.jsonl文件,该文件为合并后的原始池。每条数据遵循ChatML格式,messages字段包含role和content键对。由于v2版本引入了多轮对话样本(约占1.2%),传统的单一用户/助手配对假设需要更新,建议在训练时遍历messages字段并对非助手角色的token进行损失掩码。系统提示不被存储在数据中,而应在数据整理阶段统一注入,以锚定创意性、不拒绝的人物设定。项目提供的构建脚本可用于实现响应长度过滤、精确与MinHash近重复去重、交叉格式去重、比例平衡(保留所有创意样本并子采样指令样本)以及90/10的训练/验证划分。需要注意的是,该数据集仅限非商业/研究用途使用。
背景与挑战
背景概述
Selene数据集由Chortan于2024年创建,专注于法语文学生成的指令微调,旨在从零基础模型出发、通过监督微调同时习得指令遵循能力、法语语感和文学风格。核心研究问题是构建一个对虚构内容不加审查的指令数据集,使模型能够服从包含黑暗或成熟主题的文学创作指令而非拒绝。该数据集融合了一般指令层与文学创作层,前者从法语Alpaca、OpenHermes等多源指令数据中采样,后者则利用古登堡计划与法语维基文库的公版文学作品,通过指令反向翻译技术生成忠实于原文的创作对。Selene的独特设计在于其零拒绝的创作导向,为法语文学生成模型的训练提供了专门化的数据基础。
当前挑战
构建过程面临多重挑战:首先,公版文学文本原始结构杂乱,需剔除转录注释、章节标题、页码等噪声,并依据章节边界合理切分为200-900词的教学用段落;其次,指令反向翻译需避免提示词泄露文本内容或专有名词,同时确保生成的创作指令风格多样且可验证;此外,多来源数据整合中需实施跨格式去重(如oasst2线程与独立对的文本重叠)以防止训练与验证集泄露;最后,在领域问题层面,Selene需在保持高比例指令数据以维持通用能力的同时,确保文学创作层占据足够份额以充分训练模型的虚构叙事专长。
常用场景
经典使用场景
Selene数据集专为法语创意写作场景设计,核心用于对预训练语言模型进行从零开始的指令微调,使其掌握遵循法语创作指令的能力。数据集融合了通用指令层与创意文学层,前者安装指令跟随与法语流畅度基础,后者则通过将公共领域文学作品转化为指令-响应对来注入文学表达风格。研究人员可借助其按层标注的字段灵活调整指令与创意样本的比例,以塑造模型在叙事性、角色扮演及世界观构建等多元创作任务中的表现力。
实际应用
在实际应用中,基于Selene微调的语言模型可被部署于法语文学创作辅助工具、剧本生成平台、互动叙事游戏以及角色扮演对话系统等场景。因其对虚构情节中各类主题的无审查支持,尤其适合面向成人用户的叙事内容生成服务,如作家灵感激发工具、多轮故事续写系统及世界观设定生成器。此外,其公共领域文本来源确保了版权合规性,为商业化创意写作产品的研发提供了可行的数据路径。
衍生相关工作
源自Selene数据集的相关研究主要体现在两个方向:一是基于其“指令反向翻译”方法论的延伸工作,即利用小型模型从无标注文学文本中自动生成高质量指令对,该方法可推广至其他语种或领域(如历史文献、科学写作);二是从零开始指令微调范式在特定风格或主题约束下的变体探索,例如在多轮对话链条中保持叙事一致性、在长文本生成中验证约束条件(视角、字数、语气)的满足程度。这些工作共同推动了可控文本生成与低资源语言创作模型的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务