遇见数据集

literary-roleplay

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

Literary Roleplay SFT是一个专门用于角色扮演模型指令微调的多语言数据集,旨在教授结构化角色扮演机制。数据集包含346个样本,覆盖英语、俄语、印地语、梵语和日语五种语言,均使用纯净词汇且方法论术语已本地化翻译。数据源自多样化的文学传统,包括果戈理、布尔加科夫、佩鲁莫夫、戈洛瓦乔夫的作品,吠陀经典(奥义书、摩诃婆罗多、罗摩衍那),经典科幻小说(阿西莫夫、克拉克、布拉德伯里、莱姆、勒吉恩、斯特鲁加茨基),经典侦探小说(柯南·道尔、克里斯蒂、哈米特、钱德勒、坡),以及日本民间传说和现代诗歌。特别包含42个女性主角样本以解决性别平衡问题。每个样本教授四种角色扮演格式之一:单轮响应、多轮场景、场景编排或情感检测。角色扮演逻辑基于三个由Super Z(GLM-5.2)编写的信标脚本:角色无关情感检测引擎v3.8、简洁与反重复引擎v3.5和场景编排引擎v2.7.18。数据集包含26个负样本(13个“坏”,13个“有缺陷”),专门展示每种反模式,用于批评者模型训练。数据样本包含14个字段,如instruction、output、format等。数据按85/15比例随机拆分为训练集(294个样本)和测试集(52个样本)。所有数据均由GLM-5.2在项目负责人编辑指导下生成,数据集采用CC0-1.0许可证发布。

Literary Roleplay SFT is a multilingual dataset specifically designed for instruction fine-tuning of role-playing models, aiming to teach structured role-playing mechanisms. The dataset contains 346 samples covering five languages: English, Russian, Hindi, Sanskrit, and Japanese, all using pure vocabulary with localized translations of methodological terms. Data is sourced from diverse literary traditions, including works by Gogol, Bulgakov, Perumov, Golovachev; Vedic classics (Upanishads, Mahabharata, Ramayana); classic science fiction (Asimov, Clarke, Bradbury, Lem, Le Guin, Strugatsky); classic detective fiction (Conan Doyle, Christie, Hammett, Chandler, Poe); and Japanese folklore and modern poetry. It specifically includes 42 female protagonist samples to address gender balance. Each sample teaches one of four role-playing formats: single-turn response, multi-turn scenario, scenario orchestration, or emotion detection. Role-playing logic is based on three beacon scripts written by Super Z (GLM-5.2): role-agnostic emotion detection engine v3.8, conciseness and anti-repetition engine v3.5, and scenario orchestration engine v2.7.18. The dataset includes 26 negative samples (13 bad, 13 defective) specifically showcasing each anti-pattern for critic model training. Data samples contain 14 fields, such as instruction, output, format, etc. The data is randomly split into training (294 samples) and test (52 samples) sets in an 85/15 ratio. All data is generated by GLM-5.2 under the editorial guidance of the project lead, and the dataset is released under the CC0-1.0 license.

创建时间:
2026-07-23
搜集汇总
数据集介绍
literary-roleplay 数据集图片
构建方式
该数据集源自对文学经典的重构与再创作,覆盖英语、俄语、印地语、梵语及日语五种语言,从果戈理、布尔加科夫、吠陀经典、科幻与侦探文学及日本民间传说中提取人物与情境。所有346条样本均由GLM-5.2模型在项目主导者的编辑指导下生成,每条样本被精心设计为四种角色扮演格式:单轮回应、多轮场景、场景编排与情感检测,并基于三份核心剧本引擎逻辑进行构建,分别处理情感识别、简洁性控制与场景调度。其中包含42条以女性为主角的样本以平衡性别分布,另有26条负面样本用于训练评论家模型识别各类反模式。
特点
该数据集的核心特色在于其高度结构化的角色扮演教学框架,通过四个明确的格式维度引导模型学习不同的扮演技巧。数据集中每条样本附有丰富元标签,涵盖质量等级、引擎焦点、扮演模式、张力级别与角色数量,便于定向训练与评估。特别引入三套身体语言调色板(文学、动漫与物理喜剧)以适应不同风格需求,同时强调视角纪律与反模式警示,使模型能够生成更自然、多样且不越界的内容。多语言纯词汇承诺确保了各语言样本的纯净性与方法术语的本土化翻译。
使用方法
该数据集适用于监督式微调任务,主要驱动文本生成模型进行高质量角色扮演。训练时建议筛选quality字段为good的320条正样本用于生成训练,而bad与flawed的26条样本则专用于评论家模型的分类训练,以识别POV违反、重复、冗长等反模式。研究人员可依据format、language、engine_focus等标签构造条件化训练集,或在多语言评估中验证跨语言一致性。数据集以parquet格式提供预划分的训练与测试集,支持Alpaca样式兼容的微调框架直接加载。
背景与挑战
背景概述
Literary Roleplay SFT数据集由项目负责人与GLM-5.2模型(Super Z)于近期联合构建,旨在弥补现有角色扮演指令微调数据集在结构化机制与多语言文学深度上的缺失。该数据集融合了果戈理、布尔加科夫、吠陀经典、日本民间传说等横跨五种语言的文学源泉,并基于三大角色扮演引擎逻辑(情感检测、简洁性及场景编排)生成346条高质量范例。通过引入女性主角(如玛格丽特、马普尔小姐)以缓解性别偏差,数据集在对话生成、角色扮演及文本分类任务中展现出独特的教学价值,为提升大语言模型的角色扮演能力提供了系统化的训练资源。
当前挑战
该数据集所解决的领域挑战在于:现有角色扮演数据集多聚焦于通用指令遵循或单一角色模板,缺乏对结构化角色扮演机制(如视角纪律、体态语言调色板、反模式识别)的系统训练。在构建过程中,主要挑战包括:确保多语言内容在词汇纯度上的严格分离,避免术语交叉污染;生成的反模式示例(26条)虽清晰但缺乏说服模型识别细微不良角色扮演的模糊性;因数据规模较小(346条),其作为独立微调语料库的有效性尚待验证;此外,LLM作为生成器与注释者的角色重叠,导致质量标签缺乏独立性评估。
常用场景
经典使用场景
在文学角色扮演与对话生成领域,该数据集被广泛用于微调因果语言模型,使其能够遵循四种核心角色扮演格式——单轮响应、多轮场景、场景编排与情感检测。通过融合果戈理、布尔加科夫、吠陀经典及日本民间传说等多语种文学源泉,数据集为模型提供了跨越英、俄、印地、梵、日五种语言的丰富叙事语境,使其在生成角色对话时能够精准维持人设、遵守视角边界、运用肢体语言及反重复模式,从而显著提升生成文本的文学质感与沉浸式体验。
解决学术问题
该数据集有效弥补了现有角色扮演数据集中结构化角色扮演机制缺失的学术空白。传统指令微调数据集(如Alpaca)或角色专属数据集缺乏对情感探测、场景编排、视角纪律及反模式识别等核心技法的显式教学。数据集通过引入三类信标脚本引擎(情感检测、简洁与反重复、场景编排),并提供26个刻意设计的负面示例(展示视角违反、词句重复、冗长等反模式),为模型训练批评模型与避免低劣角色扮演提供了系统性方法论,推动了基于文学深度的多语种角色扮演生成研究。
衍生相关工作
该数据集衍生了若干关键学术工作与工程实践,包括基于其角色扮演方法论的批评模型训练研究——通过320条高质量样本与26条反模式样本,学者开发了专门检测视角越界、情感螺旋与场景连续断裂的分类器。其次,数据集的多语种与文学特性催生了跨语言角色一致性评估框架,研究者利用其语言纯度承诺与角色卡结构,设计了对比式跨角色迁移学习实验。此外,其四格式体系为场景编排器与情感调色板的端到端融合提供了基准,推动了从单轮对话生成到复杂多角色叙事结构的可控生成范式探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务