故事创作场景语体真实感与表达边界数据
收藏资源简介:
本数据主要用于故事创作、内容生成辅助、正文生成约束、正文生成后校验、人物对白设计、旁白压缩、古今语感转译和去AI味返修等场景。具体可用于:为正文生成提供语体边界、人物声口和旁白节制规则;检查文本中的AI味、解释腔、总结腔、现代腔、人物声口错位和对话失真问题;辅助人物卡、场景卡和关系动力设计中“谁能说、谁不能说、如何绕开直说”的判断;为自动化质检系统提供语体问题分类、风险标签和返修建议,提升文本真实感、身份贴合度和阅读沉浸感。加工前数据主要来源于申请人整理的古典叙事文本、人物对白、旁白及相关故事创作材料,原始形态以非结构化文本为主,存在来源分散、表达功能未分类、人物身份与关系语境未显式标注、真实感依据和表达风险依赖人工经验判断等问题,不能直接作为内容生成或文本校验系统的规则数据。加工前保留来源标题、来源位置和关键表达,按可独立判断的表达片段切分,剔除来源不明、语义残缺、上下文不足、重复或无法判断说话者及语境的材料,并配置唯一记录编号和数据集编号,保证来源可追溯、记录可区分。 处理采用“来源校验—片段切分—表达分类—身份识别—语境建模—特征提取—真实感判定—风险检测—修正映射—质量复核”的规则链。先依据表达目的和交互位置,将样本识别为下位者回话、上位者发令、请求、请辞、辩解、试探、劝阻、威慑、寒暄或旁白等类型;再结合称谓、行动、叙述信息和前后关系,判断说话者或叙述视角的身份、尊卑位置、责任义务及当前目标。关系与场景语境按“交互双方—身份差—利益或责任—当前事件—不可直说内容—裁断权归属”拆解;表达特征按语序、措辞强弱、直接程度、礼貌层级、信息留白、责任归因和裁断权处理提取。真实感成立须同时满足身份声口与人物位置一致、表达策略与关系压力一致、措辞与时代语境基本协调、表达顺序服务人物目标。出现现代直白谈判、网络或职场化措辞、解释腔、总结腔、过度堆砌古语、身份越级、情绪与处境不符、人物声口趋同或脱离语境套用时,标记相应风险,并映射为修正方向,归纳为“适用条件—表达步骤—禁止方式”的可迁移规则。生成式人工智能仅用于候选提炼、字段初填和格式整理,最终分类、风险判断、规则确认和质量等级由申请人复核;关键字段缺失、逻辑冲突、规则不可执行或无法回溯来源的记录不纳入数据集。 加工后数据形成以记录编号为主索引的结构化语体规则记录,包含来源信息、关键表达、表达类型、说话者或叙述视角身份、关系与场景语境、表达特征、真实感依据、边界风险、修正方向、可迁移表达规则、结构化摘要、主题标签、适用创作环节、质量等级和复核备注等内容。每条记录同时保留正面真实感依据和负面边界风险,可用于生成前的语体约束、人物声口调用和旁白节制,也可用于生成后的AI味、现代腔、解释腔、人物错位及对话失真检测,并输出可追溯的返修建议。




