复杂长指令对话生成数据本数据集是为驱动大语言模型(LLM)从通用对话工具向专业级业务执行引擎进化而设计的。它通过专有的、集多阶段处理与智能构建于一体的数据生成体系,重点强化LLM在复杂场景下的指令遵循与逻辑推理能力。
数据集的核心价值在于,它教会模型如何精准理解并严格执行复杂的标准作业流程(SOP)。通过构建“指令-推理-反馈”的闭环学习机制,并引入大量错误案例进行对齐与逻辑纠偏,模型能掌握在真实业务中至关重要的决策稳定性与规则遵循能力。
核心应用场景:下一代智能客户中心
• 智能质检与陪练: 实现对客服交互的100%全量自动化质检,不仅识别流程合规性,更能定位逻辑错误,并生成改进建议,赋能一线人员持续成长。
• 智能坐席实时辅助: 在服务过程中为坐席提供实时“副驾”支持,根据SOP动态推荐最佳操作与话术,确保复杂业务处理的标准化和高质量。
• 复杂任务型对话机器人: 打造能自主完成多步、跨系统操作(如退改签、理赔申请)的自动化服务流程,显著提升效率,降低运营成本通过在现有的系统提示词数据库中选择系统提示词,构建标准对话及典型错误对话,LLM+人工评估的方式,筛选出标准对话及典型错误对话。具体过程如下:1)选择系统提示词:根据不同的行业/场景,从系统提示词库中选择系统提示词; 2)根据系统提示词,提取SOP的主题 3)根据提取的主题,生成不同的客户人设 4)基于系统提示词及客户人设,生成标准对话 5)根据系统提示词,采用文本生成类大模型进行典型对话的生成。6)模型/人工 逐条评估该大模型的回答是否和标准回答一致,符合对话的SOP。给出判断结果及原因。
带图几何习题数据通过对“基于几何实体和关系生成的几何习题问答对和解题过程”数据集的分析、评测,帮助企业发现当前模型在问答推理、图片细节理解、关系推理等方面存在的问题,将该数据集应用于企业大模型的训练,帮助企业提升企业模型在知识问答、逻辑推理、图片关系理解方面的准确性和稳定性。通过平面几何实体及关系知识,实现不同实体及关系的平面几何图生成、问题-答案生成、解题过程生成及校验,具体过程如下: (1)实体及关系采样筛选生成几何图:从当前构造的平面实体(e.g.圆、正方形等 )及关系 (e.g.共线、中点等)中选择多个实体及关系,根据实体属性及关系属性,过滤逻辑错误的实体、关系组合,最终生成符合逻辑的平面几何图及其依赖的实体及关系; (2)构建逻辑依赖图:根据几何图及其依赖的实体及关系,应用所有可能的几何定理,以宽度优先搜索(BFS)方式推导新结论作为新节点,构建可实现的逻辑依赖图; (3)根据目标反向标记路径:根据不同的搜索深度,以逻辑依赖图的一个节点作为“求解答案”,逆向追溯,找到所有推导的前提条件和中间步骤;(4)生成推理路径:根据标记的路径,梳理拓扑排序,使得每一个节点都是(条件、定理、结论)三元组;(5)几何语言转译为自然语言:采用LLM模型+prompt模板,将推理过程润色成解题过程,生成不同难度的习题、答案和解题思路;(6)COT筛选及校正:采用LLM-as-a-judge评估当前转译的解题思路是否存在修改条件、定理和结论,如果有修改,将该cot过程+评估结果作为prompt一部分,重新生成COT;
12315商品投诉分析数据源为杭州市余杭区域内12315市场投诉举报信息,数据内容仅包含脱敏后商品投诉内容,适用于“消费者洞察”场景
客服文档知识提取问答数据对合法采集的企业文档数据进行分析、处理,帮助企业快速提取文档中的问答对,提升企业知识运营效率,完善机器人知识库等系统。客服文档知识提取问答数据的算法规则包括:
1、数据采集和处理:客户通过产品页面,上传PDF/DOCX等文档数据,含文字和图片等内容。
2、算法加工:针对上传的文档文件等数据,通过OCR、版面分析等文档解析模型,识别出文件中的文字和图片等文档段落信息内容。这样,完成了从文档源格式文件到文档段落内容的提取。基于每个文档段落,应用NLP大模型(基于抽样的文本段落和相应的标定的问答对SFT训练的大模型),从这些信息中,抽取出若干个问答对(包含问题和答案部分)。汇总所有文档段落的问答对结果,即得到了整篇文档的所有问答对抽取结果。
复杂长指令对话生成数据本数据集是为驱动大语言模型(LLM)从通用对话工具向专业级业务执行引擎进化而设计的。它通过专有的、集多阶段处理与智能构建于一体的数据生成体系,重点强化LLM在复杂场景下的指令遵循与逻辑推理能力。
数据集的核心价值在于,它教会模型如何精准理解并严格执行复杂的标准作业流程(SOP)。通过构建“指令-推理-反馈”的闭环学习机制,并引入大量错误案例进行对齐与逻辑纠偏,模型能掌握在真实业务中至关重要的决策稳定性与规则遵循能力。
核心应用场景:下一代智能客户中心
• 智能质检与陪练: 实现对客服交互的100%全量自动化质检,不仅识别流程合规性,更能定位逻辑错误,并生成改进建议,赋能一线人员持续成长。
• 智能坐席实时辅助: 在服务过程中为坐席提供实时“副驾”支持,根据SOP动态推荐最佳操作与话术,确保复杂业务处理的标准化和高质量。
• 复杂任务型对话机器人: 打造能自主完成多步、跨系统操作(如退改签、理赔申请)的自动化服务流程,显著提升效率,降低运营成本
客服会话总结摘要数据对合法采集的企业服务会话数据进行分析、处理,帮助企业快速对会话内容进行概括总结,提升客服服务效率。客服服务用户过程中,因技能组差异,可能需要转交客服,被转交客服为了了解用户的问题,需要理解以前客服和用户的交互信息,通过总结的摘要和用户核心诉求等关键信息,有助于客服快速理解以往的服务记录,提升服务效率。客服会话总结摘要数据的算法规则包括:
1、数据采集和处理:企业客户自身积累的客服和用户之间的语聊会话数据,对用户的id等敏感信息做匿名化处理。
2、算法加工:客服和用户间的语聊会话存在大量数据,抽取部分样本并人工总结摘要及抽取核心诉求,以此为样本,微调训练 NLP大模型。针对每日新增的客服和用户的语聊数据,基于前述的场景数据微调的NLP大模型,生成会话摘要,及用户的核心诉求等字段关键信息。
瓴羊One客服会话质检分析数据对合法采集的企业服务会话数据进行分析、处理,帮助企业识别会话内容的质量与规范性,提升服务品质。瓴羊One客服会话质检分析数据的算法规则包括:
1、数据采集和处理:企业客户自身积累的客服和用户之间的语聊会话数据,对用户的id等敏感信息做匿名化处理。
2、算法加工:基于外部数据,涉黄、涉政等字典库,欢迎语等样本数据,训练用于识别涉黄、涉政、是否欢迎语等类别的NLP多分类模型。针对客服在服务用户过程中的语聊数据,基于辱骂、涉黄、涉政检测,是否使用欢迎语等NLP模型,识别客服服务过程中是否规范,服务是否有温度。
3、应用场景:客服服务质量需要进行考核,通过会话质检,一方面,可以检测客服在服务过程是否有辱骂用户、涉黄、涉政等高风险话语,另外,可以在服务过程是否有欢迎语等体现服务温度方面进行检测。