遇见数据集

人资行业客户流失风险问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

原始数据来源于公司面向合作企业、个人客户开展商务服务过程中沉淀的全量客户经营台账数据。 通过构建客户营收贡献 - 合作周期 - 互动频次 - 异常行为 - 风险标签多维查询语料体系,将自然语言问数需求转化为标准 SQL 查询语句,覆盖统计类、分布类、占比类、TopN 类、对比类、阈值类、趋势类等七大查询场景。 该数据集解决企业客户流失识别滞后、流失诱因无法量化定位、分层客户风险缺少量化评级、客户营收异动原因不明、挽留施策缺乏数据依据等核心痛点,帮助业务部门从 “凭经验判断客户好坏” 转向 “数据驱动客户生命周期精细化运营与流失前置干预决策”。 同时,该数据集的特征工程体系与 SQL 生成规范经过标准化处理,可为客户流失风控领域垂类大模型 Text-to-SQL 任务提供结构化标注训练样本,推动客户风控运营模式从 “人工逐条梳理台账统计” 向 “自然语言提问 + AI 自动取数分析” 智能化演进。该查询体系可横向复用至大客户运维、中小散客运营、续费续约管理、渠道代理商管控、会员体系流失监测等领域。1.数据清洗与标准化:按"问数需求+客户编号"去重,剔除重复语料;通过逻辑校验删除矛盾数据;保留"结果输出=无匹配数据"的样本,增强模型对数据缺失场景的处理能力,清洗后数据有效率≥98%。格式统一:统一时间格式、风险等级名称、SQL语法;对"客户行业"字段补全。 2.问题分类与结构化:从人力资源服务企业客户管理系统(如CRM、HRM系统)收集问数需求,按"基础统计类"(如"制造业客户总共有多少家")"风险评估类"(如"人员变化率超过负20%的客户有哪些")"对比分析类"(如"各行业的平均流失风险评分对比")"排名查询类"(如"人员流失率最高的前5家客户")等场景分类,标注"风险指标""查询类型"标签,确保覆盖人力资源服务行业客户流失风险管控90%以上核心问数需求,构建基础语料库。 3.核心算法建模:(1)语义解析与要素提取:采用"人力资源服务预训练模型(BERT-HRService)",对问数需求进行语义切分;通过命名实体识别提取专属要素(如"制造业"为"客户行业","负20%"为"变化率阈值"),要素提取准确率≥96%;(2)SQL生成与初步验证:基于"业务术语-字段名"映射规则,对简单问数调用预设SQL模板,对复杂问数用Seq2Seq模型生成多表关联SQL;生成后通过关联表结构校验,SQL语法正确率≥94%;(3)异常值检测:采用IsolationForest算法检测"风险评分<0""覆盖率>100%"等异常SQL,结合人力资源服务行业标准(如GB/T 32634-2016)核验"人员流失率是否在合理范围",异常语料过滤率≥99%;(4)逻辑核验与业务对齐:由资深人力资源服务管理人员对生成的问题-SQL-结果三元组进行最终核验。 4.语料库迭代优化:构建语料库的闭环迭代机制。新产生的业务问题及其经核验的SQL语句会定期注入语料库。同时,通过分析大语言模型在实际应用中的反馈(如查询失败、语义理解错误),定位语料库的薄弱环节并进行针对性补充,形成"应用-反馈-优化"的良性循环,持续提升语料库的覆盖度和质量。

创建时间:
2026-06-24
搜集汇总
数据集介绍
人资行业客户流失风险问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集基于公司客户经营台账,构建了覆盖统计、分布、占比、TopN、对比、阈值、趋势等七大查询场景的多维查询语料体系,将自然语言问数需求转化为标准SQL语句,用于人资行业客户流失风险分析,解决客户流失识别滞后、流失诱因无法量化、分层风险缺少评级等痛点,助力数据驱动的客户生命周期精细化运营与流失干预决策。数据集经过清洗、分类、算法建模与迭代优化,为垂类大模型Text-to-SQL任务提供结构化训练样本,推动客户风控从人工台账统计向自然语言提问与AI自动取数分析演进,并可横向复用至大客户运维、续费续约管理等场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务