遇见数据集

人资业客户合作问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

原始数据来源于公司为企业提供第三方人力资源服务业务中的合作数据。 通过构建"客户规模-业务类型-地域分布-合作周期"多维查询语料体系,将自然语言问数需求转化为标准SQL查询语句,覆盖统计类、分布类、占比类、TopN类、对比类、阈值类、趋势类等七大查询场景。 该数据集解决人力资源服务行业客户合作分析门槛高、依赖专业SQL技能、多维度数据分散导致跨表查询困难、业务人员无法自主获取客户合作数据等核心痛点,帮助人力资源服务企业从"技术依赖"转向"自然语言交互"。 同时,该数据集的特征工程体系与SQL生成规范经过标准化处理,可为人力资源服务领域的垂类大模型Text-to-SQL任务提供结构化训练样本,推动行业从"人工编写SQL"向"自然语言+AI"演进。该查询体系可横向复用至劳务派遣、人事代理、灵活用工、企业外包等领域,为全行业建立统一的智能查询标准。1.数据清洗与标准化:按"问数需求+查询维度"去重,剔除重复语料;逻辑校验删除矛盾数据(如"合作企业数<0""合作年限<0");保留"结果输出=无匹配数据"样本,清洗后有效率>=98%。统一时间格式(YYYY-MM-DD)、字段命名(snake_case)、地区编码;项目类型补全率100%。 2.问题分类与结构化:按统计类、分布类、占比类、TopN类、对比类、阈值类、趋势类七大场景分类,标注"查询类型""目标维度"标签,覆盖人力资源服务行业90%以上核心问数需求。 3.核心算法建模:(1)语义解析:采用BERT-HRS预训练模型对问数需求语义切分,命名实体识别提取要素(如"2025年"→cooperation_start_year),提取准确率>=96%;(2)SQL生成:基于"业务术语-字段名"映射,简单问数调用预设模板,复杂问数用Seq2Seq生成多条件SQL,语法正确率>=94%;(3)异常检测:IsolationForest检测异常SQL,结合GB/T 33529-2017标准核验合规性,过滤率>=99%;(4)逻辑核验:业务专家终审问题-SQL-结果三元组,确保业务适用性。 4.语料库迭代:新核验SQL定期注入语料库,分析模型反馈定位薄弱环节,形成"应用-反馈-优化"闭环,持续提升覆盖度与质量。

创建时间:
2026-06-24
搜集汇总
数据集介绍
人资业客户合作问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集基于第三方人力资源服务业务中的合作数据构建,通过“客户规模-业务类型-地域分布-合作周期”多维查询体系,将自然语言问数需求转化为标准SQL语句,覆盖统计、分布、占比、TopN、对比、阈值、趋势等七大查询场景。它旨在降低客户合作分析门槛,减少对专业SQL技能的依赖,帮助业务人员自主获取数据,并为人力资源服务领域的垂类大模型提供Text-to-SQL训练样本。数据经过清洗与标准化、问题分类、核心算法建模(如BERT-HRS语义解析和SQL生成)及语料迭代,确保高质量与适用性,并可横向复用至劳务派遣、人事代理、灵活用工等领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务