遇见数据集

健康体检套餐价格配置问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据面向体检行业“套餐价格体系复杂、机构间价格不可比、低价高价异常难以及时发现、服务配置与价格缺少统一分析口径”的经营治理痛点,可用于训练健康体检套餐价格配置问数垂类大语言模型。模型能够理解套餐类别、价格带、机构类型、住宿配置、问卷费用配置、提前预约天数、预约人数配置和启停状态之间的业务关系,支持“某类套餐在不同机构类型下的价格区间”“高价套餐是否具备相应服务配置”“低价启用套餐是否存在异常”“问卷费用或住宿配置对均价的影响”等自然语言问数。该语料可帮助体检平台建立跨机构可比的价格基准,支撑套餐定价复盘、价格异常预警、服务内容与价格匹配审核和市场竞争力评估;对医院合作和企业团检采购场景,可提升价格透明度,减少人工比价成本,推动体检套餐从经验定价转向可查询、可追溯、可评估的精细化定价治理。1.数据清洗与标准化:数据清洗以“套餐编码+价格配置”为业务粒度,套餐价格统一为人民币元并保留两位小数,价格带统一划分为500元以下、500-999元、1000-1999元、2000-3999元、4000元及以上;住宿配置、问卷费用配置、启停状态、预约人数配置和提前预约天数统一为标准枚举或分组。敏感信息加密:套餐、机构均使用脱敏编码,不输出机构名称、套餐名称、联系人等明文信息。 2.问题分类与结构化:按照套餐价格配置治理场景归类为价格带结构分析、套餐类别价格区间、高价套餐配置排名、低价套餐治理分析、住宿服务价格分析、问卷费用价格分析、预约人数配置价格分析和提前预约价格分析,确保覆盖套餐定价复盘、异常价格识别、服务内容与价格匹配审核和跨机构价格对标。 3.核心算法建模:(1)语义解析与要素提取:重点抽取套餐类别、机构类型、价格带、价格阈值、住宿配置、问卷费用配置、预约人数配置分组、提前预约分组、启停状态、排名方向和TOP N条件。(2)SQL语句生成:均价、最低价、最高价分别采用AVG(package_price)、MIN(package_price)、MAX(package_price);套餐数量采用COUNT(DISTINCT package_code);低价治理采用CASE WHEN package_price<100 THEN 1 ELSE 0 END统计异常低价;高价排名必须按套餐编码GROUP BY后按package_price降序排序。(3)异常值检测:校验套餐价格不得为负,价格带必须与实际金额区间一致,预约人数配置不得为负,提前预约天数不得明显异常;禁止把价格配置口径与订单成交金额、销量或真实需求热度混用。(4)逻辑核验与业务对齐:由定价运营或医院合作人员核验问题-SQL-结果三元组是否符合“价格配置、服务配置、套餐状态、机构对标”的业务链路,确保输出可用于定价治理而不是误导为收入分析。 4.语料库的持续迭代:新增语料优先补充低价启用、高价服务配置不足、住宿高价、问卷费用异常、提前预约天数异常、同类套餐机构间价格差异大等场景;根据模型错误反馈持续扩充“均价、价格区间、低价异常、高价套餐、价格带、服务配置、预约人数配置”等同义表达词典。

创建时间:
2026-06-17
搜集汇总
数据集介绍
健康体检套餐价格配置问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集面向健康体检行业,针对套餐价格体系复杂、机构间价格不可比、异常价格难以及时发现等经营治理痛点,专门用于训练健康体检套餐价格配置问数垂类大语言模型。模型可理解套餐类别、价格带、机构类型、住宿配置等业务关系,支持价格区间查询、高价服务配置匹配、低价异常识别等自然语言问数,辅助体检平台建立跨机构可比的价格基准,推动套餐定价的精细化治理。数据集包含约5000条脱敏数据,涵盖价格带结构分析、异常价格检测等场景,并按需更新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务