健康体检预约订单问数垂类大模型语料数据
收藏资源简介:
该数据可用于训练健康体检预约订单问数垂类大语言模型,使其能够深度理解体检预约运营中关于订单月份、体检月份、体检星期、体检机构、套餐类别、预约状态、支付状态、号源类型和订单金额的自然语言查询,并准确转化为SQL。依托 `dwd_exam_reservation_order_fact` 表中的 `order_code`、`order_month`、`exam_month`、`exam_weekday`、`institution_code`、`institution_type`、`package_code`、`package_category`、`appointment_status`、`payment_status`、`source_type`、`order_amount` 等字段,模型可回答“某月预约订单数是多少”“不同机构类型支付率如何”“周几体检预约最多”“哪些套餐类别取消率较高”“公共号源订单平均金额是多少”等预约经营问题。平台运营人员可基于该语料快速生成预约日报、状态分布、套餐运营复盘、体检日期热度分析和号源结构分析,减少人工从订单表、明细表、机构表和套餐表反复汇总的成本。本数据1.数据预处理:对预约订单编码、订单月份、体检月份、体检星期、机构类型、套餐编码、套餐类别、预约状态、支付状态、号源类型和订单金额进行清洗标准化。统一月份格式为 `YYYY-MM`,统一预约状态和支付状态字典,剔除删除记录、金额负值记录和关键字段缺失记录,体检星期由体检日期标准化得到。 2.问题收集与分类:从预约运营、订单日报、套餐复盘、号源分析和经营管理场景中收集问题,按预约订单规模、月度预约趋势、机构类型预约、套餐类别预约、预约状态结构、支付完成订单、取消订单、体检星期分布、平均订单金额、号源预约结构、支付率和取消率等类别整理语料。 3.核心算法建模:构建“语义解析-查询生成-异常检测-逻辑验证”全流程算法体系。 (1)语义解析与结构化:将“本月”“某月”“体检星期”“机构类型”“套餐类别”“预约状态”“支付完成”“取消预约”“公共号源”等表达映射到 `order_month`、`exam_weekday`、`institution_type`、`package_category`、`appointment_status`、`payment_status`、`source_type` 字段。 (2)SQL生成与初步验证:订单数采用 `COUNT(order_code)`,支付完成订单数和取消订单数采用条件聚合,平均订单金额采用 `AVG(order_amount)`,支付率和取消率按订单总数计算。按月份、体检星期、机构类型、套餐类别、预约状态、支付状态和号源类型进行分组。 (3)异常值检测:检测订单金额是否为负,检测支付率和取消率是否超出0-100%,检测取消订单是否被错误计入有效支付完成,检测体检月份和订单月份是否存在异常时间跨度。 (4)逻辑核验与优化:由预约运营人员核验订单、机构、套餐、号源、状态和金额口径是否一致,确保查询结果能直接用于预约运营日报和经营复盘。 4.语料库迭代优化:根据模型在预约订单问数中的实际反馈,持续补充高取消套餐、低支付机构、热门体检星期、高订单月份和公共号源样本。该算法规则确保本语料数据能够为健康体检预约运营问数垂类大语言模型提供专业、准确、可复用的训练支撑。




