健康体检套餐适用规则治理问数垂类大模型语料数据
收藏资源简介:
该数据面向体检行业“套餐适用规则不统一、特殊人群提示依赖人工、跨机构套餐上架审核难追溯”的共性痛点,可直接用于训练健康体检套餐适用规则问数垂类大语言模型。模型通过学习适用性别、婚姻状态、孕妇适用状态、年龄上下限、套餐类型、启停删除状态和机构类型之间的查询关系,能够把“哪些女性专项套餐仍允许孕期使用”“男性套餐的孕妇口径是否全部为不适用”“某类机构停用未删除套餐有哪些”等业务问题自动转成SQL。对体检平台而言,该数据可支撑套餐上架前规则核验、特殊人群适检提示、套餐主数据质量巡检和机构规则配置对标;对医院体检中心和企业团检服务商而言,可减少套餐适用条件错配、降低前台咨询和售后争议,提高套餐供给的标准化、可审计性和预约前风险提示能力。1.数据清洗与标准化:数据清洗以“套餐编码+体检机构编码”为业务粒度,统一套餐类别、机构类型、适用性别、婚姻状态、孕妇适用状态、套餐类型、启停状态和删除状态枚举;年龄上下限统一为整数,年龄跨度按0-20岁、21-50岁、51岁及以上分组。敏感信息加密:套餐和机构均采用脱敏编码,不输出套餐原始名称、机构原始名称、联系人、电话等可识别信息;套餐名称仅用于类别归并。格式统一:问题中的“女性套餐、男士套餐、孕妇能不能用、年龄限制、停用套餐、已删除套餐、规则配置最多”等表达映射为标准字段和枚举值。 2.问题分类与结构化:按照套餐适用规则治理场景归类为适用性别规则分布、婚姻状态规则分布、孕妇适用规则分析、年龄跨度规则分析、启停删除状态治理、适用规则组合分析、机构规则配置排名和套餐类型规则分析,确保覆盖套餐上架审核、特殊人群适检提示和跨机构规则对标。 3.核心算法建模:(1)语义解析与要素提取:重点抽取机构类型、套餐类别、适用性别、婚姻状态、孕妇适用状态、年龄跨度、套餐类型、启停删除状态、排名方向和TOP N条件。(2)SQL语句生成:套餐数量采用COUNT(DISTINCT package_code),规则记录数采用COUNT(*);年龄边界场景输出MIN(age_min)、MAX(age_max);机构规则配置排名必须按institution_code分组后再ORDER BY package_count或category_count;所有查询不得把WHERE过滤字段与GROUP BY字段重复使用。(3)异常值检测:校验年龄下限不得大于年龄上限,男性专属套餐的孕妇适用状态必须为“不适用”,启用且已删除、停用但仍参与上架审核等组合进入治理样本;样本支持量必须等于SQL WHERE条件对应的底层记录数。(4)逻辑核验与业务对齐:由套餐运营或体检业务人员核验问题-SQL-结果三元组是否符合“人群适用条件、套餐有效状态、机构配置差异”的业务链路,避免把规则配置口径误解释为真实预约成交结果。 4.语料库的持续迭代:新增语料优先补充孕期禁用、男性不适用、年龄边界冲突、停用未删除、机构套餐规则配置差异大等高风险场景;根据模型错误反馈持续扩充“孕妇可用、孕期适用、男士套餐、年龄限制、停用、删除、规则冲突”等同义表达词典,并定期复核套餐规则枚举和业务口径。




