遇见数据集

供应链支付偏好分析问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

本数据专为训练供应链行业支付偏好分析领域垂类大语言模型而构建。当前供应链企业日常需查询各支付方式分布、金额分桶、时间模式、累计趋势等数据,但依赖复杂窗口函数和子查询技能导致运营人员无法自主分析。支付偏好数据分散在各订单明细中,NTILE分桶和SUM OVER累计分析缺乏统一追踪,支付效率评估响应慢影响渠道优化决策。本数据产品采用Text-to-SQL技术路径,围绕客户订单信息表设计58种典型查询场景,覆盖NTILE金额分桶、DATE_FORMAT时间模式、SUM OVER累计窗口、相关子查询跨维度对比、COALESCE空值处理、CONCAT_WS信息组合等场景,生成高质量的问题-SQL-结果三元组训练语料。企业可基于本语料的指标名称问题查询等字段内容,适配自身数据表结构,快速启用文字转SQL功能进行复用。本数据产品作为稀缺的高质量垂直领域语料,对推动供应链支付分析智能化发展提供了有力支撑。1.数据清洗与标准化:按"问数需求+支付方式"去重,剔除重复语料;通过逻辑校验删除矛盾数据(如"支付金额<0""支付方式为空但有交易记录");保留"结果输出=无匹配数据"的样本,增强模型对数据缺失场景的处理能力,清洗后数据有效率≥98%。格式统一:统一金额精度(保留2位小数)、百分比格式(保留1位小数);对"支付方式"字段标准化(COALESCE补全空值),补全率100%。2.问题分类与结构化:从供应链企业支付管理系统收集问数需求,按"分桶类"(如"金额四分位分桶")"时间模式类"(如"支付方式小时分布")"累计类"(如"月度累计金额")"跨维度对比类"(如"高于支付方式平均的订单数")"空值处理类"(如"空值支付方式金额统计")"组合信息类"(如"支付信息组合摘要")等场景分类,标注"查询维度""窗口函数类型"标签,确保覆盖支付偏好分析90%以上核心需求,构建基础语料库。3.核心算法建模:(1)语义解析与要素提取:采用"供应链支付偏好分析预训练模型(BERT-PPA)",对问数需求进行语义切分;通过命名实体识别提取专属要素(如"支付方式"为字段名,"分桶"映射NTILE() OVER函数,"累计"映射SUM() OVER PARTITION BY函数,"高于平均"映射相关子查询,"空值"映射COALESCE函数,"小时"映射DATE_FORMAT函数),要素提取准确率≥96%;(2)SQL生成与初步验证:基于"业务术语-字段名"映射规则,对简单问数调用预设SQL模板,对复杂问数用Seq2Seq模型生成含NTILE() OVER分桶函数、SUM() OVER PARTITION BY累计窗口、COALESCE空值处理、DATE_FORMAT时间格式化、CONCAT_WS字符串组合及相关子查询的SQL;生成后通过建表结构校验,SQL语法正确率≥94%;(3)异常值检测:采用IsolationForest算法检测"分桶数异常""累计金额为负"等异常SQL,异常语料过滤率≥99%;(4)逻辑核验与业务对齐:由资深支付运营人员结合业务知识判断SQL逻辑是否正确。4.语料库迭代优化:构建闭环迭代机制。新产生的业务问题及经核验的SQL语句定期注入语料库,通过分析大模型实际应用反馈定位薄弱环节并针对性补充,形成"应用-反馈-优化"的良性循环,持续提升语料库的覆盖度和质量。

创建时间:
2026-07-08
搜集汇总
数据集介绍
供应链支付偏好分析问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集为供应链支付偏好分析领域构建的垂类大模型训练语料,采用Text-to-SQL技术路线,围绕客户订单信息表设计58种典型查询场景,覆盖NTILE金额分桶、DATE_FORMAT时间模式、SUM OVER累计窗口、相关子查询跨维度对比、COALESCE空值处理及CONCAT_WS信息组合等复杂SQL操作,生成高质量的问题-SQL-结果三元组。数据经过严格清洗与标准化,并采用BERT-PPA和Seq2Seq等模型进行语义解析与SQL生成,确保高质量和高准确率,可用于支持企业快速启用文字转SQL功能,提升供应链支付分析的智能化水平。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务