环卫车辆运维问数垂类大模型语料数据
收藏资源简介:
数据来源于环卫车辆运维管理记录,涵盖车辆编号、车辆类型、计划作业里程、实际作业里程、标准百公里油耗、总油耗、应出勤天数、维修停驶天数、维修次数、维修金额、保养次数等核心字段。 通过构建自然语言问数解析模型与SQL生成校验机制,将运维管理人员的自然语言查询转化为可执行的标准SQL语句并输出精确结果,覆盖油耗监测、维修统计、里程追踪、保养提醒等核心运维场景。 解决环卫行业车辆油耗管理粗放导致运营成本不透明、维修停驶缺乏量化监控影响运力调度、车辆保养依赖经验判断导致故障频发等核心痛点。 该数据集可为环卫车辆运维领域的垂类大模型提供结构化训练样本,推动行业从"人工台账统计"向"自然语言问数+AI自动生成"演进,同时可横向复用至物流运输、公交运营、工程车辆管理等车辆运维场景。 1.数据采集与清洗:以母公司环卫车辆运维业务数据为来源,以业务(含车辆类型、维修保养记录、油耗数据、运行里程、故障状态、出勤管理等16个业务字段)为基准表,采集该表覆盖的各类问数需求数据,经交叉校验确保数据一致性,清洗后数据有效率≥98%。 2.维度分类与标注:按业务查询维度进行分类标注,标注查询维度标签、问数需求类型等分类信息,构建覆盖车辆运维核心查询场景的语料基础库,语料以"问数需求-SQL查询-结果输出"三元组结构组织。 3.核心算法:本语料面向大语言模型对于环卫车辆运维场景的微调训练需求,按以下流程构建: (1)语料特征工程与语义解析:对问数需求进行语义结构化分析,提取查询目标、筛选条件和统计维度等核心要素,要素提取准确率≥90%; (2)查询逻辑构建与三元组生成:基于查询要素构建标准化的查询逻辑链路,生成对应的SQL查询语句和结果输出,形成"问数需求-SQL查询-结果输出"三元组语料结构; (3)结果输出与验证:将查询结果组织为结构化输出,与问数需求进行一致性核验,确保输出结果准确反映问数意图; (4)异常检测与质量过滤:对查询要素不完整、逻辑矛盾、统计口径不一致等异常情况进行识别和过滤,异常过滤率≥99%,同时通过结果核验正确率和人工核对正确率双维度进行质量校验。 4.独立语料训练优势:本语料聚焦环卫车辆运维单一业务领域,与通用环卫语料相比存在显著差异:第一,车辆运维涉及设备参数、维修标准、故障码、油耗模型等大量专业领域词汇,通用语料中此类词汇出现频率极低,若合并训练,领域专有特征的表达权重会被稀释,导致模型在车辆运维细分场景下的查询理解能力下降;第二,车辆运维问数具有明显的业务逻辑特征,如"维修金额超阈值""百公里油耗异常""出勤率偏低"等,这些业务逻辑判断需要专门的语料支撑,独立训练可确保车辆运维领域查询语义的专注度和深度,提升大模型在该细分场景下的查询逻辑准确率;第三,从市场化运用角度看,环卫车辆运维管理是环卫行业的刚性需求,独立语料有利于形成垂直领域的专业化服务能力,更好地满足环卫企业精细化管理的实际业务需求。




