遇见数据集

基于智水孪生的水质 COD 在线监测与评价数据集

收藏
天津市数据知识产权登记平台2026-07-14 更新2026-07-28 收录
官方服务:

资源简介:

一、数据收集与预处理 数据来源于城市污水管网主干管网8个关键节点的COD在线监测设备,采样频率5分钟/次。原始数据包含监测点位编号、监测位置类型、监测时间、原始COD浓度值,共计466,421条记录。预处理包括:时间字段特殊字符清理、时间戳格式统一转换、COD数值类型强制转换、缺失值识别与统计等。 二、多层校核数据清洗算法 设计并实现了包含自适应范围校核和逻辑一致性校核的五层校核规则体系,对每条数据赋予唯一质量标签和可信度权重: L1层 自适应范围校核(权重35%):采用分位数动态阈值方法,基于各监测点位历史数据独立计算P1、P5、P95、P99分位数,将数据分为正常、可疑、异常三级。该方法相比固定阈值能自动适应不同点位的水质特征。 L2层 时序一致性校核(权重25%):基于3σ原则计算相邻时刻COD变化率阈值,识别违背时间连续性的突变异常。各点位独立计算变化率均值和标准差,超过均值+3σ则判定为时序异常。 L3层 空间一致性校核(权重15%):基于管网拓扑关系,计算各点位COD均值的Z-score,评估各点位与整体管网的空间一致性。Z分数绝对值超过3则空间得分为0。 L4层 物理合理性校核(权重15%):基于污水COD物理边界检验,设定理论有效范围和设备量程。特别识别设备量程上限,共计3,571条,这些数据虽然设备有读数但并不代表真实浓度,需降低可信度。 L5层 趋势合理性校核(权重10%):基于污水管网水质的日周期变化规律,构建192个时段基线(8点位×24小时),计算每条数据与同点位同时段历史基线的Z-score偏差,评估其趋势合理性。 三、数据可信度权重模型 采用加权融合算法,综合五层校核得分计算每条数据的综合可信度权重(0-1之间)。基于可信度权重将数据分为五个质量等级A2级、A1级、B级、C级、D级:该权重体系可直接为数字孪生模型提供数据可信度依据,实现模型输入数据的质量控制。 四、智能数据修复算法 针对D级和缺失数据,采用基于高可信度数据的时段基线修复策略:优先使用同点位同时段的高可信度(≥0.7)数据均值进行修复,保留数据的日周期特征;若同时段无高可信度数据,则回退至点位高可信度均值。共修复6,748条数据,修复成功率100%。 五、特征工程与知识发现 基于修复后的高可信度数据,计算日统计表征指标:日均COD浓度、日最大/最小COD浓度、COD浓度波动系数(变异系数CV)。基于日均COD浓度依据GB 18918-2002标准进行水质污染等级自动评定。形成1,716条日统计评价记录,揭示了管网水质的时空变化规律。 六、数据处理成果 形成包含五个工作表的标准化数据集:主干管网COD监测数据(466,421条,含五层校核结果和可信度权重)、五层校核详情、日统计评价指标(1,716条)、数据质量汇总、监测点位信息。平均可信度权重0.911,推荐使用数据占比95.32%。

创建时间:
2026-07-03
搜集汇总
数据集介绍
基于智水孪生的水质 COD 在线监测与评价数据集 数据集图片
背景与挑战
背景概述
该数据集基于城市污水管网8个关键节点的COD在线监测设备,以5分钟/次的频率采集数据,经预处理后共包含466,421条原始记录。通过设计五层校核规则体系(自适应范围、时序、空间、物理及趋势合理性)对数据进行质量评估与清洗,并引入可信度权重模型将数据划分为A2至D五个等级,平均可信度达0.911。此外,采用智能修复算法对低质量及缺失数据进行修复,最终形成包含日统计评价指标、监测点位信息等五个工作表的标准化数据集,为城市排水管网运行监管、水质预警及污染控制提供数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务