分享自:

运行调控工业循环冷却水中水质变量和基于朗格利尔饱和指数的结垢倾向状态的可预测性边界

期刊:Journal of Environmental Chemical EngineeringDOI:10.1016/j.jece.2026.125305

本研究由西安交通大学环境科学与工程系的马若欣、杨铎文、李继群和徐浩,以及ScienGreen (Shandong) Environmental Technology Co. Ltd.的田敏格共同完成。论文发表于 Journal of Environmental Chemical Engineering 第14卷,文章编号125305,于2026年9月29日在线发表。徐浩为通讯作者。

该研究属于工业水处理与环境机器学习交叉领域,聚焦工业开式循环冷却水系统中水质变量和结垢趋势的可预测性边界。循环冷却水在蒸发浓缩、补排水、化学加药和负荷波动的共同作用下,日常化验数据呈现强噪声、操作调控和非平稳特征,这使得面向自然水体或市政污水开发的预测框架难以直接迁移。研究的核心目标是建立一个过程知情的分层框架,系统识别哪些水质变量可以从同步水化学状态中重建,哪些变量保留可学习的时间结构,以及在连续数值预测不可靠时,如何以状态识别方式表征基于Langelier饱和指数的结垢趋势。

研究数据来自某工业开式循环冷却水系统的426条日化验记录,包含总硬度、钙硬度、总碱度、氯化物、电导率、pH、浊度、铁和余氯共九个变量。数据缺失以连续区间为主,缺失原因涉及化验频次、现场中断和运行扰动。针对不同建模任务,研究采用了分层预处理策略:静态重建任务中删除任何关键变量缺失的记录,保留411条同步完整样本;基于手工时序特征的随机森林任务中,对连续缺失区间进行线性插值以保证等间隔时间轴;长短期记忆网络任务中,先使用局部加权散点平滑识别并剔除超过两倍标准差的异常点,再插值填补,然后进行最小-最大归一化,最后用Savitzky-Golay滤波抑制高频噪声。Langelier饱和指数计算中,总溶解固体由电导率乘以0.65的经验系数估算,水温固定为30摄氏度。相对状态标签的阈值仅由训练集分布的第33和第66百分位数确定,避免测试集信息泄漏。

研究流程包含三个互补层次。第一层为基于随机森林的静态同步重建,以九个变量中的每一个依次作为响应变量,其余八个同时间测定的变量作为解释变量,建立九个独立的随机森林回归模型,用于评估变量间的同步非线性耦合和信息冗余。第二层为一步超前时间预测,包括基于手工构造特征的传统随机森林模型和去噪辅助的长短期记忆网络模型。手工特征包含目标变量在t-1、t-3和t-7的滞后项、其余八个变量在t-1的值、7日移动均值和移动标准差,以及月份、星期和年内日等日期特征;长短期记忆网络采用两层堆叠结构,每层50个隐藏单元,输入窗口为3日,预测时域为1日。第三层为Langelier饱和指数的连续回归和状态分类。间接回归路径将各子参数的一日超前预测值代入Langelier公式;直接回归路径将Langelier饱和指数作为独立序列进行端到端预测。状态分类任务中,固定物理阈值的时间切分和分层抽样作为两个基线模型,改进模型采用系统相对分位数标签并配合合成少数类过采样技术缓解类别不平衡。回归性能以决定系数和均方误差评价,分类性能以准确率、宏F1分数、高结垢状态召回率及混淆矩阵评价。

静态重建结果显示明显的分层特征。钙硬度、总硬度、电导率和氯化物形成高可重建组,决定系数分别达到0.9705、0.9654、0.9206和0.8918,共同反映蒸发浓缩过程中硬度离子和保守离子的协调变化。特征重要性分析表明总硬度与钙硬度之间存在最强的互解释关系,电导率的主要贡献变量为总硬度和氯化物。铁和总碱度为中等可重建变量,决定系数分别为0.4314和0.3347。pH、余氯和浊度构成低可重建组,决定系数仅为0.0090、0.0131和0.1113,说明这些变量的变化主要受加药调节、局部腐蚀和颗粒扰动等独立过程控制。

基于手工时序特征的随机森林预测中,仅氯化物获得了可靠性能,测试集决定系数为0.8300,均方误差为691.84。氯化物作为保守离子,其浓度主要取决于补水、蒸发浓缩和排污,历史滞后项具有明确物理意义。相比之下,pH的测试集决定系数为-47.65,浊度为-1.20,铁、余氯和总碱度也均为负值,表明固定滞后特征无法表示操作反馈和事件驱动的动态过程。值得注意的是,电导率、钙硬度和总硬度在静态重建中表现优异,但在时序预测中决定系数接近零或为负,说明同步水化学耦合不能直接转化为稳定的时间外推能力。

经过多阶段去噪后,长短期记忆网络对积累主导变量的预测显著改善。电导率、钙硬度、氯化物和总硬度的测试集决定系数分别达到0.8958、0.8883、0.8407和0.8045。浊度、铁和余氯的测试集决定系数也分别提升至0.7091、0.7354和0.7229,显示扰动并非完全随机,短时持续性仍可被提取。pH的决定系数从-47.65提升至0.6277,总碱度从-0.7143提升至0.2866,但局部峰谷转变仍未充分恢复,因为这两个变量直接响应加酸加碱、补水和碱度调节,而这些操作变量未包含在输入中。

连续Langelier饱和指数回归中,间接路径的预测曲线明显平滑,未能重现真实序列的频繁短时波动和峰谷变化。一次替换分析表明,将预测pH替换为观测值可使Langelier饱和指数均方根误差降低46.1%,总碱度和钙硬度的替换降幅分别为22.0%和15.4%,而电导率的替换几乎无影响。直接路径虽然避免了多子模型误差的逐步传播,但整体性能仍无实质提升,误差主要集中在-0.2至+0.3之间,峰谷区间偏差更为突出。

状态分类结果显示,固定物理阈值下的两个基线模型均存在严重的类别分布问题。时间切分基线模型的测试集无低状态样本,准确率为0.76但宏F1仅为0.49;分层抽样基线模型的测试集无中高状态样本,0.96的准确率仅反映对主导低状态类别的识别。改进模型采用训练集分位数阈值并配合过采样后,准确率和宏F1均达到0.72,高Langelier饱和指数状态的精确率、召回率和F1分数分别为0.77、0.83和0.80,测试集三个状态的样本数分别为28、28和29。多数误分类发生在相邻状态之间,仅一个高状态样本被直接判为低状态,表明分类不确定性主要集中在相邻状态边界。

研究的核心结论是,工业循环冷却水的可预测性由过程动态、信息可得性和预测目标设定三者共同决定。积累主导变量在去噪后可由长短期记忆网络可靠预测;受操作调控的pH和总碱度因缺少加药和排污等驱动变量而预测受限;连续Langelier饱和指数回归无法可靠再现转变区间,但将目标重构为系统相对状态识别后,高状态F1分数达到0.80。该方法论贡献在于将过程变量表征、分层可预测性评估和建模目标重构整合为一个统一框架。

研究的局限包括:数据来自单一工业系统,跨系统、跨季节和跨工况的可迁移性尚未验证;数据集未包含化学加药、排污、补水水质和生产负荷等关键操作驱动变量;插值和去噪可能削弱短时扰动;Langelier饱和指数仅表征热力学结垢倾向,未与实际沉积或传热恶化直接验证;固定水温和电导率估算总溶解固体引入了不确定性。未来研究应整合高频监测、操作控制记录和直接结垢性能测量,并开展多系统前瞻性验证。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com