本文所评述的研究由中国科学院南京地理与湖泊研究所流域地理科学重点实验室的刘凯(Kai Liu)与宋春桥(Chunqiao Song)完成,宋春桥为通讯作者。该研究成果发表于 Journal of Hydrology 第604卷,文章编号127260,于2021年11月30日在线发表,2022年正式刊出。
湖泊存储了地球表面约87%的液态淡水,是人类活动的主要水源,并提供关键的生态系统服务。湖泊水深(lake bathymetry)作为湖泊属性的核心组成部分,决定了湖泊的深度和蓄水量,并在湖泊富营养化控制、湖泊水动力模拟及沉水植物评估等研究中具有基础性作用。获取精确可靠的湖泊水下地形数据最直接的方法是使用船载声纳或无人机搭载声纳进行水文测量,但此类方法耗时费力,难以在大尺度区域推广。机载激光雷达在水深测绘中虽有一定应用,但其最大探测深度通常不足两倍塞氏盘深度(Secchi depth),难以适用于深水或高浊度内陆水体。近年来虽有研究尝试利用光学影像和卫星测高进行湖泊水深反演,但该方法仅在间歇性淹没区域有效,对于常年积水区域的水下地形获取仍面临巨大挑战。
为克服上述困难,一些空间预测与建模方法被提出,试图利用湖泊周边出露地形来推断水下地形。已有研究对地形变量与湖泊水深及容积之间的关系进行了较为深入的探讨,为区域乃至全球尺度的湖泊水深与水量估算奠定了基础。然而,这类估算在特定湖泊或局部尺度上的不确定性和潜在偏差不可忽视。对单个湖泊而言,利用周围地形坡度进行线性外推是一种较为简便的解决方案,但预测的永久积水区域水深通常不够真实。少量研究表明,有限数量的实地水深测量数据对于约束外推精度不可或缺。因此,亟需发展一种在仅获取有限实地测量的可行条件下、具有优化地形变量集的有效空间建模方法。
本研究的目标是开发仅依赖一至两条水深测量路线、而非全湖覆盖测量的稳健湖泊水深建模方法,从而大幅节省区域湖泊调查的人力与经济成本,尤其是针对青藏高原(Tibetan Plateau, TP)这类海拔高、可达性差的偏远地区。青藏高原拥有超过1600个面积大于1平方公里的湖泊,总面积约5万平方公里,占中国湖泊面积的约60%,但绝大多数湖泊缺乏实测水深数据。
研究选取了青藏高原12个具有代表性的湖泊作为建模测试对象,这些湖泊面积从99.75平方公里到967.77平方公里不等,均分布于海拔4000米以上区域。所选湖泊在湖泊面积、形态、周边地形及平均水深等方面具有多样性,以验证所提方法的应用稳健性。研究使用的实测水深数据来源于已发表文献中的测量数据或等深线图,其中部分湖泊的完整实测水深数据被用作模型验证的参考真值。此外,研究使用了MERIT DEM(Multi-Error-Removed Improved-Terrain DEM)作为描述湖泊周边出露地形的数字高程模型数据。选择MERIT DEM的原因在于:其数据源主要为2000年获取的SRTM DEM,而青藏高原多数湖泊自2000年以来经历了显著扩张,因此该DEM能够捕捉更多出露区域;其在青藏高原具有较高的精度,均方根误差(RMSE)仅为8.60米;且数据格式为浮点型,避免了整型数据带来的精度损失。所有栅格数据均重采样至90米空间分辨率。
该方法的核心思想是将湖泊周边出露地形向水下区域进行空间延伸,并以实地水深测量作为约束。其实现包含两个关键步骤。
第一步是湖泊几何特征的概化,生成用于水深重建的地形骨架。该骨架由两部分组成:一条沿湖泊长轴方向的中心线(centerline),该中心线被推荐作为水深测量路线;以及多条从湖泊两侧周边地形延伸而来的横断面(cross section)。湖泊中心线通过确定长轴两端的起点和终点、利用欧氏分配算法将湖泊划分为两个弧形区域、并取两区域的共享边界而生成。对于每个沿湖岸线的采样像元,搜索其距离中心线最近的像元,连接两像元并向出露地形方向延伸一定缓冲距离,即可生成一系列近似垂直于中心线的横断面。横断面间距和岸线缓冲距离是该方法的两个关键参数,本研究初始设置横断面间距为10个像元、缓冲距离约为600米。
第二步是对横断面上未测采样像元的水深进行空间预测。每条横断面包含三类像元:缓冲区内出露地形像元、待预测的水下像元、以及具有已知水深的中心线像元。水下像元预测包括两个子步骤:首先假定湖泊周边地形的坡度值可近似代表淹没区域的坡度,通过对陆域像元进行多项式拟合计算缓冲区内梯度,并利用该梯度沿横断面预测高程剖面;其次,预测值低于实测值的部分被截断,以符合平底形态的几何特征。若实测像元低于横断面上所有预测像元,则改用陆域像元与实测像元之间的线性插值来生成谷坡。
该方法基于XGBoost(Extreme Gradient Boosting)算法,通过建立已知水深像元与多个地理空间变量之间的决策规则来预测未知水下区域的水深。其实现同样包含两个步骤。
第一步是训练样本与预测样本的构建。沿水深测量路线的实测像元被作为训练数据。与基于骨架的插值方法不同,机器学习方法不要求测量路线必须沿湖泊长轴布置。预测数据以固定距离间隔进行空间采样,本研究中间隔设为10个像元。
第二步是基于XGBoost算法建立预测模型。XGBoost是一种集成众多回归树的提升树模型,通过迭代添加树来实现特征分裂,每棵树包含若干叶节点,每个叶节点对应一个得分,最终预测值为所有树中对应得分之和。从数学角度看,每增加一棵树即生成一个新函数以拟合上一棵树的残差。模型的输入变量包括两类:每个训练或预测像元到湖泊岸线的空间距离,以及出露地形缓冲区内的一组地形变量。具体设计了10个变量:到最近岸线像元的距离,以及在三种不同缓冲区宽度设置(300米、600米和1200米)下分别计算的平均坡度、平均高程差和高程梯度。需要说明的是,由于DEM分辨率和栅格化处理的限制,实际生成的缓冲区宽度并非始终精确等于目标宽度,本研究采取从湖岸线向陆地方向扩展直至距离最接近目标缓冲区宽度的方式生成缓冲区。此外,模型的学习率、最大树深度、子采样率和正则化系数等超参数通过逐步网格搜索策略进行调优。
获得各预测点的高程值后,研究构建了基于不规则三角网(TIN)的表面,并通过自然邻域插值将其转换为栅格化湖泊水深DEM。对每个湖泊随机选取约1000个像元作为验证数据集。研究计算了平均绝对误差(MAE)和均方根误差(RMSE)两项指标来评估预测水深的垂直精度,并采用bias_d和bias_v两个指标来评估基于建模水深估算的湖泊平均深度和总蓄水量的相对偏差。
对12个湖泊的水深重建结果显示,两种方法均能提供可接受的水下地形估算,与实测数据对比的总体平均决定系数(R²)约为0.70。机器学习方法(XGBoost)的总体表现更为可靠,所有湖泊案例的蓄水量估算偏差均小于20%,具体范围为1.38%至19.49%。相比之下,基于骨架的插值方法的蓄水量偏差相对较高,其中赤布张错(Chibuzhang Co)的蓄水量被高估了24.57%,而郭扎错(Guozha Co)的bias_v为-34.33%,表明存在严重低估。所有精度指标(包括bias_d、bias_v和线性拟合方程的斜率值)均表明,机器学习方法重建的水深有可能被系统性低估,这可能是由于对湖泊最深水下区域的定义不准确,导致训练数据集中深水样本的代表性不足。
值得注意的是,基于骨架的插值方法在特定湖泊类型上优于机器学习方法。对于狭长形态的湖泊,如库赛湖(Kusai Lake)和当惹雍错(Tangra Yumco),骨架法的R²值分别为0.83和0.82,高于机器学习方法的0.79和0.65。尤其是当惹雍错,骨架法的MAE为19.04米,明显低于机器学习方法的29.90米。这一结果验证了骨架法在建模狭长型湖泊水下地形方面的优势,其根本原因在于该方法以湖泊长轴中心线为基础构建横断面,能够更好地捕捉狭长湖泊的地形结构。反之,对于圆形度较高的湖泊,如鄂陵湖(Eling Lake)和玛旁雍错(Manasarovar Lake),机器学习方法的优势更为突出。
研究进一步评估了缓冲距离和横断面间距两个参数对骨架法结果的影响。缓冲距离范围从300米到1500米,间距从2个像元变化到22个像元。结果显示,缓冲距离的影响在不同湖泊间差异显著。例如,阿克赛钦湖(Aksai Chin Lake)、扎日南木错(Zhari Nam Co)和当惹雍错的RMSE随缓冲距离增大而呈上升趋势,而郭扎错和龙木错(Longmu Co)则呈现相反趋势。郭扎错是一个典型案例:在600米缓冲距离设置下其水深被严重低估(bias_v小于-30%),而由于该湖周围环绕高山,增大缓冲距离可生成坡度更大的预测剖面,从而减小低估程度。横断面间距的影响方面,大多数湖泊的RMSE随间距增大而呈下降趋势,赤布张错、鄂陵湖、塔若错(Taro Co)和库赛湖的下降趋势尤为显著。这主要与横断面生成呈现凹形特征有关,采样间距增大可能导致部分深度信息丢失,进而降低整体的过度估计倾向。
研究以当惹雍错、玛旁雍错和龙木错为例,探讨了沿湖泊短轴布设测量路线对机器学习方法性能的影响。每个湖泊生成10条潜在短轴测量路线,分为两组,每次实验从每组中随机选择2条路线组成训练数据集,共进行25次不同路线组合的实验。结果表明,两条短轴路线的总长度除玛旁雍错因圆形度高而例外外,均明显短于沿长轴中心线的单条路线长度。测量策略的改变显著减少了野外工作量,同时也带来一定的建模性能不确定性。大多数湖泊的估算蓄水量偏差仍保持在25%以内。考虑到测量长度较中心线路线大幅缩减,这一精度损失是可接受的。实验证明了机器学习方法的灵活性和稳健性,能够在野外测量效率和建模精度之间取得良好平衡。然而,少数案例(如郭扎错)表明测量路线设计的影响不可忽视,建议避免将测量路线布设在远离湖泊中心区域的湖湾角落。
研究以扎日南木错为例,将重建的水深数据与全球地表水(GSW)数据集的年度湖泊范围及湖泊水位数据相结合,重建了1990至2020年间的湖泊蓄水量变化。结果显示,扎日南木错湖面积从984.20平方公里扩张至1053.35平方公里。长期蓄水量估算呈现三个明显阶段:20世纪90年代湖泊蓄水量从18.22 Gt降至17.18 Gt,损失约6%的水量;2000年前后达到最小值后,2000至2016年蓄水量以年均0.15 Gt/y的速率缓慢增长;2016年以来蓄水量进入快速增长期,年均速率达0.75 Gt/y。过去30年湖泊蓄水量累计增加了25%。这一大幅水量增加不可避免地导致了水化学特征的显著变化。根据20世纪80年代的测量记录和2020年8月的实地采样,扎日南木错的盐度(salinity)从11.64 g/L下降至8.61 g/L,降幅达24%,显示出水量稀释效应。
本研究针对湖泊水深测量成本高、效率低的挑战,提出了两种新颖的建模方法——基于骨架的插值方法和基于XGBoost的机器学习方法,以少量水深测量数据为约束进行湖泊水下地形建模。两种方法的技术实现手段不同,但均基于水下地形与湖泊周边出露景观之间的地貌相似性原理。基于骨架的插值方法通过将湖岸坡度向水下区域延伸来预测水下地形,而机器学习方法则通过建立实测水深与对应地理空间变量之间的隐式规则来实现空间预测。
在青藏高原12个具有恶劣野外调查环境的典型湖泊上的测试表明,两种方法均能生成可接受的水深图,总体平均R²约为0.70。机器学习方法在大多数湖泊案例中表现更优,其估算的湖泊蓄水量偏差均小于20%,显示出在大规模湖泊蓄水量估算中的巨大潜力。然而,基于骨架的插值方法在狭长型湖泊上仍具有不可替代的优势。研究为湖泊水深重建提供了一种实用方法,尤其适用于偏远和数据稀缺地区。重建的水深数据有望显著提升对无资料湖泊的长期和高频水资源监测能力,同时为深入理解湖泊对气候变化的响应机制提供了关键数据基础。
本研究的主要创新点体现在以下几个方面:其一,提出了仅需一至两条测量路线即可实现湖泊水深稳健重建的方法框架,大幅降低了野外调查成本,对于青藏高原等极端环境地区具有极高的实用价值;其二,系统比较了基于地貌延伸的骨架插值方法与基于机器学习决策规则的空间预测方法在不同湖泊形态条件下的适用性,明确了两种方法的适用场景和优劣势;其三,通过参数敏感性分析和测量路线设计实验,深入揭示了关键参数和采样策略对建模精度的影响规律,为方法的实际应用提供了指导;其四,展示了重建水深数据在湖泊长期蓄水量变化和盐度响应研究中的应用潜力,为无资料湖泊的水文与生态研究开辟了新的途径。