分享自:

FSVLM:一种用于遥感农田分割的视觉语言模型

期刊:IEEE Transactions on Geoscience and Remote SensingDOI:10.1109/TGRS.2025.3532960

研究报告:基于视觉-语言模型的遥感农田分割方法研究

主要作者及发表信息

本研究由来自中南大学地球科学与信息物理学院的吴海洋、杜卓飞、钟丹丹、王玉泽及陶超(通讯作者)共同完成。该研究成果于2025年1月23日在线发表于国际著名学术期刊《IEEE Transactions on Geoscience and Remote Sensing》(IEEE地球科学与遥感汇刊),并被收录于该期刊2025年第63卷,文献编号为4402813。

研究背景与目的

本文的研究领域为遥感图像处理与深度学习。准确且高效地提取耕地资源信息,对于农业现代化和粮食安全决策至关重要。然而,现有的基于标签的视觉深度学习范式面临两大核心挑战。首先,它们难以捕捉农田与其周围环境(如水体、植被、人工建筑)之间复杂的相互关系。其次,这些方法无法有效表征与物候循环(phenological cycle)相关的时序变化,例如农田在播种期、生长期、休耕期所呈现的巨大视觉差异。模型若仅依赖标签学习,可能将休耕的农田误判为非农田。这些局限性导致了识别过程中的遗漏和混淆,严重影响了农田识别的准确性与效率。

语言作为一种能够表达丰富语义和逻辑关系的模态,可以精确描述农田的空间属性、随季节变化的独特物候景观,以及这些变化与环境因素间的复杂交互。因此,本研究首次探索了语言引导的视觉-语言模型(Vision-Language Models, VLMs)在农田分割中的应用,旨在通过引入语言描述来弥补传统方法在理解农田复杂特征上的不足,将模型的能力从简单的“视觉识别”提升至更深层次的“视觉理解”。为此,研究设定了三个主要目标:1) 构建一个专用的农田图像-文本配对数据集;2) 设计一种用于农田分割的视觉-语言模型;3) 分析不同语义层级的语言描述对模型性能的影响。

研究详细流程

本研究的工作流程主要包含三个步骤:数据集的构建、模型的提出与实现,以及实验验证与分析。

第一步:构建农田图像-文本配对数据集 当前VLM研究缺乏专门的农田图像-文本配对数据集,因此研究的首要工作是构建一个高质量的“农田图像-文本”(Farmland Image-Text, FIT)数据集。该过程分为两个子步骤。 首先,研究设计了一个半自动的文本描述标注框架。为精确刻画影响农田分割的复杂因素,研究团队通过分析大量遥感图像和现有工作,总结出12个关键因子。这些因子被分为两大类:一是农田内在属性,包括拍摄时间、地理位置、景观特征、农田分布、农田形状、内部道路和地形;二是周围环境属性,包括水体分布、植被分布、建筑分布和作物播种情况。基于此,研究设计了一个文本模板,将这12个因子整合其中,并作为选项控件集成到标注软件Labelme中,实现了对每张图像的半自动文本标注。 其次,研究使用该框架构建FIT数据集。数据源方面,为确保数据多样性,研究选取了中国四个省份(湖南、广东、安徽、云南)的多个地级市作为研究区域,这些区域涵盖了从亚热带到温带的气候带,以及平原、高原、丘陵和山地等多种地形。研究使用Bigemap软件获取了这些区域不同月份的0.5米分辨率谷歌卫星影像。经过预处理和统一裁剪为512×512像素后,人工剔除不含农田的图像,共得到7269张有效图像。图像的空间标注方面,为了减少标注时间成本,研究将Segment Anything Model集成至Labelme,实现了图像的半自动掩码标注,获取了精确的农田标签。最终,每张图像都配有一张对应的农田标签图(yimg)和一段基于12个因子的文本描述(ytxt),共同构成了FIT数据集。

第二步:设计并实现农田分割的视觉-语言模型 研究提出了一种名为FSVLM的模型,该模型结合了一个语义分割模型和一个多模态大语言模型(Multimodal Large Language Model, MLLM)。 模型整体架构包含两个分支。多模态大语言模型分支负责建立视觉与语言的关系。它基于LLaVA模型,首先使用CLIP视觉编码器提取图像Ximg的视觉特征,再通过线性投影层将其转换为与语言模型词元序列维度相同的视觉词元序列Timg。然后,该序列与输入的查询文本ytxt(由提示文本和之前的12因子描述文本组成)的词元序列Ttxt一起被送入Vicuna语言模型,生成响应文本。为生成分割掩码,研究中采用了“嵌入作为掩码”范式,即在语言模型中引入一个新词元⟨seg⟩,当需要输出掩码时,模型生成的文本会包含该词元。该词元在语言模型最后一层嵌入层的输出,经过一个多层感知机(Multilayer Perceptron, MLP)进行非线性映射,得到包含分割提示信息的特征Tseg。 分割模型分支直接采用了Segment Anything Model。其工作流程是:首先,使用SAM的视觉编码器(冻结参数的ViT-Huge)对原始图像进行编码,得到图像嵌入特征Ie。然后,将上述由多模态大语言模型分支输出的Tseg特征送入SAM的提示编码器,将其编码为稀疏嵌入特征Pe。最后,将Ie和Pe共同输入SAM的解码器,生成最终的农田分割掩码。在训练过程中,多模态大语言模型部分使用了低秩适应技术进行高效微调,以保留其预训练的泛化能力。整个模型的损失函数由两部分组成:用于优化多模态大语言模型的自回归交叉熵损失,以及用于优化分割模型的逐像素二元交叉熵损失和骰子系数损失的加权组合。

第三步:实验设置与验证分析 研究者在NVIDIA A6000 GPU上使用AdamW优化器对模型进行了10个周期的训练,并设计了三类实验来全面评估FSVLM的性能。 首先,对比实验在自建的FIT数据集上进行,将FSVLM与六个先进的基于标签学习的语义分割模型(DeepLabV3, SegFormer, MaskFormer, Mask2Former, SegNext, DDRNet)进行对比。实验采用7:3的训练/测试比例,并使用平均准确率(mAcc)、平均交并比(mIoU)、平均骰子系数(mDice)和召回率(Recall)四个指标进行评估。 其次,泛化性能测试使用未参与训练的LoveDA数据集作为独立测试基准。LoveDA数据集包含南京、常州、武汉等地的农村区域图像,具有与训练数据不同的地域特征。通过在该数据集上测试所有方法,可以评估FSVLM对未知环境的适应能力。 最后,消融实验用于探究不同语义层级的文本描述对FSVLM性能的影响。实验将描述文本分为“描述农田属性”和“描述周围环境”两大类,并通过移除特定描述来观测模型精度的变化。

主要实验结果与讨论

在基于FIT数据集的对比实验中,FSVLM在四个省份的测试子集上均表现出超越其他方法的整体性能。具体而言,在安徽、广东、湖南、云南四地的结果表显(见表IV-VII),FSVLM在mAcc指标上展现出显著优势,表明模型在区分农田与非农田区域时具有更高的精确度,减少了误判。同时,其在mIoU和mDice指标上也有显著提升,高mIoU值证明FSVLM在农田边界勾画上更为准确,而高mDice值则进一步证实了其在复杂场景下的稳定性和鲁棒性。尽管在湖南地区的召回率略低于Mask2Former,这可能源于模型偏好高置信度预测,但这不影响其整体优越性。分割结果的可视化图(见图6-9)也直观地显示,FSVLM生成的分割掩码与真实标签高度对齐,在整体布局和细节纹理上都展现出惊人的相似性,虽然部分结果存在轻微的“椒盐噪声”,这为未来优化指明了方向。

在泛化性能测试中,FSVLM模型的表现同样出色(见表VIII)。即使是面对完全陌生的地理环境(LoveDA数据集中的南京、武汉、常州地区),其分割性能依然优于所有其他对比方法。这一结果不仅证明了FSVLM能有效跨越地理差异进行农田分割,更展示了其在未知环境中应用的巨大潜力和强大的迁移能力。

消融实验的结果(见表IX)揭示了语言描述在VLM中的关键作用。首先,引入描述文本(实验d对比实验a)能显著提升模型的分割精度,证明了语义信息的价值。其次,对比实验b、c与实验d发现,当移除农田形状、分布等核心属性描述时,模型精度出现明显下降,凸显了关键属性描述对模型理解能力的重要性。最后,一个重要的发现是,与仅包含部分描述的文本相比,完整的描述文本(实验d)为模型带来了最高的精度提升,这揭示了不同描述文本之间存在紧密的上下文语义联系,它们共同作用产生了显著的协同效应,共同促进了模型对农田特征的全面准确理解。

研究结论、价值与亮点

本研究结论明确指出,将语言模态与视觉模态融合的FSVLM,在遥感农田信息提取中的性能显著优于传统的基于标签的深度学习方法。该模型不仅能更有效地区分农田与非农田区域,并且在复杂地形环境中展现了更强的适应性和更优的提取性能。

本研究的科学价值在于,它首次成功探索了VLM在农田分割领域的应用,验证了语言引导在提升模型“视觉理解”能力方面的有效性。其应用价值在于,所提出的半自动FIT数据集构建框架和FSVLM模型,为大范围、高精度的农田制图提供了强有力的技术支持和新的研究范式,对精准农业管理和土地资源监测具有重要实践意义。

本研究的亮点主要体现在三个方面。第一,方法的首创性:首次将视觉-语言模型引入农田分割任务,实现了从“标签学习”到“语言引导的视觉理解”的范式跨越。第二,数据集的构建策略:创造性地提出了基于12个影响因子的半自动文本描述标注框架,平衡了数据集构建的效率与质量,为后续相关研究提供了宝贵的数据资源和方法参考。第三,对语言作用机制的深入洞察:通过消融实验,首次系统分析了不同语义类型描述文本对模型性能的影响,发现聚焦农田属性的描述文本比聚焦周围环境的文本更有效,并且完整文本描述存在显著的上下文协同效应。这些发现为未来优化VLM和构建更高效的图像-文本配对数据集指明了方向。未来工作将聚焦于优化图像与文本之间的空间对齐,以解决在极端复杂农田环境中出现的误分割问题。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com