分享自:

MovSeg:面向多光谱开放词汇分割的视觉-语言模型高效适配

期刊:IEEE Journal of Selected Topics in Applied Earth Observations and Remote SensingDOI:10.1109/jstars.2026.3658442

MovSeg: 面向遥感多光谱开放词汇语义分割的高效视觉-语言模型适配框架

主要作者与研究机构

该研究由Ji Yingrui、Wang Chenhao、Chen Jiansheng、Chen Jingbo、Yue Anzhi、Meng Yu及Sui Chenhong共同完成。研究团队主要来自中国科学院空天信息创新研究院(Aerospace Information Research Institute, Chinese Academy of Sciences),部分作者同时隶属于中国科学院大学电子电气与通信工程学院。通讯作者为Chen Jiansheng。此项研究成果于2026年发表于IEEE地球科学与遥感学会旗下的权威期刊《IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing》(IEEE应用地球观测与遥感选题期刊)第19卷。

研究背景与目的

语义分割是遥感影像分析的一项基础任务,通过对每个像素进行分类,为土地覆盖制图、城市规划等应用提供核心支持。然而,传统语义分割模型采用“闭集”(closed-set)策略,即只能识别训练时预定义的固定类别,无法泛化到新的、未知的类别。每当需要新增类别时,就必须重新采集数据、进行昂贵的像素级标注并重新训练模型,这极大地限制了大规模地球观测系统的灵活性和可扩展性。

开放词汇分割(Open-Vocabulary Segmentation, OVS)的提出为解决这一瓶颈提供了新思路。OVS模型能够根据文本提示(例如类别名称)来分割任意物体,其泛化能力源自CLIP(Contrastive Language-Image Pretraining)等大规模视觉-语言模型(Vision-Language Models, VLMs)所学习的跨模态语义对齐。近年来,遥感领域已开始探索OVS的应用,催生了如SkySense-O等代表性框架。然而,一个关键的研究空白(research gap)始终存在:现有的遥感OVS框架均继承自仅能处理标准红绿蓝(RGB)三通道图像的基础VLMs,无法有效利用多光谱图像中的其他宝贵波段信息,尤其是近红外(Near-Infrared, NIR)波段。NIR波段对于区分健康与受胁迫植被、划定水体边界、评估土壤湿度等具有极强的判别能力。忽视这些光谱信息将迫使模型在次优的特征空间下工作,严重限制了其在光谱敏感类别上的表现。

鉴于此,本研究旨在解决如何在不损害开放词汇泛化能力的前提下,高效地将多光谱信息集成到OVS框架中。为此,文章提出了MovSeg框架,这是一个面向多光谱开放词汇分割的新方法。

详细工作流程与技术方法

研究团队以SkySense-O架构为基础,通过两项核心创新组件来实现对多光谱数据的适配。

系统整体架构 MovSeg采用双编码器-单解码器架构。输入为包含红、绿、蓝和近红外四波段(RGB+NIR)的多光谱图像和一组用于开放词汇的文本提示。视觉编码器(Vision Encoder)负责从图像中提取视觉特征,文本编码器(Text Encoder)则生成文本提示的语义特征向量。最后,分割解码器(Segmentation Decoder)融合这两类表征,生成像素级的分割结果。为了避免引入冗余的参数分支,MovSeg并未为NIR波段增设独立编码器,而是通过两个定向修改,将NIR信息直接整合进原始视觉编码器中。

核心创新一:多光谱输入适配模块(Multispectral Input Adaptation, MIA) 视觉编码器的第一层,即图像块嵌入层(Patch Embedding),原本是一个将RGB图像块投影为特征向量的二维卷积层。为使其能处理四通道输入,MIA模块首先采用权重复制(weight-copying)策略进行初始化:红、绿、蓝通道的权重直接继承自预训练模型,而全新的NIR通道权重则通过复制红色通道的权重来初始化。这一选择的依据是红波段与NIR波段在遥感数据中常具有较高的光谱相关性,能为模型提供一个稳定的适应起点。此外,该设计具有波段无关性(band-agnostic),可自然扩展至处理高光谱或任意多光谱输入。

更进一步,MIA模块集成了一个新颖的窗口高效通道注意力(Window Efficient Channel Attention, WindowECA)机制。该机制并非直接学习固定的全局波段权重,而是首先将输入特征图划分为不重叠的局部窗口。在每个窗口内,通过全局平均池化聚合空间信息,生成一个通道描述符。随后,一个核大小为k的一维卷积捕获局部跨通道交互,并通过Sigmoid函数生成注意力分数。最终,原始窗口特征与该分数进行逐通道相乘,实现基于局部空间区域的光谱通道动态重加权,从而自适应地强调图像中不同区域最具信息量的波段。

核心创新二:空间-通道自适应微调策略(Spatial-Channel Adaptive Tuning, SCAT) 仅修改输入层不足以完全适应NIR波段带来的深层特征分布变化。SCAT策略作为一种参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)技术,在空间和通道两个维度上对冻结的视觉编码器深层模块进行低成本适配。

在空间自适应微调方面,SCAT针对自注意力机制中的查询(Query, Q)和值(Value, V)投影矩阵应用低秩适配(Low-Rank Adaptation, LoRA)。训练时,预训练权重被冻结,仅更新两个小型的低秩矩阵,从而模拟权重的更新量。微调Q矩阵会影响空间注意力的方向,而微调V矩阵则影响从被关注位置检索到的信息内容,使模型能以极少参数学习新的空间注意力模式。

在通道自适应微调方面,SCAT采用混合策略。一方面,对注意力输出投影(Output Projection, O)矩阵同样应用LoRA,以学习新的通道重加权机制。另一方面,在前馈网络(Feedforward Network, FFN)旁并联插入一个轻量级的适配器(Adapter)模块。该适配器由降维、非线性激活(GeLU)和升维操作组成。FFN的原始输出将与适配器路径的输出相加,共同构成最终输出。这条独立的低参数量通路能有效学习专属于多光谱数据的通道变换,同时不破坏预训练知识。

实验设置与数据集 为验证MovSeg的有效性,研究在三个具有代表性的多光谱数据集上进行了广泛的实验: 1. FLAIR:一个用于法国土地覆盖制图的大型基准数据集,包含0.2米分辨率的512×512航空影像,具有RGB和NIR四个波段,标注了13个语义类别。训练/验证集包含61,712个图像块。 2. Five-Billion-Pixels (5BP):提供4米分辨率的中国高分二号卫星影像,用于国家级土地覆盖制图。数据被裁剪为256×256的图像块,共产生了84,650个训练对和32,799个测试对,包含24类。 3. Potsdam:ISPRS提供的城市语义分割标准基准,包含5厘米分辨率的正射影像,提供RGB和NIR四个波段,标注了6个类别。标准划分使用24景用于训练,14景用于测试。

模型采用统一的合并数据集进行训练,评估指标为所有类别的平均交并比(mean Intersection over Union, mIoU)。为专门评估NIR波段的增益,本研究创新性地引入了mIoU_NIR指标,该指标仅计算对NIR光谱反应敏感的地物类别子集上的mIoU,如植被、水体等。训练配置为50,000次迭代,使用AdamW优化器,学习率设为0.0002,批大小为4。在WindowECA中,窗口尺寸设为2×2;在SCAT策略中,空间LoRA秩R_s设为8,输出LoRA秩R_o设为4,适配器瓶颈维度R_a设为16。

主要实验结果与分析

定量结果(Table I)表明,MovSeg在所有数据集上的平均mIoU达到70.64%,显著超越其基线模型SkySense-O(64.34%)以及其他通用领域和遥感领域的方法。在衡量NIR敏感类别性能的mIoU_NIR指标上,MovSeg的平均得分为68.69%,相比基线的61.33%提高了7.36个百分点,增益幅度超过整体mIoU的提升,有力地证实了模型有效利用了额外的光谱信息。其中,在5BP数据集上的提升最为显著,mIoU从54.98%跃升至68.78%。

消融实验(Ablation Study)进一步验证了各组件的有效性。基线配置(仅使用RGB输入且冻结编码器)的平均mIoU为64.32%。仅添加MIA模块处理四波段数据后,平均mIoU提升至65.60%。最关键的对比在于,若在MIA基础上进行完整微调(Full Fine-Tuning),性能反而下降至64.31%,这揭示了灾难性遗忘(catastrophic forgetting)的风险;而采用参数高效的SCAT策略则达到了70.66%的最佳性能。这一系列对照实验清晰地证明了MIA模块和SCAT策略各自不可或缺的贡献,以及PEFT策略在保留泛化能力与适应新模态间取得最佳平衡的必要性。

定性结果直观展示了MovSeg的优势。在FLAIR数据集上,基线模型常将“透水面”误分为“不透水面”或“水体”,并混淆“针叶林”与“落叶林”、“草本植被”与“裸土”。而MovSeg能更准确地区分这些类别。在场景复杂的5BP数据集上,基线模型混淆“稻田”与“池塘”以及“花园土地”与各类“森林”,而MovSeg是唯一能正确分辨“鱼塘”与周边“稻田”并同时识别出“工业区”和“道路”的方法。即便在空间分辨率极高的Potsdam数据集上,当现有模型严重混淆树木与低矮植被时,MovSeg也能实现清晰的分割。

研究结论与价值

本研究成功解决了遥感开放词汇分割领域长期存在的RGB输入限制问题,提出了开创性的MovSeg框架。该框架通过精心设计的MIA和SCAT两大组件,高效地将多光谱(RGB+NIR)数据集成到预训练的视觉-语言模型中,且实现了较低的计算开销。该研究不仅在多个基准数据集上取得了领先的分割精度,更重要的是通过mIoU_NIR指标确证了模型对额外光谱信息的强大利用能力。这项工作为未来多源、多模态的开放词汇遥感解译提供了兼具实用性与高效性的新范式,标志着向更智能、更通用的地球观测分析迈出了重要一步。

研究亮点

本研究的核心亮点在于其双重创新与实用导向。首先,它首次将多光谱信息引入开放词汇语义分割框架,直接填补了领域内的一项关键技术空白。其次,所提出的MIA模块采用权重复制与WindowECA机制,以精巧且可扩展的方式解决了输入层适配问题;而SCAT策略通过混合LoRA与Adapter的PEFT技术,以极低的参数成本实现了深层特征的跨模态对齐,有效规避了完整微调带来的灾难性遗忘风险。最后,研究提出的mIoU_NIR评估指标,为定量化衡量多光谱信息在分割任务中的价值提供了新的标准化工具。这些贡献共同构成了一个高效、完整且可推广的解决方案。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com