本研究由Qingsong Jiang、Wenjing Zhao、Weiqing Zhao及Guolong Cui等人完成,第一作者与通信作者单位均为电子科技大学(University of Electronic Science and Technology of China)。该研究于2026年4月30日投稿至IEEE传感器快报(IEEE Sensors Letters),并于同年5月20日被接收,最终发表于2026年7月刊(第10卷第7期)。论文标题为《基于交叉注意力变换网络的虚警率可控海面目标检测》(*False Alarm Rate-Controllable Maritime Target Detection via Cross-Attention Transformer Network*)。
一、 研究背景与目的
雷达目标检测在国防安全和灾害监测等领域至关重要,然而,海洋环境的复杂性为这项任务带来了巨大挑战。海杂波(sea clutter)具有非高斯(non-Gaussian)和时变(time-varying)的特性,会严重干扰雷达对小型目标的检测,导致检测性能下降和虚警率(False Alarm Rate, FAR)失控。传统的检测方法通常依赖于对海杂波统计分布进行精确建模,例如使用威布尔分布(Weibull distribution)、对数正态分布(Log-normal distribution)和K分布(K-distribution)等复合高斯模型(Compound-Gaussian models),并结合恒虚警率(Constant False Alarm Rate, CFAR)检测算法。然而,当实际海况与预设模型不匹配时,这类方法的性能会严重退化。为了应对未知的杂波统计特性,研究人员探索了基于手工特征(handcrafted feature)的方法,如利用幅度、多普勒和熵特征的三特征凸包算法。尽管取得了一定的性能提升,但在强杂波条件下的鲁棒性(robustness)仍然不足。近年来,深度学习凭借其自动特征提取能力,为这一问题提供了新的解决思路,例如利用双通道卷积神经网络(CNN)或残差网络(ResNet)进行虚警可控的检测。但是,卷积神经网络的局部感受野(local receptive fields)限制了其对时间依赖关系的捕捉,这在短观测时间和低信杂比(Signal-to-Clutter Ratio, SCR)场景下尤为致命。虽然基于Transformer的自注意力机制(self-attention mechanism)能有效捕捉全局时间依赖性,但在强海杂波下的短时序列检测性能与虚警控制仍有待深入研究。为此,本研究提出了FARC-CAT,一种基于交叉注意力Transformer的虚警率可控检测器,旨在通过融合能量和频率特征,提升在强海杂波和短观测时间下的检测概率(probability of detection, Pd)并实现可靠的虚警控制。
二、 研究流程与具体方法
本研究将目标检测任务表述为一个二分类的监督学习(supervised learning)问题。假设雷达在一个距离单元(range cell)内接收到由目标回波、杂波回波和噪声回波组成的复数信号,检测任务就是判断该信号中是否存在目标。研究的核心是设计全新的FARC-CAT模型架构与训练策略,其具体流程与方法如下。
首先,研究设计了一个双编码器变换网络架构(Dual-encoder Transformer Architecture),由幅度分支和短时傅里叶变换分支组成,以解决单一域表征在低信杂比下的局限性。 1. 幅度分支(Amplitude branch)的处理流程:该分支以原始幅度序列为输入。它首先将序列通过重复、零填充和重排操作,构造成一个5×224的幅度矩阵并进行归一化。随后,利用一个由三个一维卷积模块构成的特征提取网络对其进行处理,每个模块包含卷积层、批归一化层(Batch Normalization)、高斯误差线性单元(GELU)激活函数和Dropout层。为增强网络对时间位置的感知能力,该分支创新性地引入了一个可学习的位置编码(learnable positional encoding),并将其与卷积特征相加,最终获得幅度分支的特征令牌(feature tokens)。 2. 短时傅里叶变换分支(STFT branch)的处理流程:该分支首先对原始复数信号进行短时傅里叶变换,得到时频矩阵。然后,吸收视觉变换网络(Vision Transformer)的架构思想,将时频矩阵分割成16×16的图像块(patches),每个块被映射为一个512维的特征向量。这些向量与一个用于聚合全局频谱信息的类别令牌(class token)拼接,并同样加入一个可学习的位置编码以保留空间布局信息,最后送入一个由六层 Transformer 编码器(Transformer encoder)组成的网络,通过多头自注意力(Multi-head Self-Attention)机制和前馈网络(Feedforward Network, FFN)进行全局特征聚合。 其次,在得到两个分支的特征后,本研究设计了双向交叉注意力与门控融合机制(Bidirectional Cross-Attention and Gated Fusion),以促进特征交互与互补。具体来说,STFT分支的令牌作为查询(Query),幅度分支的令牌作为键(Key)和值(Value),进行一次交叉注意力计算,并用残差连接进行融合,使得幅度信息融入STFT特征。反之亦然,幅度分支也以同样方式吸收来自STFT分支的频率域信息。完成双向交互后,分别从STFT分支的类别令牌和经过平均池化(average pooling)的幅度令牌中提取全局特征,并将其拼接。这两个全局特征随后被送入一个双层门控网络(two-layer gating network),生成样本自适应(sample-adaptive)的融合权重,对两个分支的特征进行加权,最终形成融合表征送入多层感知机(MLP)分类器进行目标预测。
最后,也是本研究的关键创新点,即基于偏移惩罚的自适应虚警率控制策略。为了实现这一目标,模型采用了一个混合损失函数(hybrid loss function)框架,由标准交叉熵分类损失(Cross-Entropy Loss, Lce)和虚警约束损失(FAR constraint loss, Lnp)组成。虚警约束损失的核心思想是,利用sigmoid函数作为阶跃函数的平滑近似,来计算当前训练批次内负样本(即纯杂波样本)的预测虚警率。当该批次的估计虚警率超过预设目标时,这个损失项就会产生一个正值的惩罚。此外,本研究还提出了一个可学习的阈值(learnable threshold)机制。该机制引入一个对数几率参数(log-odds parameter),通过sigmoid映射将其转化为(0,1)区间内的决策阈值。该参数的初始值由首轮训练后负样本预测概率的指定分位数确定,并在后续训练中与网络参数一并优化。训练完成后,还会利用验证集上的负样本进行分位数校准(quantile calibration),对阈值进行微调,以确保虚警率的精准控制。
三、 主要实验结果与分析
实验验证采用了公开的1993年IPIX雷达数据集(IPIX 1993 dataset)。该数据集采集自一部X波段雷达,脉冲重复频率为1000赫兹,目标为一个直径1米的泡沫塑料球,包含HH、HV、VH、VV四种极化模式下的数据。研究者将数据前90秒用于训练,后41秒用于测试,并选取了CA-CFAR、三特征检测器、MD-CCNN和CVHSTNet四种代表性方法进行对比。
实验结果显示,FARC-CAT在各项指标上均表现出显著优势: 1. 不同极化下的检测性能:在虚警率固定为0.001的条件下,FARC-CAT在不同数据集和极化模式下的检测概率均一致性地优于其他方法。例如,在#30数据集上,其在四种极化模式下的检测概率分别达到了0.8237、0.9939、0.9963和0.9621;在高信杂比的#310数据集上,在HV和VH极化下甚至达到了100%的检测概率。其检测效果图也直观显示了更高的检测概率和更低的虚警点。 2. 虚警率控制能力:在#310数据集上进行的不同虚警约束条件下的实验表明,当预设虚警率为10⁻⁴(万分之一)这一极低水平时,FARC-CAT的平均检测概率仍高达91.97%,远优于其他对比方法,证明了其卓越的虚警率控制能力与检测概率保持能力。 3. 短时样本下的检测优势:本研究特别验证了模型在短观测时间下的有效性。在#30VV数据集上,当样本时长缩短至0.512秒时,FARC-CAT的检测概率高达0.9621,显著优于其他方法。随着观测时间的减少,其性能下降幅度更小,凸显了其在短时场景下的独特优势。 4. 泛化能力验证:为了验证模型的通用性,实验还在涵盖不同海况的MTDSP数据集上进行了测试。结果表明,FARC-CAT在不同海况条件下都能维持更稳定的检测性能,展现了对复杂海杂波的强大鲁棒性。
四、 结论与研究价值
本文提出了一种名为FARC-CAT的虚警率可控海面目标检测方法,核心在于一个基于交叉注意力机制的双编码器Transformer架构,以及一个创新的偏移惩罚混合损失与可学习阈值机制。实验充分证明,该方法在低信杂比条件下,无论是短时样本检测能力还是虚警控制能力,都显著优于现有的代表性方法。
该研究的科学价值在于,它成功地将双域信息融合与Transformer的全局依赖捕捉能力相结合,为解决非平稳海杂波下的微弱信号检测难题提供了一种高效的新范式。其应用价值则更为直接,在极低的、可控的虚警率下实现高检测概率,这对于要求高可靠性的海事监视、搜救和国防预警系统具有重大意义,能有效减少虚警带来的资源浪费和决策错误。
本研究的亮点与创新点集中体现在:其一,提出的融合幅度和频率特征的双编码器与双向交叉注意力结构,突破了单域表征的局限;其二,开发了基于sigmoid平滑近似的虚警约束损失和可学习阈值,首次将虚警率作为一项可微分约束直接集成到网络训练优化过程中,实现了精确、可靠的端到端虚警控制。该设计有效解决了传统深度学习检测器难以精确控制虚警率的工程痛点。此外,模型在极短观测时间下的优越性能,解决了雷达快速扫描场景下样本不足的难题,拓展了其应用边界。