本文作者为Leyuan Zhang、Fan Wan与Yang Long,均来自英国杜伦大学(Durham University)。通讯作者为Yang Long。该研究发表于*Neurocomputing*期刊第695卷(2026年),文章编号133967,于2026年2月12日投稿,2026年4月19日修订,2026年5月12日接受,2026年5月14日在线发表。研究获得了中国国家留学基金委员会(China Scholarship Council, CSC)的资助。
联邦学习(Federated Learning, FL)允许多个客户端在不集中原始数据的前提下协同训练模型,但当不同客户端来自不同数据域(domain)或数据生成环境时,模型性能会严重退化。这种场景下的核心挑战不仅是通用的非独立同分布(non-IID)优化问题,更是域不平衡(domain imbalance)问题:全局模型容易被多数域牵引,而忽视少数域或偏移严重的域。当评估目标不仅是平均性能、还包含对最差服务域(worst-served domain)的鲁棒性时,这一问题尤为突出。
已有的联邦优化方法(如FedProx、SCAFFOLD、FedDyn、FedOpt)主要通过在参数空间中正则化或校正客户端更新来提升训练稳定性,但并未显式解决参数平均本身在域不平衡下偏向多数域的问题。基于原型(prototype)的通信方法通过交换紧凑的类级特征均值而非完整梯度,以更稳定且通信高效的方式共享跨域结构信息。然而,现有原型方法大多依赖静态或按样本量驱动的聚合策略,在域不平衡下会使全局原型参考偏向多数域,削弱其对欠代表域的效用。本研究的目标正是解决这一缺口:将原型聚合与模型聚合视为两个不同问题,通过解耦“覆盖导向”的原型形成与“稳定性导向”的模型聚合,在固定训练预算下同时提升平均精度与最差域精度。
研究考虑(m)个客户端,客户端(i)具有数据分布(\mathcal{D}_i)和局部目标(Fi(\boldsymbol{w})=\mathbb{E}{(x,y)\sim\mathcal{D}_i}[\ell(\boldsymbol{w};x,y)]),其中(\boldsymbol{w}\in\mathbb{R}^d)为模型参数。每轮通信中,服务器持有(\boldsymbol{w}^t)并广播给客户端。实验采用域筒仓异质性(domain-silo heterogeneity)设定:每个客户端属于一个域,域间存在差异,且各域分配的客户端数量不平衡。主实验协议使用(m=10)个客户端全参与,域-客户端分配比例分别为:PACS为3个photo、4个art、2个cartoon、1个sketch;Office-Caltech为3个amazon、4个dslr、2个webcam、1个caltech;Office-Home为3个art、4个clipart、2个product、1个real-world;Digits为3个mnist、4个usps、2个svhn、1个mnist-m。每个域内的训练样本按域内客户端数均匀划分为互不重叠的分片,保证来自域偏移的不平衡仅源于客户端数量差异而非单客户端数据量差异。
令(g_{\boldsymbol{w}}(\cdot))为特征提取器(倒数第二层输出)。客户端(i)按类构建原型:
[ \boldsymbol{p}_i^{(k)}=\frac{1}{|Di^{(k)}|}\sum{(x,y)\in Di}\mathbb{1}[y=k]\,g{\boldsymbol{w}}(x), ]
(\boldsymbol{P}_i={\boldsymbol{p}_i^{(k)}}_k)为原型集合。若客户端(i)当前轮不含类别(k)的样本,则直接省略该原型,不向服务器传输,也不参与该类聚合。每个客户端使用分类损失加原型对齐损失进行训练:
[ \mathcal{L}_i(\boldsymbol{w})=\mathcal{L}_i^{\text{cls}}(\boldsymbol{w})+\lambda\mathcal{L}_i^{\text{proto}}(\boldsymbol{w};\boldsymbol{P}^g), ]
其中对齐项使用实例到原型的均方误差(MSE)。
服务器收到原型后,使用单纯形(simplex)权重(\boldsymbol{\theta}^t)进行类级聚合。首先量化客户端(i)与上一轮全局原型的偏差:
[ di^t=\sum{k\in\mathcal{K}_i^t\cap\mathcal{K}_g^{t-1}}\left|\boldsymbol{p}_i^{(k),t}-\boldsymbol{p}_g^{(k),t-1}\right|_2, ]
其中(\mathcal{K}_i^t)是客户端(i)在当前轮观测到的类别集合,(\mathcal{K}_g^{t-1})是上一轮可用的全局原型类别集合。随后通过熵正则化(entropy-regularized)目标更新(\boldsymbol{\theta}^t):
[ \boldsymbol{\theta}^t=\arg\max_{\boldsymbol{\theta}\in\Delta_m}\langle\boldsymbol{\theta},\boldsymbol{d}^t\rangle-\frac{1}{\gamma}\sum_i\theta_i\log\theta_i, ]
其闭式解为(\theta_i^t=\frac{\exp(\gamma di^t)}{\sum{j=1}^m\exp(\gamma d_j^t)})。偏差越大的客户端获得越大的原型权重,使全局原型避免向多数域坍缩。
研究指出,被全局原型覆盖差的客户端往往产生更大且噪声更多的参数更新,因此单一权重无法同时兼顾原型覆盖扩展与参数聚合稳定。FedPAD首先将偏差分数归一化到单纯形权重(\boldsymbol{\theta}^t)(有界且跨轮可比),再通过温度控制映射得到模型聚合权重:
[ \alpha_i^t=\frac{\exp(-\thetai^t/\tau)}{\sum{j=1}^m\exp(-\theta_j^t/\tau)}, ]
其中(\tau>0)为温度参数。偏移大的客户端(\theta_i^t)较大,因此获得较小的模型权重。服务器模型聚合为(\boldsymbol{w}^t=\sum_i\alpha_i^t\boldsymbol{w}_i^t)。算法1总结了完整流程:每轮服务器广播(\boldsymbol{w}^{t-1})和(\boldsymbol{P}_g^{t-1});客户端本地执行(K)步SGD(损失含原型对齐项);计算并上传原型和模型;服务器计算偏差、更新(\boldsymbol{\theta}^t)、类级聚合原型、推导(\boldsymbol{\alpha}^t)、聚合模型并广播。
研究在时变聚合权重下进行收敛性分析。正式定义轮次目标(F^t(\boldsymbol{w})=\sum_i\alpha_i^t F_i(\boldsymbol{w})),并给出四个标准假设:(L)-光滑性、无偏随机梯度与有界方差、时变权重下的异构性界(\zeta^2)、有界迭代集与有界目标值(B_F)。两个关键引理建立了softmax映射的稳定性:(|\boldsymbol{\theta}(\boldsymbol{d})-\boldsymbol{\theta}(\boldsymbol{d}‘)|1\le\frac{\gamma}{2}|\boldsymbol{d}-\boldsymbol{d}’|\infty),以及(|\boldsymbol{\alpha}(\boldsymbol{\theta})-\boldsymbol{\alpha}(\boldsymbol{\theta}‘)|_1\le\frac{1}{2\tau}|\boldsymbol{\theta}-\boldsymbol{\theta}’|_1)。组合得到权重漂移界(|\boldsymbol{\alpha}^t-\boldsymbol{\alpha}^{t-1}|1\le\frac{\gamma}{4\tau}|\boldsymbol{d}^t-\boldsymbol{d}^{t-1}|\infty)。主要定理给出了(R)轮后的收敛界:
[ \frac{1}{R}\sum{t=1}^R\mathbb{E}|\nabla F^t(\boldsymbol{w}^{t-1})|^2\le\frac{4(F^1(\boldsymbol{w}^0)-F{\inf})}{\eta KR}+8L\eta K\sigma^2+8L^2\eta^2K^2\zeta^2+\frac{4BF}{\eta K}\cdot\frac{1}{R}\sum{t=2}^R|\boldsymbol{\alpha}^t-\boldsymbol{\alpha}^{t-1}|_1. ]
该界明确分离了优化进展项、梯度噪声项、异构性惩罚项与时变聚合特有的权重漂移项。推论进一步表明,漂移项可由偏差变化上界控制为(\frac{BF\gamma}{\eta K\tau}\cdot\frac{1}{R}\sum{t=2}^R|\boldsymbol{d}^t-\boldsymbol{d}^{t-1}|_\infty)。这揭示了(\gamma)(原型温度,控制反应性)与(\tau)(模型温度,控制保守性)之间的覆盖-稳定性权衡。
实验使用ResNet-18骨干网络与线性分类头,PACS和Office数据集将输入调整为224×224,Digits也调整为224×224并转为三通道RGB。所有方法使用SGD优化器,动量0.9,权重衰减(5\times 10^{-4}),Digits学习率0.01,PACS/Office学习率0.001。训练预算为(R=100)轮,每轮(E=10)个本地epoch,完整参与。FedPAD默认使用(\tau=0.1)和(\lambda=0.1)。基线与比较方法包括FedAvg、FedProx、SCAFFOLD、FedDyn、FedOpt(FedAdam)、fafed,以及两个原型基线(原始FedProto和协议对齐的FPL)。对每种方法使用相同的验证协议和相同数量的超参数搜索试验。评估指标为领域测试精度、平均精度(avg)和最差域精度(worst),每种设置下使用3个随机种子报告均值±标准差。
首先检验(\boldsymbol{\theta}\to\boldsymbol{\alpha})映射的必要性。固定(\boldsymbol{\alpha}\equiv 1/m)的变体与完整FedPAD相比,在PACS上最差精度从83.55%降至81.30%,在Office-Home从55.16%降至53.70%,在Digits从85.55%降至84.00%。消融实验(表3)进一步验证各组件贡献:移除原型对齐((\lambda=0))导致所有基准的平均和最差精度全面下降(如PACS最差精度降至80.35%);移除(\boldsymbol{\theta})加权原型聚合使Office-Home最差精度降至54.01%;移除(\boldsymbol{\alpha}(\boldsymbol{\theta}))映射等价于均匀模型权重,PACS最差精度降至81.30%。
PACS(表4):FedPAD达到平均精度87.44%和最差精度83.55%,优于最佳基线FedOpt(86.10%/81.00%),并在photo域取得85.05%(所有方法中最高),cartoon域91.62%。相比之下,原型基线FedProto在art域仅78.18%,FPL仅77.56%,显示静态原型聚合在多数域偏移下失效。
Office-Caltech(表5):FedPAD达到平均精度96.11%和最差精度93.30%,与FedOpt相当(95.80%/93.20%),但FedPAD的标准差更小(平均精度±0.22),表明更稳定的性能。
Office-Home(表6):FedPAD平均精度65.28%和最差精度55.16%,在clipart域取得55.16%,比第二名FedDyn(54.20%)高近1个百分点,而FedAvg在clipart仅53.21%。
Digits(表7):FedPAD平均精度92.84%和最差精度85.55%,在mnist-m域达到92.54%,明显优于所有基线(最佳为fafed的89.80%)。
在更强的域数量不平衡下(表8-9),FedPAD保持优势。例如PACS在6/2/1/1比例(即6个photo、2个art、1个cartoon、1个sketch)时,FedPAD最差精度80.98%对比FedOpt的78.12%。在部分参与设定下(表10-11),FedPAD在20%参与率时PACS最差精度78.34%对比FedOpt的75.43%,Office-Home在20%参与率时53.30%对比FedOpt的51.79%。在域数量与数据量双不平衡下(表19-20),FedPAD同样保持最差域优势。
映射消融(表12-13)直接验证了两阶段变换的价值:使用原始偏差分数直接映射(PACS最差80.37%)或归一化后直接映射(82.23%)均劣于FedPAD的完整两阶段(d\to\theta\to\alpha)流程(83.55%)。敏感性分析(图5)显示FedPAD对(\gamma)、(\tau)和(\lambda)的适度变化不敏感,但过激超参设置会降低最差域鲁棒性,符合覆盖-稳定性权衡的理论预期。
图6显示权重漂移(|\boldsymbol{\alpha}^t-\boldsymbol{\alpha}^{t-1}|1)和偏差变化(|\boldsymbol{d}^t-\boldsymbol{d}^{t-1}|\infty)随训练轮数递减,支持时间变化权重漂移可控这一理论前提。图7显示模型范数轨迹保持有界,验证有界迭代假设的实践合理性。图8显示少数域原型到全局原型的距离随时间下降,表明原型覆盖在改善。
表14显示FedPAD每轮总字节900.24 MiB(模型900 MiB + 原型载荷约0.24 MiB),服务器聚合时间0.49秒,相对运行时间1.05倍,与标准FedAvg(900 MiB,0.42秒,1.00倍)相比开销极小。Wilcoxon符号秩检验(表15)在PACS、Office-Home和Digits上的最差精度比较中均达到(p<0.05)的显著水平,Office-Caltech因增益较小而显著性较弱。Friedman平均排名(表16)将FedPAD排在首位(1.42)。原型扰动实验(表17-18)显示,高斯噪声(\sigma_p=0.05)时PACS平均/最差精度仍达86.69%/82.75%,表明FedPAD对轻度隐私兼容的原型扰动具有合理鲁棒性。
本研究提出的FedPAD通过显式分离原型聚合与模型聚合的角色,解决了域偏移联邦学习中覆盖-稳定性冲突这一关键张力。核心结论是:对原型扩展覆盖最有信息量的客户端,未必是应该在模型平均中占据主导的客户端。理论层面,该工作首次在时变聚合权重下分析局部SGD收敛,保留了权重漂移项并给出明确的上界,为自适应加权的可控性提供了理论依据。三个理论要点为:时变聚合引入显式漂移惩罚,偏差演化平滑时漂移可控,(\gamma)与(\tau)分别控制覆盖-稳定性权衡的两端。
应用价值方面:FedPAD以极小的通信与运行时间代价(仅增加约0.24 MiB原型载荷和5%的运行时间)带来显著的最差域精度提升,这在要求跨域公平性的实际联邦系统(如多机构医疗影像协作、跨站点工业质检)中具有重要价值。该方法对域名数量不平衡、部分客户端参与、双不平衡和轻度隐私噪声扰动均具有鲁棒性,显示其不是针对单一不平衡类型的专用方案,而是具有广义适应性的框架。
(1)两层级解耦设计:首次在原型联邦学习中同时引入覆盖导向的原型权重(\boldsymbol{\theta})与稳定性导向的模型权重(\boldsymbol{\alpha}(\boldsymbol{\theta})),并通过温度控制映射实现解耦,而非使用单一权重。
(2)显式的时变聚合收敛分析:区别于将实时变化权重视为固定权重的不严谨做法,该研究明确保留了权重漂移项,将原型温度与模型温度引入收敛界,为覆盖-稳定性权衡提供了可解释的参数化控制手段。
(3)覆盖-稳定性权衡的实证验证:健全性检验与映射消融证实了设计选择的有效性,敏感性分析印证了理论预期的权衡结构,经验分析从权重漂移、范数轨迹和原型距离三个维度连接了理论与实践。
(4)困难场景下的最差域性能提升:在强域不平衡、部分参与和双不平衡等挑战性更强的协议下,FedPAD的最差域优势更加明显,特别在PACS和Office-Home等困难基准上,相比静态聚合方法的最差精度有约2-3个百分点的稳定提升。
论文在附录中提供了完整的数学推导,包括光滑性下降引理、Young不等式、凸组合范数界、方差分解、softmax映射的Lipschitz稳定性证明,以及目标漂移引理和三个步骤的主定理证明。这些证明细节对希望扩展时变权重分析的研究者具有参考价值。
作者也明确指出了该工作的局限性:(1)当前仅聚焦于分类基准,尚未扩展到回归、生成或多模态场景;(2)原型通信虽紧凑且隐私兼容,但不提供正式隐私保证,也未进行完整隐私分析;(3)缺失类处理使用保守的省略策略而非原型补全;(4)评估仍限于有限的联邦场景集合。这些局限指明了未来研究方向,包括权重温度的自适应调度、更原则性的原型补全、更强的隐私保护集成,以及覆盖-稳定性解耦原则向其他联邦任务(如目标检测、语义分割、序列学习)的扩展。