本文是一篇综述性论文。以下为根据文档内容生成的学术报告。
迈向地球尺度智能:通用大型遥感模型的路线图
作者与发表信息
本文由张良培(Liangpei Zhang,IEEE Fellow)、张乐飞(Lefei Zhang,IEEE高级会员)、贺威(Wei He,IEEE高级会员,通讯作者)、袁强强(Qiangqiang Yuan,IEEE会员)、赵兰普(Lanpu Zhao)及张立强(Liqiang Zhang,IEEE会员)共同撰写。第一作者张良培隶属于河南省科学院空天信息研究所及武汉大学测绘遥感信息工程国家重点实验室;通讯作者贺威隶属于武汉大学测绘遥感信息工程国家重点实验室。该综述发表于《Proceedings of the IEEE》,并于2026年5月30日被接收发表。
研究主题与背景
本综述的核心主题是探讨大型遥感模型(Large Remote Sensing Models, LRSMs)从传统深度学习(Deep Learning, DL)向具备地球尺度智能(Earth-Scale Intelligence, ESI)潜力的通用基础模型演进的路线图。遥感(Remote Sensing, RS)在土地监测、灾害评估、环境保护等地球观测(Earth Observation, EO)应用中发挥着关键作用,但传统针对特定任务训练的深度学习模型,在面对传感器模态、成像条件和地理区域的多样性时,泛化能力严重受限。近年来,受自然语言处理(NLP)和计算机视觉(CV)领域基础模型的启发,研究者开始通过在海量多样化遥感数据上预训练的方式,开发能够提取通用表征并适应多种下游任务的大型遥感模型。本文正是在这一背景下,系统性地梳理了驱动遥感领域这一范式转变的四个核心发展方向。
主要内容与论点阐述
本文的核心论点围绕大型遥感模型发展的四个关键转变展开,每个转变都构成了迈向地球尺度智能路线图上的一个重要环节。
第一,从深度学习到大型模型的转变:预训练范式的建立。 该部分阐述了遥感视觉模型如何从任务特定的监督学习,转向利用海量无标签数据构建通用特征提取器。其核心论据在于,标注数据的稀缺性和高昂成本是传统方法的瓶颈,而自监督学习(Self-Supervised Learning, SSL)的预训练范式解决了这一问题。文章详细论证了两种主流的预训练策略:基于对比学习(Contrastive Learning, CL)的方法,例如SeCo利用季节对比、CACo利用变化感知对比来学习具有判别力的表征;以及基于掩膜图像建模(Masked Image Modeling, MIM)的方法,如Scale-MAE和SatMAE++通过对多尺度、被遮挡的图像区域进行重建,迫使模型捕捉丰富的语义和上下文信息。此外,文章还论证了预训练从单模态(纯粹视觉)向多模态视觉(融合多光谱、合成孔径雷达、数字表面模型等异源数据)的扩展,其中跨模态对比学习和多模态掩膜图像建模是关键机制。例如,多模态模型CROMA结合对比学习与掩膜重建来对齐并增强光学与SAR表征。在模型适配层面,文章指出参数高效微调(PEFT),如LoRA、适配器等技术,正成为主流,它们能以极低的算力成本将冻结了大部分参数的预训练大模型高效地迁移到多种下游任务中。
第二,从视觉到多模态的转变:交互能力的构建。 该部分论证了大型遥感模型正超越单纯的图像解析,通过与自然语言的结合,发展出视觉问答、指代表达和对话推理等更高级的交互能力。其支撑观点体现在两个技术范式上:一是受CLIP启发的图像-文本预训练,旨在通过大规模对比学习建立视觉与语言的统一语义空间,代表性工作如RemoteClip,它通过“框到描述”等策略统一异构标注,增强了零样本分类和跨模态检索能力;二是受LLaVA启发的视觉引导指令微调,旨在赋予模型多轮对话和深层推理能力。例如,GeoChat通过低秩微调支持区域特定的对话,而Falcon则通过“万物皆语言”的范式实现了图像、区域、像素级别的统一理解。文章进一步区分了这两类模型:前者侧重于静态的语义对齐,而后者则偏向于动态的、需要上下文理解的视觉-语言推理任务,如像素级语言推理和基于知识增强的关系推理。
第三,从数据驱动到物理信息引导的转变:鲁棒性的增强。 该部分着重论述了融入物理机制对于提升LRSMs可解释性和鲁棒性的关键作用,特别是在地球系统参数反演和时空预测两项任务上。其论证逻辑是:纯数据驱动模型在训练分布外数据上可能产生物理上不一致的结果。解决方案之一是将物理先验知识,如辐射传输方程,融入模型。例如,差分水云模型(Differentiable Water Cloud Model, DWCM)将辐射传输公式嵌入到可学习的架构中,使得土壤水分反演更具物理可解释性。另一路径则通过物理公式自动生成大规模监督信号,如SatelliteCalculator模型,它利用物理指数公式合成了包含叶面积指数、生物量等八个生态变量在内的上百万样本,用于训练基础模型,从而将物理一致性通过数据生成的方式强加于模型。在时空预测方面,文章论证了掩膜时空预测、多任务学习分离时空特征以及多模态联合建模等预训练范式的有效性,并强调了物理信息神经网络(Physics-Informed Neural Networks, PINNs)通过将控制方程作为损失函数项,在约束模型输出符合物理规律方面的巨大潜力。
第四,从封闭集到开放世界评估的转变:基准体系的演进。 该部分系统性地指出,随着模型能力的跃升,评估协议也必须从静态、单一任务的数据集,转向多维度、层次化的基准测试,最终迈向开放世界的评估。文章首先总结了针对视觉基础模型的传统评估任务,包括场景分类、目标检测和语义分割等,并指出诸如DOTA、LoveDA等数据集已成为评测标准。接着,文章分析了针对多模态LRSMs的新兴评估任务,包括图像描述、视觉问答和视觉定位,并指出RSVQA和DIOR-RSVG等专用数据集的出现。文章的核心洞察在于,当前评估正面临根本性变革,从RSIEval、VLEO-Bench等统一多任务基准,发展到URBench、XLRS-Bench和CHOICE等层级化基准,它们将评估维度细化为感知、推理、地理定位等子能力,并着重解决数据泄露问题。最终,文章提出,真正的开放世界评估需超越封闭的类别设定,强调在域外分布、跨传感器、跨时空条件下的鲁棒性测试,并引入事件驱动的基准(如GeoBench-VLM)来衡量模型在真实世界高风险场景下的推理可靠性。
论文的价值与意义
本文的学术价值在于,它并非对现有文献的简单罗列,而是构建了一个从感知到认知、从数据驱动到知识引导、从封闭测试到开放部署的统一系统级分类学(Taxonomy)框架。它不仅清晰地描绘了大型遥感模型的发展全貌,更精准地指出了四个关键转变中各自面临的技术挑战与前沿方向。其应用价值在于,该路线图为遥感科学、计算机视觉和地球系统科学交叉领域的研究者提供了明确指引,有助于加速LRSMs从研究原型向实际业务化部署的转化,最终在灾害应急、全球变化监测、资源管理等重大社会需求中发挥其“地球尺度智能”的潜力。文章最后关于效率、统一表征、推理能力和鲁棒性的四大挑战的总结,也为未来的研究定下了基调。