本研究作者包括Cristian Bodnar、Wessel P. Bruinsma、Ana Lucic、Megan Stanley、Anna Allen等,主要来自Microsoft Research AI for Science、剑桥大学、阿姆斯特丹大学等机构。该论文于2025年5月21日在线发表于Nature,题为《A foundation model for the earth system》(一个地球系统的基础模型)。
该研究属于人工智能与地球科学交叉领域,旨在解决传统数值预报模型计算成本高昂、开发周期长等问题。传统的地球系统预测,如天气、空气质量、海洋波浪和热带气旋预报,依赖超级计算机上运行的复杂物理模型,这些模型不仅需要专门工程团队维护,而且改进周期往往长达数年。近年来,以Pangu-Weather为代表的AI模型在中程天气预报上取得突破,但其应用多局限于全球0.25°分辨率的中期天气预报,在其他关键领域,如海洋动力学、大气化学和极端天气预报方面仍存在大量空白。在此背景下,研究团队提出了Aurora,一个大规模地球系统基础模型(foundation model),目标是创建一个能够以低计算成本适应多种预报任务的通用模型,使高精度地球系统预测更加大众化。
研究流程与详细方法
该研究的整体工作流程分为两个核心阶段:大规模预训练(pretraining)和针对特定任务的下游微调(fine-tuning)。Aurora模型本身是一个拥有13亿参数的灵活3D Swin Transformer架构,由三个主要部分组成:一个3D Perceiver编码器(encoder),负责将多源异构的气象和气候数据转换为统一的潜在三维表示;一个作为神经模拟器的多尺度3D Swin Transformer U-Net主干网络(processor),该主干网络通过在局部窗口内执行自注意力操作,并在每两个连续层之间平移窗口来模拟物理信息的传播,其对称的上下采样结构能高效模拟不同尺度的物理过程;以及一个3D Perceiver解码器(decoder),将演化后的三维表示解码回特定的物理预测变量。
在第一阶段,研究团队让Aurora在超过一百万小时的多源异构地球物理数据上进行预训练,以学习大气和海洋流动及其次生过程动力学的通用表征。预训练数据包括了来自ERA5的再分析数据(reanalysis data)、IFS HRES的零场预报(即HRES t0,作为高质量真实值)、GFS业务预报、GEFS集合再预报、CMIP6气候模拟数据以及MERRA-2大气再分析数据等。预训练的目标是最小化未来6小时预报的预测值与真实值之间的平均绝对误差(MAE),训练过程在32块A100 GPU上持续了15万步,耗时约2.5周。研究团队通过实验证明了数据量和模型规模对于性能的增益:在预训练中加入更多样化的数据(如CMIP6气候模拟数据)能系统性地提高模型在验证集上的性能,尤其改善了极端值的预报效果;同时,验证性能随着模型规模呈幂律提升,参数数量每增加十倍,验证损失约降低6%。
在第二阶段,预训练好的Aurora模型针对四个关键任务进行了高效微调。由于Aurora灵活的编码器-解码器设计,它能够接受任意变量、气压层和分辨率的输入。为了高效适应长序列动力学,研究团队开发了一种新的滚动微调(roll-out fine-tuning)方法,该方法结合了低秩适应(LoRA)技术和“前推技巧”(pushforward trick),并创新性地引入了受深度强化学习启发的内存回放缓冲区(in-memory replay buffer),使得在不消耗过多显存且不损害训练速度的前提下,能够训练非常长的自回归预测序列。
在大气化学与空气污染预报任务中,模型针对空气质量预报的关键六种污染物(CO, NO, NO₂, SO₂, O₃, PM₁, PM₂.₅, PM₁₀)进行微调。数据集包括时间跨度有限但质量较高的CAMS分析场数据(2017年10月至2022年5月用于训练,2022年5月至11月用于测试),以及分辨率较低、版本较老的CAMS再分析数据EAC4(2003年1月至2021年12月)作为补充。预报分辨率为0.4°。在海洋波浪动力学预报任务中,模型同时对海浪变量和气象变量进行微调。关键海浪变量包括有效波高(SWH)、平均波周期(MWP)和平均波向(MWD),并细分风浪(WW)、总涌浪(TS)、主涌浪(1)和次涌浪(2)等成分。数据来源于ECMWF的HRES-WAM分析场和HRES t0,时间覆盖2016年至2021年用于训练,2022年用于评估,分辨率重网格化至0.25°。由于海浪数据在海冰覆盖的海洋区域会缺失,研究团队扩展了Aurora以支持缺失数据处理,为每个变量引入了一个额外的密度通道。在热带气旋路径追踪任务中,模型并未专门为路径预报进行微调,而是直接使用在HRES t0数据上微调至0.25°分辨率的Aurora模型。通过一个简单的启发式追踪器(将连续预测中的最低平均海平面气压点定位为涡旋中心),生成气旋路径预测。评估使用了IBTrACS数据集中2022-2023年所有全球热带气旋的官方路径作为基准,并与多个官方机构的业务预报产品进行比较。在高分辨率天气预报任务中,由于0.1°高分辨率数据(来自IFS HRES)仅从2016年才开始可用,数据量极为有限,这使得预训练的作用变得至关重要。模型在该数据集(2016-2022年)上进行微调,并按照业务化协议,将预测结果与IFS HRES分析场进行比较。同时也使用了包含全球超13000个气象站实测数据的WeatherReal-ISD数据集进行验证。
主要研究结果
在空气污染预报方面,微调后的Aurora与计算成本高昂的CAMS业务系统相比,在74%的评估目标上表现持平或更优,在3天预报时效上,这一比例达到89%。它能精确捕捉到诸如2022年6月13日伊拉克严重沙尘暴等极端事件。其生成预测的速度极快,在单个A100 GPU上每预报一小时仅需约0.6秒,计算速度提升约10万倍。与从头训练的模型相比,预训练微调策略为所有目标带来了平均54%的性能提升。在海洋波浪预报上,Aurora在86%的海浪变量上持平或优于业务化的HRES-WAM系统,在3天预报时效上,91%的地表变量表现更佳。它能精确预测超强台风“南玛都”在峰值强度时产生的巨浪和波向。预训练带来的平均性能提升为22%。在热带气旋路径预测上,Aurora是首个在长达5天的所有预报时效上,超越全球多个主要官方机构业务路径预报的机器学习模型。例如,在美国国家飓风中心管辖的北大西洋和东太平洋,Aurora在1天和2-5天预报时效上的误差分别降低了6%和20-25%。在台风“杜苏芮”的案例中,Aurora在4天前就准确预测了其在菲律宾北部的登陆,而当时官方预报指向台湾北部。在高分辨率天气预报上,Aurora在92%的预报目标上超过了IFS HRES系统,尤其在超过12小时的预报时效上优势明显,RMSE降低幅度最高达24%。在基于气象站实测数据的评估中,Aurora在所有预报时效上都优于IFS HRES。对于2023年的风暴“夏兰”,Aurora是唯一能够准确预测其最大10米风速急剧增强现象的AI模型。
研究结论、价值与亮点
该研究成功展示了构建地球系统基础模型的可行性。Aurora作为一个通用模型,在多个此前AI模型鲜有涉足的领域均达到了最先进的性能,证明了通过一次昂贵的大规模预训练,再以极低计算成本快速适应多种下游任务的技术路线是成功的。这项工作不仅科学价值显著,标志着AI在理解和预测复杂地球系统方面迈出了重要一步,其巨大的应用价值也不容忽视。它将业务级高精度环境预测的能力下放,让原本需要国家级超级计算中心才能完成的工作,有望在单块GPU上实现,这对科学研究、灾害应急、农业生产、公共卫生等众多领域都具有深远意义。
本研究的主要亮点在于:其一,提出了一个真正意义上的地球系统基础模型,其涵盖的领域远超现有AI气象模型,首次在全局性空气质量和波浪预报等复杂任务上超越了业务化系统。其二,证明了模型与数据规模化带来的普适性能提升,揭示了扩展预训练数据和模型规模的有效性。其三,开发了一套创新的滚动微调技术,特别是利用低秩适应和内存回放缓冲区,解决了在高分辨率下进行长序列自回归训练的效率与内存瓶颈问题。其四,在热带气旋路径预测上首次全面超越包含人类专家判断的复杂综合业务预报系统。Aurora的成功也为后续研究指明了方向,如发展集合预报、实现端到端直接处理观测数据、以及将应用拓展到海洋环流、海冰范围、农业产量、可再生能源等更广泛的领域。尽管模型仍依赖传统资料同化系统提供初始场,但其从根本上改变了我们对地球系统预测模式的认知。