这是一篇综述文章,作者为Yue Zhou、Shujun Zhao、Xue Yang等(所属机构未在文档中单独列出),发表于《IEEE Geoscience and Remote Sensing Magazine》。文章于2026年被接收,系统性地回顾了为视觉-语言模型(Vision-Language Models, VLMs)量身定制的遥感(Remote Sensing, RS)数据集的发展现状,并提出了一个从数据构建到微调和评估的完整实践指南。
本文的核心观点是,在大模型时代,遥感视觉-语言模型的研究范式已经从以模型为中心(Model-Centric)转向了以数据为中心(Data-Centric)。文章指出,直接修改通用基础模型的庞大架构在计算资源上对大多数学术机构是不可行的。因此,高质量、面向特定领域的遥感视觉-语言数据集,而非模型架构本身,成为了释放基础模型潜力的关键赋能因素。然而,学术界缺乏一个系统性的、以数据为中心的综述,来指导研究者构建高质量数据集和进行有效的模型微调与评估。本文正是为了填补这一空白。
文章提出了一个新颖的“GeoChef”数据策展研究框架,将遥感视觉-语言模型的开发过程系统类比为烹饪流程。这个框架包括四个关键阶段,这也构成了全文的实践指南: 1. 食材图鉴(Ingredient Atlas):系统梳理遥感视觉-语言数据集并建立分类法。文章从数据的输入输出形式出发,提出了一个以数据为中心的分类法,将任务分为三大类十六个子类,包括图像描述(Image Captioning)、视觉问答(Visual Question Answering, VQA)和视觉定位(Visual Grounding)。文章通过对2023年至2025年数据集的增长趋势分析,揭示了该领域正在经历爆发式增长,尤其在2025年,新增数据集数量已超过以往总和。作者还观察到,数据集的任务范式正从传统的检测和分割,向指令微调、视觉推理、视频理解等需要复杂认知的高级任务转变。 2. 食材处理(Ingredient Processing):全面阐述数据集的构建方法论。文章将主流构建流程分为三类:完全人工(Manual)、完全自动(Automatic)和半自动(Semi-automatic)流水线。半自动方法以56.25%的比例占据主导,尤其在图说数据集中达到了65.52%,而VQA数据集因其固有的推理复杂性,人工标注比例最高(31.48%)。文章还特别分析了半自动方法中生成模型的使用情况,指出GPT-4o是当前最主流的工具。此外,文章介绍了一个更前沿的范式——人工智能体驱动(AI Agent-Driven)的数据构建,特别是双智能体(生成-评估)和三智能体(推理者-感知者-验证者)架构,如何通过协同工作来生成高质量的思维链(Chain-of-Thought, CoT)推理数据。 3. 烹饪手册(Cooking Manual):详细介绍数据集微调策略的选择和实施。该部分旨在帮助研究者根据具体任务需求和资源限制,选择最优的微调方法,尽管文档未对此部分展开过多技术细节。 4. 美食品鉴(Gourmet Tasting):建立全面的评估框架,介绍不同任务常用的基准和评估指标。例如,图像描述任务主要由基于文本相似度的指标评估,视觉问答任务则根据题型不同,采用客观准确性或基于大语言模型和人工的评判,而视觉定位任务则采用交并比(IoU)等空间重叠度量。
文章的另一大贡献是开发并开源了一个社区驱动的数据仓库“awesome-rs-vl-data”。针对该领域数据资源碎片化、现有开源仓库维护停滞的挑战,该数据仓库采用社区自维护模式,通过GitHub平台,利用多维标签分类系统对超过120个数据集进行了精细标注和分类。这一模式通过一个已成功运行八年的口琴谱库项目得到了可行性验证,旨在为研究者提供一个可持续更新、高效检索数据资源的平台。
最后,文章指出了遥感视觉-语言数据的未来发展方向。发展趋势包括:从单纯追求数据规模,转向规模与质量并重,提升指令的复杂性、多样性和准确性;从简单的多模态数据拼接,转向深度的跨模态对齐与协同理解;任务设计日趋复杂和实用化,从基础的描述和问答,发展到需要时空推理、因果分析和决策支持的综合性任务。这些趋势共同推动着遥感多模态大模型(MLLMs)朝着更高层级的通用感知与理解迈进,其核心演变将聚焦于构建高质量、深融合、强推理和重评估的新一代数据基础设施。