基于丰富归纳偏见的视觉语言模型学习
Learning with Enriched Inductive Biases for Vision-Language Models 研究背景与问题提出 近年来,视觉-语言模型(Vision-Language Models, VLMs)在计算机视觉和自然语言处理领域取得了显著进展。这些模型通过大规模图像-文本对进行预训练,能够构建统一的多模态表示空间,从而在多种下游任务中表现出色。然而,在少样本学习(few-shot learning)场景下,如何有效地调整这些模型以适应特定任务,同时保持良好的泛化能力,仍然是一个亟待解决的问题。 现有方法通常依赖于提示工程(prompt engineering)或参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)策略...