摘要:Segment anything model(SAM)凭借优异的性能和泛化能力广泛应用于各种下游视觉任务,但是将其直接迁移至遥感图像语义分割任务时存在明显的局限性:1)SAM基于自然图像数据训练,难以适应遥感图像的尺度范围大以及地物分布的不均一性;2)SAM的图像编码器基于Vision Transformer,对局部纹理与高频细节的建模能力有限,难以保留高频空间信息,导致地物边界模糊和纹理特征弱化。为解决上述问题,本文提出了一种基于微调与高频增强的多尺度SAM遥感图像分割模型MSHF-SAM(Multi-Scale SAM with Fine-tuning and High-Frequency Enhancement)。在编码阶段,首先引入高频增强模块,使其有效保留高频特征信息,其次,引入少量参数高效微调策略,缓解SAM模型迁移至遥感领域时的跨域特征偏移问题。在解码阶段,采用MACU-Net解码头替换SAM原始掩码解码器,并设计轻量级边界细化分支,在保持模型高效运行的同时,有效提升地物边界与分割质量。在高分辨率遥感数据集LoveDA和Vaihingen上的实验结果表明,MSHF-SAM的mIoU和F1等评价指标均优于其他对比模型。其中,相较于经典的Unetformer分割模型,本文所提方法在LoveDA数据集的mIoU得分提升了4.33%,在Vaihingen数据集的mIoU得分提升了2.85%,实验结果表明所提方法具有良好的性能,实现了视觉大模型在遥感语义分割场景的应用。