中文引用格式: 徐穎杰,張宇,黃啟光,等. 適配語義對齊圖像字幕方法[J]. 電子技術應用,2026,52(5):141-148.
英文引用格式: Xu Yingjie,Zhang Yu,Huang Qiguang,et al. Adaptive semantic alignment image captioning method[J]. Application of Electronic Technique,2026,52(5):141-148.
引言
隨著多模態大語言模型[1-2]在跨模態理解和生成上取得令人矚目的成功,以凍結的特征提取器、可訓練特征對齊適配器、凍結的大語言模型組成的編碼器-解碼器架構正成為圖像字幕領域的主流技術范式[3-4]。該范式的核心優勢在于,它能夠充分激發和利用預訓練視覺模型與語言模型中蘊藏的海量知識資產,將其作為高質量、可復用的基礎數據要素,從而避免從零開始訓練的巨大成本。然而,該架構也面臨一個關鍵挑戰:如何高效、精準地實現視覺數據要素與文本數據要素之間的語義對齊,以保障視覺信息流能夠無損、高效地流通至語言模型,并驅動其生成忠實于圖像的描述。
為解決上述跨模態對齊的難題,先前的研究主要致力于設計更精巧的適配器來橋接視覺與語言模態。例如,BLIP-2[5]提出了一個預訓練的圖文轉換器,作為連接凍結圖像編碼器與凍結LLM的橋梁;Flamingo[6]則通過在大語言模型的每一層插入門控注意力層,來實現深層次的跨模態交互;而LLava[7]采用了一種相對直接的方式,使用可學習的線性層或多層感知機來映射圖像特征。這些方法的核心思路是構建一條從圖像到文本的單向特征投射通道,力圖將視覺數據要素轉化為LLM能夠理解的偽文本令牌。
然而,近期研究揭示,這種單向、粗粒度的對齊策略存在固有缺陷[8]。圖像令牌與文本令牌之間存在著巨大的模態鴻溝,簡單的投影操作可能導致投射后的視覺令牌在語義尺度上與真實的文本令牌存在顯著差異。當這些被投影的視覺數據要素注入LLM時,極易被模型誤判為噪聲令牌,從而引發錯誤的注意力分布,限制模型的對齊能力,甚至導致生成描述時的“幻覺”現象。這本質上反映了當前方法在促進多模態數據要素高效、保真地流通與融合方面存在瓶頸。如圖1所示,盡管方法(a)和(b)在適配器設計上有所不同,但它們在大語言模型解碼階段仍依賴于單一的語義對齊尺度,導致噪聲注入問題未能根本解決。

圖1 跨尺度圖文語義對齊示意圖
針對這一核心問題,本文提出了一種名為適配語義對齊的圖像字幕新方法。該方法旨在重塑視覺-語言模態間的數據流通路徑,以實現更精細的語義對齊。具體而言,適配語義對齊方法首先通過一個微調的預訓練適配器,對視覺特征進行初步壓縮和語義提煉,完成數據要素的初步整合與降維。隨后,本文創新性地引入了一個語義路由機制,該機制能夠動態地評估每個視覺令牌的語義特性,并將其智能地轉發至大語言模型的不同層級進行處理。這種設計使得視覺數據要素能夠在多個尺度上與文本語義進行交互與對齊,從而有效緩解了因單一尺度對齊不匹配而導致的令牌失效問題,提升了跨模態數據流通的效率和魯棒性。
在此基礎上,本文的貢獻可以概括為:
(1) 提出了一種新穎的適配語義對齊圖像字幕方法,通過引入可微調的適配器,顯著降低了需要處理的圖像令牌數量,在減少模型可訓練參數總量的同時,優化了數據要素的處理效率。
(2) 本文創新性的提出了語義路由,語義路由決定圖像令牌在大語言模型的哪一層被處理,有效緩解圖像令牌和文本令牌語義難以完全對齊導致圖像令牌易失效問題。
(3) 在MSCOCO、Flickr30k、NoCaps等公共數據集上的實驗結果表明,本文所提方法在僅需訓練少量參數的情況下,各項性能指標均達到了目前的先進水平,驗證了其在促進多模態數據要素價值釋放方面的有效性。
本文詳細內容請下載:
http://www.tom3567.com/resource/share/2000007084
作者信息:
徐穎杰,張宇,黃啟光,李斌
(數字大理建設運營有限公司,云南 大理 671000)

