中文引用格式: 王希萌,李鵬輝,趙皓陽,等. 基于動態路徑與局部視覺融合的圖像描述生成[J]. 電子技術應用,2026,52(7):124-132.
英文引用格式: Wang Ximeng,Li Penghui,Zhao Haoyang,et al. Image caption generation based on dynamic path and local vision fusion[J]. Application of Electronic Technique,2026,52(7):124-132.
引言
圖像描述生成[1]作為計算機視覺與自然語言處理交叉領域的重要研究方向,旨在構建視覺內容與語義文本之間的跨模態映射橋梁,其核心目標是使人工智能系統具備人類水平的圖像理解與語言表達能力。該任務不僅要求模型準確識別圖像中的實體對象,還需深入解析目標間的空間關系、動作關聯及場景上下文信息,以實現對視覺內容的深度語義表征與自然語言描述。
近年來,以卷積神經網絡[2](CNN)和Transformer[3]為代表的深度學習模型在圖像描述生成[4]、視覺問答(VQA)[5]等跨模態任務中表現出色。然而,面對復雜場景下的動態語義建模與多尺度特征融合問題,現有方法仍存在明顯不足。當前主流的動態網絡架構方法[6]多圍繞卷積核的動態調整展開。盡管此類設計在一定程度上增強了模型對輸入數據的自適應性,但仍存在兩大關鍵缺陷:其一,過度關注卷積操作的動態化,而忽視了空間多尺度特征與通道信息的協同建模,導致模型難以充分捕捉多尺度視覺語義信息;其二,部分方法將所有候選模塊置于統一路由空間,引發路由效率低下的問題。此外,在跨層特征融合方面,現有方法普遍采用特征拼接或加權求和等簡單策略,難以深入挖掘不同層次特征間的語義互補性,限制了模型對全局語義與局部細節的協同表征能力。
針對上述挑戰,本文提出一種基于動態路徑與局部視覺融合的圖像描述生成模型(DP-LVF)。該模型創新性地設計了動態路徑編碼器,通過引入空間上下文建模單元與通道注意力建模單元,分別對輸入樣本的空間多尺度特征與通道信息進行建模,從而構建層次化、多維度的路由空間。在此基礎上,采用空間-通道聯合路由機制,通過自適應權重分配為不同樣本動態分配定制化路徑,顯著提升了模型對多尺度目標的表征能力與計算效率。同時,本文設計了局部視覺融合模塊,通過構建跨層特征聚合網絡整合不同編碼器層的特征表示,實現全局語義與局部細節的互補增強,有效提升了模型對復雜場景的語義解析能力。
本文在MS-COCO標準數據集上進行了系統實驗。結果表明,與現有先進方法相比,本文方法在CIDEr-D、METEOR、BLEU等核心評價指標上均有提升。特別地,與BLIP、OFA等大型視覺語言模型相比,本文方法在保持競爭性性能的同時,顯著降低了計算開銷,更適合實際部署場景。消融實驗驗證了動態路徑與局部視覺融合策略在復雜場景語義解析與關系推理任務中的有效性與優越性。
本文的主要貢獻包括:
(1)提出了一種空間-通道聯合路由(SCJR)機制,突破了傳統動態路由僅基于單域建模的局限,將空間和通道特征聯合建模,實現了跨域路徑的自適應選擇,從而在復雜場景中具備更強的動態表達能力。
(2)提出了一種局部視覺融合(LVF)模塊,不僅實現跨層特征聚合,還通過空間偏移操作增強了局部區域的語義對齊。與常規的特征拼接或加權求和不同,LVF能夠在空間與通道維度同時實現細粒度交互,顯著提升特征融合的有效性。
(3)在MS-COCO數據集上驗證了所提方法的有效性,實驗結果表明其在生成準確性與語義豐富性方面優于現有技術,同時在效率上顯著優于大型視覺語言模型。
本文詳細內容請下載:
http://www.tom3567.com/resource/share/2000007151
作者信息:
王希萌,李鵬輝,趙皓陽,趙文彬
(石家莊鐵道大學 信息科學與技術學院,河北 石家莊 050043)

