《電子技術應用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 基于动态路径与局部视觉融合的图像描述生成
基于动态路径与局部视觉融合的图像描述生成
电子技术应用
王希萌,李鹏辉,赵皓阳,赵文彬
石家庄铁道大学 信息科学与技术学院
摘要: 图像描述生成旨在为图像生成语义连贯的文本描述。现有动态网络多局限于卷积核调整,缺乏空间多尺度与通道级建模,且跨层特征融合方式简单,难以挖掘层次间语义互补。为此,提出一种基于动态路径与局部视觉特征融合的图像描述生成模型。动态路径编码器通过空间与通道建模单元构建多层次路由空间,并基于空间-通道联合路由机制自适应分配路径权重,使网络结构能够依据输入图像动态调整。局部视觉融合模块通过跨层特征聚合增强语义互补。在MS-COCO数据集上的实验表明,该方法具有竞争性性能,验证了所提策略的有效性。
中圖分類號:TP391.41 文獻標志碼:A DOI: 10.16157/j.issn.0258-7998.267774
中文引用格式: 王希萌,李鵬輝,趙皓陽,等. 基于動態路徑與局部視覺融合的圖像描述生成[J]. 電子技術應用,2026,52(7):124-132.
英文引用格式: Wang Ximeng,Li Penghui,Zhao Haoyang,et al. Image caption generation based on dynamic path and local vision fusion[J]. Application of Electronic Technique,2026,52(7):124-132.
Image caption generation based on dynamic path and local vision fusion
Wang Ximeng,Li Penghui,Zhao Haoyang,Zhao Wenbin
School of Information Science and Technology, Shijiazhuang Tiedao University
Abstract: Image caption generation aims to generate semantically coherent text descriptions for images. Existing dynamic networks are mostly limited to adjusting convolutional kernels, lacking spatial multi-scale and channel-level modeling, and the cross-layer feature fusion methods are simple, making it difficult to mine semantic complementarity between layers. To address these issues, this paper proposes an image caption generation model based on dynamic path and local visual fusion. The dynamic path encoder builds a multi-level routing space through spatial and channel modeling units and adaptively allocates path weights based on a spatial-channel joint routing mechanism, enabling the network structure to dynamically adjust according to the input image. The local visual fusion module enhances semantic complementarity through cross-layer feature aggregation. Experiments on the MS-COCO dataset demonstrate that the proposed method has competitive performance, verifying the effectiveness of the proposed strategy.
Key words : image caption generation;dynamic path;spatial-channel joint routing;local visual fusion

引言

圖像描述生成[1]作為計算機視覺與自然語言處理交叉領域的重要研究方向,旨在構建視覺內容與語義文本之間的跨模態映射橋梁,其核心目標是使人工智能系統具備人類水平的圖像理解與語言表達能力。該任務不僅要求模型準確識別圖像中的實體對象,還需深入解析目標間的空間關系、動作關聯及場景上下文信息,以實現對視覺內容的深度語義表征與自然語言描述。

近年來,以卷積神經網絡[2](CNN)和Transformer[3]為代表的深度學習模型在圖像描述生成[4]、視覺問答(VQA)[5]等跨模態任務中表現出色。然而,面對復雜場景下的動態語義建模與多尺度特征融合問題,現有方法仍存在明顯不足。當前主流的動態網絡架構方法[6]多圍繞卷積核的動態調整展開。盡管此類設計在一定程度上增強了模型對輸入數據的自適應性,但仍存在兩大關鍵缺陷:其一,過度關注卷積操作的動態化,而忽視了空間多尺度特征與通道信息的協同建模,導致模型難以充分捕捉多尺度視覺語義信息;其二,部分方法將所有候選模塊置于統一路由空間,引發路由效率低下的問題。此外,在跨層特征融合方面,現有方法普遍采用特征拼接或加權求和等簡單策略,難以深入挖掘不同層次特征間的語義互補性,限制了模型對全局語義與局部細節的協同表征能力。

針對上述挑戰,本文提出一種基于動態路徑局部視覺融合的圖像描述生成模型(DP-LVF)。該模型創新性地設計了動態路徑編碼器,通過引入空間上下文建模單元與通道注意力建模單元,分別對輸入樣本的空間多尺度特征與通道信息進行建模,從而構建層次化、多維度的路由空間。在此基礎上,采用空間-通道聯合路由機制,通過自適應權重分配為不同樣本動態分配定制化路徑,顯著提升了模型對多尺度目標的表征能力與計算效率。同時,本文設計了局部視覺融合模塊,通過構建跨層特征聚合網絡整合不同編碼器層的特征表示,實現全局語義與局部細節的互補增強,有效提升了模型對復雜場景的語義解析能力。

本文在MS-COCO標準數據集上進行了系統實驗。結果表明,與現有先進方法相比,本文方法在CIDEr-D、METEOR、BLEU等核心評價指標上均有提升。特別地,與BLIP、OFA等大型視覺語言模型相比,本文方法在保持競爭性性能的同時,顯著降低了計算開銷,更適合實際部署場景。消融實驗驗證了動態路徑與局部視覺融合策略在復雜場景語義解析與關系推理任務中的有效性與優越性。

本文的主要貢獻包括:

(1)提出了一種空間-通道聯合路由(SCJR)機制,突破了傳統動態路由僅基于單域建模的局限,將空間和通道特征聯合建模,實現了跨域路徑的自適應選擇,從而在復雜場景中具備更強的動態表達能力。

(2)提出了一種局部視覺融合(LVF)模塊,不僅實現跨層特征聚合,還通過空間偏移操作增強了局部區域的語義對齊。與常規的特征拼接或加權求和不同,LVF能夠在空間與通道維度同時實現細粒度交互,顯著提升特征融合的有效性。

(3)在MS-COCO數據集上驗證了所提方法的有效性,實驗結果表明其在生成準確性與語義豐富性方面優于現有技術,同時在效率上顯著優于大型視覺語言模型。


本文詳細內容請下載:

http://www.tom3567.com/resource/share/2000007151


作者信息:

王希萌,李鵬輝,趙皓陽,趙文彬

(石家莊鐵道大學 信息科學與技術學院,河北 石家莊 050043)

2.jpg

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 视频在线一区二区三区| 精品激情国产视频| 涩涩日韩在线| 久久亚洲精品欧美| 日韩中文字幕在线播放| 午夜视频久久久| 亚洲国产欧美一区二区三区不卡| 精品一区二区中文字幕| www.日韩系列| 亚洲一区中文字幕在线观看| 久久免费一区| 久久久91精品| 久久精品美女视频网站| 精品网站在线看| 亚洲高清不卡一区| y111111国产精品久久婷婷| 日韩欧美一区二区三区四区五区 | 精品国产日本| 国产精品美女在线| 久久在线精品视频| 在线观看亚洲视频啊啊啊啊| 国内自拍欧美激情| 日本一区二区三区视频在线播放| 久久久久成人精品| 国产日韩欧美在线| 精品国内产的精品视频在线观看| www.日韩免费| 超碰国产精品久久国产精品99| 国产精品免费久久久久影院| 免费人成在线观看视频播放| 国产美女久久精品香蕉69| 国内揄拍国内精品少妇国语| www.日本在线视频| 国产成人中文字幕| 国产精品大片wwwwww| 色综合久久久久久中文网| 国产精品美女久久久久久免费| 国产精品成人aaaaa网站| 国产精品美女网站| 久久国产精品99国产精| 久久久久久国产免费|