《電子技術應用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 基于动态路径与局部视觉融合的图像描述生成
基于动态路径与局部视觉融合的图像描述生成
电子技术应用
王希萌,李鹏辉,赵皓阳,赵文彬
石家庄铁道大学 信息科学与技术学院
摘要: 图像描述生成旨在为图像生成语义连贯的文本描述。现有动态网络多局限于卷积核调整,缺乏空间多尺度与通道级建模,且跨层特征融合方式简单,难以挖掘层次间语义互补。为此,提出一种基于动态路径与局部视觉特征融合的图像描述生成模型。动态路径编码器通过空间与通道建模单元构建多层次路由空间,并基于空间-通道联合路由机制自适应分配路径权重,使网络结构能够依据输入图像动态调整。局部视觉融合模块通过跨层特征聚合增强语义互补。在MS-COCO数据集上的实验表明,该方法具有竞争性性能,验证了所提策略的有效性。
中圖分類號:TP391.41 文獻標志碼:A DOI: 10.16157/j.issn.0258-7998.267774
中文引用格式: 王希萌,李鵬輝,趙皓陽,等. 基于動態路徑與局部視覺融合的圖像描述生成[J]. 電子技術應用,2026,52(7):124-132.
英文引用格式: Wang Ximeng,Li Penghui,Zhao Haoyang,et al. Image caption generation based on dynamic path and local vision fusion[J]. Application of Electronic Technique,2026,52(7):124-132.
Image caption generation based on dynamic path and local vision fusion
Wang Ximeng,Li Penghui,Zhao Haoyang,Zhao Wenbin
School of Information Science and Technology, Shijiazhuang Tiedao University
Abstract: Image caption generation aims to generate semantically coherent text descriptions for images. Existing dynamic networks are mostly limited to adjusting convolutional kernels, lacking spatial multi-scale and channel-level modeling, and the cross-layer feature fusion methods are simple, making it difficult to mine semantic complementarity between layers. To address these issues, this paper proposes an image caption generation model based on dynamic path and local visual fusion. The dynamic path encoder builds a multi-level routing space through spatial and channel modeling units and adaptively allocates path weights based on a spatial-channel joint routing mechanism, enabling the network structure to dynamically adjust according to the input image. The local visual fusion module enhances semantic complementarity through cross-layer feature aggregation. Experiments on the MS-COCO dataset demonstrate that the proposed method has competitive performance, verifying the effectiveness of the proposed strategy.
Key words : image caption generation;dynamic path;spatial-channel joint routing;local visual fusion

引言

圖像描述生成[1]作為計算機視覺與自然語言處理交叉領域的重要研究方向,旨在構建視覺內容與語義文本之間的跨模態映射橋梁,其核心目標是使人工智能系統具備人類水平的圖像理解與語言表達能力。該任務不僅要求模型準確識別圖像中的實體對象,還需深入解析目標間的空間關系、動作關聯及場景上下文信息,以實現對視覺內容的深度語義表征與自然語言描述。

近年來,以卷積神經網絡[2](CNN)和Transformer[3]為代表的深度學習模型在圖像描述生成[4]、視覺問答(VQA)[5]等跨模態任務中表現出色。然而,面對復雜場景下的動態語義建模與多尺度特征融合問題,現有方法仍存在明顯不足。當前主流的動態網絡架構方法[6]多圍繞卷積核的動態調整展開。盡管此類設計在一定程度上增強了模型對輸入數據的自適應性,但仍存在兩大關鍵缺陷:其一,過度關注卷積操作的動態化,而忽視了空間多尺度特征與通道信息的協同建模,導致模型難以充分捕捉多尺度視覺語義信息;其二,部分方法將所有候選模塊置于統一路由空間,引發路由效率低下的問題。此外,在跨層特征融合方面,現有方法普遍采用特征拼接或加權求和等簡單策略,難以深入挖掘不同層次特征間的語義互補性,限制了模型對全局語義與局部細節的協同表征能力。

針對上述挑戰,本文提出一種基于動態路徑局部視覺融合的圖像描述生成模型(DP-LVF)。該模型創新性地設計了動態路徑編碼器,通過引入空間上下文建模單元與通道注意力建模單元,分別對輸入樣本的空間多尺度特征與通道信息進行建模,從而構建層次化、多維度的路由空間。在此基礎上,采用空間-通道聯合路由機制,通過自適應權重分配為不同樣本動態分配定制化路徑,顯著提升了模型對多尺度目標的表征能力與計算效率。同時,本文設計了局部視覺融合模塊,通過構建跨層特征聚合網絡整合不同編碼器層的特征表示,實現全局語義與局部細節的互補增強,有效提升了模型對復雜場景的語義解析能力。

本文在MS-COCO標準數據集上進行了系統實驗。結果表明,與現有先進方法相比,本文方法在CIDEr-D、METEOR、BLEU等核心評價指標上均有提升。特別地,與BLIP、OFA等大型視覺語言模型相比,本文方法在保持競爭性性能的同時,顯著降低了計算開銷,更適合實際部署場景。消融實驗驗證了動態路徑與局部視覺融合策略在復雜場景語義解析與關系推理任務中的有效性與優越性。

本文的主要貢獻包括:

(1)提出了一種空間-通道聯合路由(SCJR)機制,突破了傳統動態路由僅基于單域建模的局限,將空間和通道特征聯合建模,實現了跨域路徑的自適應選擇,從而在復雜場景中具備更強的動態表達能力。

(2)提出了一種局部視覺融合(LVF)模塊,不僅實現跨層特征聚合,還通過空間偏移操作增強了局部區域的語義對齊。與常規的特征拼接或加權求和不同,LVF能夠在空間與通道維度同時實現細粒度交互,顯著提升特征融合的有效性。

(3)在MS-COCO數據集上驗證了所提方法的有效性,實驗結果表明其在生成準確性與語義豐富性方面優于現有技術,同時在效率上顯著優于大型視覺語言模型。


本文詳細內容請下載:

http://www.tom3567.com/resource/share/2000007151


作者信息:

王希萌,李鵬輝,趙皓陽,趙文彬

(石家莊鐵道大學 信息科學與技術學院,河北 石家莊 050043)

2.jpg

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 俄罗斯精品一区二区三区| 久久精品无码中文字幕| 国产日韩欧美自拍| 91精品久久久久久久久| 欧美亚洲激情在线| 亚洲a级在线播放观看| 欧美久久综合性欧美| 久久国产精品99国产精| 欧美激情中文字幕在线| 日本一区免费看| 99久久99久久精品国产片| 一区二区三区在线观看www| 日本高清久久一区二区三区| av在线亚洲男人的天堂| 97干在线视频| 欧美日韩国产精品一区二区| 国产精品无av码在线观看| 久久99国产综合精品女同| 91精品久久久久久久久久另类| 国产精品乱子乱xxxx| 久久夜色精品国产亚洲aⅴ| 欧日韩免费视频| 一区中文字幕在线观看| 亚洲v国产v| 国产精品久久久av久久久| 高清视频一区二区三区| 日韩精品视频在线观看视频| 精品久久国产精品| 日本不卡二区| 日本欧美在线视频| 精品毛片久久久久久| 国产精品视频内| 久久亚洲综合网| 欧美日韩国产91| 欧美综合在线第二页| 亚洲av综合色区| 国产成人成网站在线播放青青| 日韩福利在线| 精品中文字幕在线2019| 精品午夜一区二区三区| 久久中文字幕视频|