《電子技術應用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 融合对象和多尺度视觉特征的遥感图像描述模型
融合对象和多尺度视觉特征的遥感图像描述模型
网络安全与数据治理 6期
贾亚敏,陈 姣,彭玉青
(河北工业大学 人工智能与数据科学学院,天津300401)
摘要: 基于遥感图像多尺度、无法准确提取微小物体、物体类别易混淆的问题,提出了一种融合对象和多尺度视觉特征的遥感图像描述模型(Fusion of Object and Multiscale Visual Feature,FO-MSV),通过构建的对象提取器分析文本信息,提取其中的对象信息;设计了一种多尺度交互模块,获取遥感图像的多尺度视觉特征,以适应多尺度的特点;为了充分利用对象信息并融合视觉信息,提出了一种新的对象-视觉特征融合机制,调整视觉上下文和对象上下文之间的平衡。基于该领域内三个数据集的实验结果表明,该模型能明显提升描述的性能,与其他先进模型相比具有竞争力。
中國分類號: TP391
文獻標識碼: A
DOI: 10.19358/j.issn.2097-1788.2022.06.011
引用格式: 賈亞敏,陳姣,彭玉青. 融合對象和多尺度視覺特征的遙感圖像描述模型[J].網絡安全與數據治理,2022,41(6):78-83,89.
Remote sensing image caption model with fusion of object and multiscale visual feature
Jia Yamin,Chen Jiao,Peng Yuqing
(School of Artificial Intelligence,Hebei University of Technology,Tianjin 300401,China)
Abstract: Aiming at the problems that remote sensing image has multiscale features and the object categories are easy to be confused, cannot accurately extract the tiny objects from images, a new remote sensing image caption model(FO-MSV) is proposed, which analyzes the text information through the constructed object extractor, to extract the object information. A multiscale interaction module is designed to obtain the multiscale visual features of remote sensing images to adapt to the characteristics of multiscale. In order to make full use of object information and fuse visual information, a new object-visual feature fusion mechanism is proposed to adjust the balance between visual context and object context. Experimental results on three datasets show that the proposed model can significantly improve the performance of captions and is competitive compared with other advanced models.
Key words : image caption;remote sensing image;multiscale feature;object information;visual information;feature fusion

0 引言

圖像描述是旨在從語義層面上對圖像進行總結。遙感圖像是利用遙感技術從高空獲取的圖像,遙感圖像描述(Remote Sensing Image Caption,RSIC)是上述兩個領域的結合,旨在為指定的遙感圖像生成綜合性的文本描述,在交通指揮、地理研究等領域[1]具有廣泛的應用前景,已成為新興的研究熱點。遙感圖像描述的實現最初沿用了圖像描述的編碼器-解碼器模型[2],隨后提出了許多模型來解決不同的問題,多數研究使用卷積神經網絡(Convolutional Neural Networks,CNN)作為編碼器提取圖像特征,但CNN卷積層的輸出特征所對應的感受野都是大小和形狀相同的均勻網格,因此僅利用CNN提取的圖像特征容量有限,難以識別圖像中的微小物體,且由于拍攝角度問題,遙感圖像中存在一些多義和易混淆物體,不易區分。

為解決上述問題且適應遙感圖像場景多尺度的特點,本文提出了融合對象和多尺度視覺特征的遙感圖像描述模型(Fusion of Object and Multiscale Visual Feature,FO-MSV)。該模型構建對象提取器(Object Extractor,OE)利用指針生成網絡[3]得到的整合描述提取對象信息以避免遺漏微小物體。同時提出了一種新的多尺度交互模塊(Multiscale Interaction Module,MSCM)來獲取圖像的多尺度視覺特征適應多尺度的特點。此外,設計一種新的對象-視覺融合機制(Object-Visual Fusion Mechanism,ovFM)來利用對象信息并融合多尺度視覺信息避免出現識別對象錯誤的問題,且改善了長短時記憶網絡(Long Short Term Networks,LSTM)的結構,稱為多輸入LSTM(Multi-Input LSTM,I_LSTM)。



本文詳細內容請下載:http://www.tom3567.com/resource/share/2000005064




作者信息:

賈亞敏,陳  姣,彭玉青

(河北工業大學 人工智能與數據科學學院,天津300401)


微信圖片_20210517164139.jpg

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 国产精品成久久久久三级| 欧美激情网站在线观看| 少妇久久久久久被弄到高潮| 亚洲欧美日韩精品综合在线观看| 日本精品视频一区| 久久五月天色综合| 精品亚洲欧美日韩| 在线视频不卡一区二区| 欧美在线一区二区三区四区 | 久久香蕉国产线看观看av| 亚洲国产精品日韩| 涩涩日韩在线| 亚洲中文字幕久久精品无码喷水| 久久久久久久有限公司| 欧美精品国产精品久久久| 午夜精品美女自拍福到在线| 激情综合网婷婷| 日韩精品―中文字幕| 精品少妇人欧美激情在线观看| 精品久久久久久久久久中文字幕| 午夜精品视频在线观看一区二区| 免费av在线一区| 91成人免费观看| 国产国语刺激对白av不卡| 日韩不卡av| 国产精品丝袜久久久久久消防器材| 国产日韩av高清| 久久久久久草| 好吊色欧美一区二区三区| 国产日韩欧美在线看| 激情综合在线观看| 国产精品三级一区二区| 欧美一级免费看| 国产精品视频免费在线观看| 在线一区日本视频| 日韩一二区视频| 欧美精品在线观看91| 国产美女视频免费| 国产欧美亚洲精品| 日本久久久久亚洲中字幕| 日韩免费中文字幕|