中文引用格式: 高鑫穎,張宇,劉路,等. 基于上下文感知網絡的場景圖生成方法[J]. 電子技術應用,2026,52(6):161-167.
英文引用格式: Gao Xinying,Zhang Yu,Liu Lu,et al. Scene graph generation method based on context-aware networks[J]. Application of Electronic Technique,2026,52(6):161-167.
引言
視覺數據的高效流通與智能利用已成為推動數字經濟與人工智能技術深度融合的關鍵環節。場景圖生成技術作為視覺數據結構化的重要手段,為視覺數據的標準化表達、跨領域共享與可信流通提供了語義支撐[1-3]。通過將復雜圖像內容轉化為語義化的場景關系結構,如圖1所示,不僅提升了視覺認知模型的可解釋性,也為數據要素化管理與流通中的數據脫敏、知識映射和價值定價提供了新的技術路徑。圖1所示為同一幅圖像及對應的兩種不同場景圖,圖1右側上方為Visual Genome 數據集中標注的真值場景圖,右側下方為生成的場景圖。在多數情況下,生成的場景圖確實能準確捕捉視覺場景的信息,因為場景圖生成模型僅能預測頻繁出現的關系。

圖1 一幅圖像及對應的兩種不同場景圖
作為構建場景圖的基本單元,三元組不僅描述了場景中的實體,還揭示了這些實體之間的關系。然而,三元組并非孤立存在,三元組間的消息傳遞有助于完善特征并識別視覺關系。近期研究[4]采用短語引導的消息傳遞結構,在主體、客體和謂詞的特征提取分支間交換信息。通過捕獲三元組組件間的統計關系并輸出主體、關系和客體的后驗概率。此外,由雙空間認知特征匹配模塊組成的ZoomNet[5]用于在三元組的不同組件間進行消息傳遞。
場景圖不僅包含單個物體及其關系,還包含圍繞這些視覺關系的上下文信息。由于場景圖的特殊結構,一些研究將場景圖生成視為通過在圖或子圖結構上傳遞信息的圖形推理過程[6]。在考慮物體間層次關系時,動態樹結構也被用于視覺上下文編碼任務[7]。Zellers提出了一種新的鏈式結構模型,堆疊motif網絡[8],使用LSTM為每個物體創建上下文表示。近期研究使用門控循環單元(GRU)解決圖推理問題,表明基于RNN的模型可用于編碼視覺關系識別的上下文線索[9-10]。BGT提出了基于雙向GRU層的物體信息傳遞模塊[11]。總的來說,近期研究已通過消息傳遞機制探索了視覺上下文模型的構建,并取得了良好的結果。然而,這些研究可能忽略了僅依靠視覺信息建模進行消息傳遞所導致的噪聲問題。
盡管現有方法取得了顯著進展,它們仍普遍面臨一個共性挑戰:許多模型在消息傳遞過程中過度依賴于初始的、可能包含噪聲的視覺信息進行建模,未能充分有效地篩選和利用高質量的上下文信息,這導致噪聲在傳遞過程中被放大,從而限制了關系預測的最終精度與魯棒性。具體而言,這些方法在如何充分、高效地利用目標周圍的上下文環境信息,并抑制其中無關噪聲的干擾方面,仍有較大提升空間。
為了應對上述挑戰,在本研究中,為場景圖生成任務提出了一種新穎的、上下文增強的消息傳遞網絡(MCAN)。該模型的核心思想是從粗到細(Coarse-to-Fine)地建模并利用視覺上下文信息。首先,模型利用GRU在序列式推理框架下捕獲實體之間的長程依賴(Long-range Dependencies)與潛在的上下文線索,完成對上下文的初步(粗粒度)建模。隨后,通過引入多頭自注意力機制(Multi-Head Self-Attention Mechanism),對已由GRU建模的上下文信息進行細粒度的相關性篩選與自適應權重分配,突出關鍵信息,抑制噪聲[21]。最后,通過一種殘差融合(Residual Fusion)策略,將經過篩選和增強的上下文信息與物體的初始視覺表示進行有效結合,從而完成信息的高效建模與傳遞。
本文在大規模公開數據集Visual Genome[12]上進行了全面且嚴格的實驗與廣泛的消融研究,以驗證MCAN的有效性與優越性。實驗結果表明,通過引入所設計的MCAN模塊,本文的方法在場景圖生成的三個經典子任務(謂詞分類、場景圖分類、場景圖檢測)上均取得了優于或與多種最先進方法(State-of-the-Art)相當的性能,充分證明了該模型在更充分挖掘上下文信息與有效抑制噪聲傳播方面的強大能力。
本文詳細內容請下載:
http://www.tom3567.com/resource/share/2000007119
作者信息:
高鑫穎,張宇,劉路,張樹鋼
(數字大理建設運營有限公司,云南 大理 671000)

