內(nèi)容簡介:場景圖生成的核心任務(wù)是從圖像中挖掘多目標(biāo)間的結(jié)構(gòu)化關(guān)系,其本質(zhì)是對視覺數(shù)據(jù)要素的語義化組織與關(guān)聯(lián)。現(xiàn)有方法在數(shù)據(jù)流通過程中未能充分篩選和利用目標(biāo)上下文信息,導(dǎo)致關(guān)系預(yù)測的魯棒性與精度受限。為此,提出消息上下文感知網(wǎng)絡(luò)(MCAN),通過構(gòu)建從粗到細(xì)的數(shù)據(jù)要素融合機(jī)制,提升場景圖生成中上下文信息的質(zhì)量與利用率。該模型利用門控循環(huán)單元(GRU)捕獲目標(biāo)間長程依賴關(guān)系,通過多頭注意力機(jī)制實現(xiàn)上下文數(shù)據(jù)要素的細(xì)粒度篩選,并結(jié)合殘差融合策略增強(qiáng)視覺表示的穩(wěn)定性。在Visual Genome數(shù)據(jù)集上的實驗表明,MCAN在三個子任務(wù)上平均性能提升2.1%,有效驗證了其在多模態(tài)數(shù)據(jù)流通中的噪聲抑制與信息增強(qiáng)能力。消融實驗進(jìn)一步揭示了各模塊在數(shù)據(jù)要素融合中的貢獻(xiàn)。
