內(nèi)容簡介:基于凍結(jié)大語言模型的圖像字幕生成方法突破了傳統(tǒng)模型在利用外部知識方面的限制,但容易過度依賴文本先驗,導(dǎo)致視覺特征利用不足和描述幻覺問題。為此,提出一種適配語義對齊的圖像字幕方法,通過視覺壓縮模塊和語義路由模塊,構(gòu)建視覺與文本數(shù)據(jù)要素間的流通路徑,實現(xiàn)跨模態(tài)語義的精準(zhǔn)對齊與高效交互。在MSCOCO、Flickr30k和NoCaps等基準(zhǔn)數(shù)據(jù)集上的實驗結(jié)果表明,該方法能夠在保持較低可訓(xùn)練參數(shù)量的同時,有效促進(jìn)多模態(tài)數(shù)據(jù)要素的價值傳遞,達(dá)到當(dāng)前先進(jìn)性能水平,為工業(yè)應(yīng)用提供了可靠解決方案。
