中文引用格式: 李松,王麗綺,張祺,等. 基于強化學習的多智能體協同任務分配與仿真驗證[J]. 電子技術應用,2026,52(5):16-23.
英文引用格式: Li Song,Wang Liqi,Zhang Qi,et al. Reinforcement learning-based multi-agent collaborative task allocation and simulation validation[J]. Application of Electronic Technique,2026,52(5):16-23.
引言
近年來,智能體迅速發展[1],在各個領域都得到了廣泛應用,但是當任務環境越來越復雜時,單智能體由于其執行能力有限,無法完成大規模的任務,因此通過多智能體協同配合執行任務成為了智能體應用的主流。
國內外研究者分別從不同的角度對關于多節點的任務分配[2]問題進行了探索[3]。在靜態任務分配方面,田震等[4]基于多類型基因編碼的改進遺傳算法,實現對協同任務分配問題的求解;鄧可等[5]提出了基于改進的量子粒子群算法,在多智能體任務分配問題中,提高了任務分配的精度與尋優效率,使任務分配達到全局最優值;許可等[6]基于分布式拍賣算法,根據已知的任務情況提前進行分配,實現任務收益最大化。上述方法雖然在一定程度上能夠實現任務分配,但在動態復雜的任務環境下,難以滿足實時性和優化性的要求。因此,越來越多的學者在動態分配方面進行了大量研究。李相民等[7]提出了在時間窗口約束下,通過一致性聯盟算法解決多智能體的動態任務分配問題;孫鵬等[8]進行了基于突發事件的任務分配研究,以最小完成時間為目標函數,通過貪婪算法進行可執行任務的動態分配,但忽略了任務截止時間的約束。上述主要研究每個任務的完整分配,而不是根據任務的實際情況進行任務中的調整,并且只進行有限次數的分配。吳蔚楠等[9]主要采取分布式遺傳算法來解決環境中多智能體任務協同動態分配問題,但忽略了高動態任務場景中不斷下發新任務時,任務的完成時間約束帶來任務完成度低的問題。
隨著人工智能[10]技術的發展,強化學習[11](Reinforcement Learning, RL)逐漸被引入任務分配領域,其通過智能體與環境的交互學習,能夠在復雜場景中實現動態決策。然而,現有研究中,強化學習在任務分配中的應用仍處于初期階段,尤其是在多智能體協同任務[12]和動態任務分配問題上,研究成果較為有限。針對動態任務場景下多智能體協同任務分配效能較低的問題,本文提出了一種基于深度強化學習的協同任務分配方法,結合深度Q網絡(Deep Q-Network, DQN)[13]算法,旨在解決動態任務分配中的關鍵問題。通過構建智能體與環境的交互模型,利用DQN算法實現任務分配的動態優化,以提升確認的效率和效果。本文的研究結果將為未來節點的智能化任務分配提供理論支持和技術參考,具有重要的學術價值和應用意義。
本文詳細內容請下載:
http://www.tom3567.com/resource/share/2000007066
作者信息:
李松,王麗綺,張祺,顧念祖
(中國人民解放軍91977部隊, 北京 100036)

