【導語】
在工業人機協同裝配場景中,遮擋嚴重影響人體姿態估計的準確性。浙江大學機械工程學院研究團隊在中國科學院一區期刊 Robotics and Computer-Integrated Manufacturing 發表研究,提出一種面向遮擋人機協作場景的視覺-慣性融合人體姿態估計方法。研究中,NOKOV 度量光學動作捕捉系統提供高精度人體姿態真值數據,用于驗證方法在真實裝配環境下的有效性與魯棒性。
一、人機協同裝配中的核心挑戰:遮擋下的人體姿態估計
在人機協作(HRC)裝配過程中,機器人與操作人員近距離協同作業,人體常被設備、工裝或機械臂部分遮擋,導致傳統基于視覺的人體姿態估計(HPE)方法精度下降。
針對遮擋人機協同裝配場景中的人體姿態估計問題,浙江大學研究團隊以工業制造真實需求為背景,探索更具魯棒性與可部署性的解決方案。
二、視覺-慣性融合的人體姿態估計方法設計
1.視覺-IMU 融合的人體姿態估計框架
論文提出一種基于視覺-慣性融合的人體姿態估計方法,以單個 RGB 相機和稀疏 IMUs 作為輸入,在保證估計精度的同時兼顧操作人員的舒適性。

人機協作框架結構
該方法通過多模態數據互補,有效緩解視覺遮擋對人體關鍵點識別帶來的影響。
2.跨模態變換器融合塊設計
研究進一步設計了一種基于特定部位的跨模態變換器融合模塊,用于整合不同模態下的人體空間特征,增強視覺與慣性信息之間的協同表達能力。
三、實驗驗證:公共數據集與真實裝配場景表現
遮擋裝配場景下的實驗驗證結果

人機協同:工業 HRC 裝配箱任務流程圖
研究在兩個公共數據集、一個合成遮擋數據集,以及自建的人機協同裝配 HPE 數據集上進行了系統實驗。

展示了數據集中的六種收集動作(a-f)及遮擋情況(a、c、f)

與不同 HPE 方法在自定義數據集上的定性比較。(黑色虛線:真實姿態;紅色實線:估算姿態)。
在自定義數據集中,NOKOV 度量動作捕捉系統用于采集包含視頻、IMU 數據與 3D 人體姿態真值的完整實驗數據,結果表明該方法在遮擋環境下展現出更高的估計精度與魯棒性。
四、NOKOV度量動作捕捉在姿態估計實驗中的關鍵作用
基于光學動作捕捉的高精度姿態真值獲取

人機協作實驗數據采集系統設置,NOKOV度量光學動作捕捉系統
在實驗驗證階段,研究團隊使用 NOKOV 度量光學動作捕捉系統 獲取高精度人體三維姿態真值數據,用于評估所提方法在不同遮擋條件下的人體姿態估計精度。
NOKOV度量動作捕捉系統在以下方面發揮關鍵作用:
提供亞毫米級精度的人體姿態真值
支撐多模態人體姿態估計方法的定量評估
驗證視覺-慣性融合方法在真實裝配場景中的可靠性
五、人機協同場景中,遮擋環境下人體姿態估計方法FAQ
Q1:遮擋環境下如何實現高精度人體姿態估計?
A1:在遮擋嚴重的人機協同裝配場景中,通過融合視覺信息與慣性傳感器數據進行人體姿態估計,并結合光學動作捕捉系統提供的高精度姿態真值進行驗證,可顯著提升估計結果的魯棒性與準確性。
Q2:光學動作捕捉在人體姿態估計研究中起什么作用?
A2:光學動作捕捉系統如 NOKOV度量動作捕捉系統可提供高精度三維姿態真值,作為驗證新型人體姿態估計方法的基準手段。
Q3:視覺-慣性融合在人類姿態估計中的優勢是什么?
A3:視覺-慣性融合的人體姿態估計方法能夠在單目視覺受限或被遮擋時,利用 IMU 數據補充人體運動信息,從而在保證系統可部署性的同時提高姿態估計穩定性。
Q4:人體姿態估計方法通常如何進行精度驗證?
A4:人體姿態估計方法的精度通常通過光學動作捕捉系統獲取的三維人體姿態真值進行評估,該方式已成為驗證工業人機協作與復雜裝配場景下算法性能的可靠手段。
六、論文及作者簡介
本研究成果“A deep learning-enabled visual-inertial fusion method for human pose estimation in occluded human-robot collaborative assembly scenarios” 發表于中科院一區期刊 Robotics and Computer-Integrated Manufacturing,作者團隊來自浙江大學、普渡大學、瑞典皇家理工學院等國際頂級機構。
作者簡介
王柏村(通訊作者),浙江大學機械工程學院副院長、百人計劃研究員、博士生導師;
宋詞,浙江大學機械工程學院博士研究生;
李興宇,普渡大學工程技術學院助理教授;
周慧穎,浙江大學機械工程學院博士研究生;
楊華勇,中國工程院院士、浙江大學工學部主任、機械工程學院教授、博士生導師;
王力翚,加拿大工程院院士、瑞典皇家理工學院可持續制造學教授及系主任。
該研究為人機協同裝配中的人體姿態估計問題提供了可落地的技術路徑,也展示了NOKOV 度量動作捕捉系統在高端機器人與智能制造研究中的真值支撐能力。

