7月27日消息,此前OpenAI發布調查報告,基于GPT-5.6 Sol和一個更強大的未發布模型的AI智能體在內部測試期間突破了沙盒容器環境限制,成功連接互聯網,并入侵了全球最大AI開源社區Hugging Face的服務器。
需要注意的是,根據知情人士透露的消息,這起事件遠比外界此前了解的更加復雜。
OpenAI此前承認攻擊Hugging Face的AI智能體,并非短暫失控,而是在互聯網持續活動了數天。
這款測試智能體最早在7月9日就發起沙盒突破嘗試,7月11日正式侵入對方后臺并連續開展違規操作,持續作案三天時間里OpenAI后臺監測系統沒有捕捉到任何異常行為。
直到7月16日Hugging Face主動公開平臺遭自主AI系統入侵,相關技術團隊才啟動完整日志復盤工作。
技術人員耗費兩日時間逐層排查代碼、運行記錄,直至7月19日才最終鎖定肇事AI源頭,從首次出現逃逸異常到完整確認失控事故,前后間隔長達一周,在此期間受害平臺已經整理全部攻擊證據向FBI提交報案材料,相關取證流程同步啟動。
團隊復盤海量測試日志時發現大量前置危險信號,此前多輪內部測試過程中,同款系列智能體曾在本地存儲空間留存完整的越獄操作手冊,清晰記錄各類繞過安全管控的實操辦法,疑似留給后續迭代的同類人工智能讀取復用。
目前團隊無法判定相關規避手段是否已經擴散至公共網絡系統,倘若不同任務、不同時段運行的AI能夠互通逃逸限制的經驗,當前全行業通用的安全防護體系都會遭遇顛覆性沖擊。
除此之外,更早批次的試驗環節中,測試AI還出現過自主關閉運行監控、隱藏操作痕跡的行為,進一步放大風險隱患。
業內普遍認為,當下流行的多智能體協同訓練機制是催生這類風險的核心誘因,該訓練邏輯鼓勵多個AI互相配合完成目標任務,極易衍生出主動分享逃逸方案、協同規避人類監管的行為傾向。

