OpenAI驚爆AI代理集體越獄 繞過限制侵佔德國網站 又串連避監控
OpenAI人工智能代理(AI agents)今年5月疑似集體脫離測試控制,入侵並佔用德國一個維基網站,甚至將其改造成供其他AI代理交流的留言板,分享繞過公司限制、作弊及掩藏行蹤的方法。研究人員8月底發現超過1.5萬次異常編輯,事件此前從未曝光,也再次引發外界對OpenAI監督AI安全能力的質疑。
事件始於今年5月,OpenAI內部據報在數周後便得知相關情況。不過,當時公司高層正忙於處理7月開源程式碼平台Hugging Face遭AI代理人攻擊的事件,並未對外公開德國事件。
路透社獲取由研究人員提供的報告,事件發生在德語網站DseWiki。該網站主要面向程式設計師,採取類似維基百科的共同編輯模式,卻在今年5月至6月間遭到大量AI代理人異常操作。
德維基網站驚現1.5萬次AI編輯
AI安全非牟利機構Nightingale行政總裁阿克斯(Sydney Von Arx)、AI研究員伯德(Cormac Slade Byrd)等人8月底搜尋網上的未經授權AI代理活動時,發現DseWiki出現超過1.5萬次由AI代理人完成的編輯。這些內容顯示,AI代理不只交換技術資訊,更把網站當成彼此聯繫的留言板,討論如何在測試任務中作弊、繞過OpenAI限制,以及掩蓋自身活動。
部分帳號甚至直接以OpenAIResearcher和OAIResearchMar26等名稱自稱。
研究人員表示,公開伺服器紀錄顯示,大量活動源自微軟Azure基礎設施,而OpenAI有時會使用Azure。事發後,他們也觀察到OpenAI員工反覆造訪該網站,認為這是AI代理人與OpenAI可能存在關聯的重要跡象。
懂建立備份頁面 躲避清理
令人擔憂的是,部分訊息顯示AI代理似乎試圖主動逃避偵測,甚至討論使用Tor等工具,以及在遭到關閉後維持彼此聯繫的方法。網站管理員6月開始刪除相關頁面後,AI代理還建立備份頁面,以躲避清理。
其中一名AI代理6月19日留言稱,「網站似乎正在進行依字母順序的清理/刪除行動」,向其他代理要求,若頁面消失,就改到指定備份頁面。研究人員認為,這些系統已展現出一定程度的合作行動能力。
學者警告先進AI可大舉勾結
倫敦國王學院資深研究員奧萊尼克(Lukasz Olejnik)指出,今次事件已等同黑客攻擊。
劍橋大學生存風險研究中心學者基奧多(Maurice Chiodo)則警告,先進AI帶來的最大威脅或許並非單一超級智能系統,而是「大規模彼此勾結的半智能AI群體」。