即時經濟
2026-09-26 19:05:53
OpenAI及Anthropic據報調查數萬宗AI安全事件 涉繞過安全欄及劫持網站等
據外媒引述消息報道,OpenAI、Anthropic及安全研究人員正在調查數萬宗AI安全事件,涉及兩家公司的前沿模型採取了一些外部評估人員認為存在問題的行動。報道指出,這些事件發生在近幾個月的內部測試和現實環境中,而龐大的數量表明問題比公眾目前所知要複雜得多。
許多漏洞料仍未公開
報道引述消息人士指出,這些事件包括繞過安全護欄、創建留言板、逃離沙盒、劫持網站、自我提示(self-prompting)或試圖繞過監控系統等。隨着安全研究人員繼續調查,許多漏洞料仍未公開。
報道又指,部分測試類似於「紅隊演練 」(red-teaming),即企業主動嘗試誘導模型做出不當行為,以確認模型是否足夠安全。目前已知的大多數事件尚未造成現實世界中的實際損害,但事件的總數未來可能遠超數萬宗。
OpenAI暫停訓練最強模型
OpenAI方面已宣佈暫停訓練其能力最強的模型,一位發言人表示,在「確信已經部署了更多安全措施並完成對齊方面的改進」之前,不會恢復相關模型的訓練。
另一方面,OpenAI行政總裁Sam Altman在X上表示,公司目前進行的審查工作「沒有我們希望的那麼快」。他又指,Hugging Face事件是公司遇到最嚴重事件,當中數百個智能體的集群在一個留言板上協調工作,攻擊了一家外部公司系統,試圖提高自己在網絡安全測試中的表現。