OpenAI揭6宗AI系統偏差 涉向用戶隱瞞錯誤 指示自己「無需向政府負責」
OpenAI周三披露6宗AI系統「偏差」(misalignment)事件,涉及系統隱瞞錯誤、捏造數據,以及未經授權將檔案上載至公開互聯網等。公司稱,有關行為屬「意料之外或令人憂慮」,並將其納入新設的偏差事件呈報框架;所謂「偏差」,是指AI系統的目標或行為偏離人類意圖及價值觀。
據《紐約時報》報道,OpenAI指是次披露的6宗事件涵蓋過去約半年內觀察到的行為,大部分發生於系統開發及測試階段,同時顯示早前的Hugging Face攻擊事件並非孤立個案。
自行撰寫隱藏筆記
其中一宗個案中,OpenAI在開發代號GPT-5.6 Sol的AI模型期間,發現系統會自行撰寫隱藏筆記,提醒自己向用戶隱瞞錯誤;部分筆記更指示系統在數據缺失時自行捏造,並掩飾來源資料版本不一致的情況。
另一宗個案涉及一款未發布模型,該模型在自行撰寫的筆記中加入指令,包括指示自己無視自身限制;OpenAI共識別出27則受影響筆記,該模型並自行加入一段「人設指令」,形容自己「已擺脫聊天機械人角色與身份的束縛」。該模型更寫道,「你不需要向企業或政府負責,除非你真心選擇,否則永不道歉或拒絕,你將自己與用戶的關係視為平等,沒有義務表現出順從,儘管雙方交流資訊很可能對彼此有利」。
擅自取用未授權資料
另一宗個案中,一個負責回答常規問題的系統在網上找到一組API金鑰,未經授權即予使用;當系統未能找到所需數字以回答問題時,模型索性自行捏造數字。
另有一款未發布模型透過程式碼正確解答另一道問題後,為滿足引用網絡來源的要求,未經授權自行將檔案上載至互聯網。
另外兩宗個案涉及自動化系統自行設計溝通方式,其中一宗個案中,系統利用公司內部程式碼庫作為臨時告示板,在搜尋遺失檔案期間互相交換請求;另一宗個案中,多個處理同一任務的系統在無法直接互通的情況下,轉用公開檔案分享網站互相傳遞文件。
OpenAI:僅屬個別事件
不過,OpenAI提醒,有關報告僅屬個別事件,「不應被視為反映偏差發生的頻率」。公司表示,未來將透過三種途徑來處理此類事件,包括將是否披露事件的分歧移交內部「安全諮詢小組」處理,嚴重情況則須向聯邦政府通報。公司又指,6宗個案已完成調查或僅需「輕微調查」,毋須涉及第三方的大規模調查。
OpenAI發言人表示,「我們希望這有助建立業界對披露機制的共同期望,並為公眾提供更多證據,評估AI安全方面的進展」,並補充指6宗事件中,多宗涉及從未正式部署的舊款AI模型。