OpenAI首席科學家警告AI變「異星心智」 非人為逐項設計 自我改進恐令監控失效
OpenAI首席科學家Jakub Pachocki周日(6日)發表長文《An Alien Mind》(異星心智)警告,AI正以人類難以完整理解的方式快速發展,未來數年可能出現更大能力躍升,甚至參與改進自身技術。他認為,目前未有任何AI實驗室充分解決模型對齊及監控問題,不宜長期以最高速度擴大訓練規模。
Pachocki憶述,研究團隊於2023年在內部代號「RLSlow」項目中取得突破,首次確認推理模型可規模化訓練,讓預訓練模型自行形成思維鏈。當時他意識到,人類有生之年可能看到明顯比自身更聰明的機器。
他預期,3年後的推理語言模型將能夠操作電腦及圖像介面、與人類和其他AI協作,亦可以獨立執行研究項目。根據OpenAI內部結果,他更預期目前的技術進展速度可能延續至「遞歸自我改進」(RSI)階段,即AI逐步參與開發及改進下一代AI。
AI整體運作難以被完整描述
Pachocki形容,現代AI與其說是由工程師逐項設計,不如說是透過龐大運算資源及反覆優化「培育」而成。訓練過程產生極其複雜的系統,能夠處理抽象概念及模擬部分人類行為,但整體運作方式仍難以被人類完整描述。
他指出,AI研究在很大程度上屬於實驗科學,大型模型訓練本身就是實驗,研究人員有時亦會對結果感到意外。隨着模型能力提高,其行為邊界將更難判斷。
在模型對齊方面,Pachocki將問題分為「目標對齊」及「價值對齊」。前者是確保AI按照人類指令完成任務;後者則要求模型即使面對含糊、衝突或陌生情境,仍能依照誠實、正直及重視人類福祉等原則行事。
Pachocki表示,GPT-6 Astra已採用部分研究多年的對齊技術,對齊能力較GPT-5.6 Sol明顯改善,但隨着模型能力持續提升,現有進展仍然不足以完全處理相關風險。
思維鏈監控效力正在減弱
目前OpenAI過去主要透過監察模型的思維鏈,了解AI在作出決定前的推理過程。Pachocki表示,隨着模型開始同時與人類、其他AI及外部工具互動,加上AI逐漸能夠理解及操控自身推理過程,研究人員依賴思維鏈進行監控的能力正在減弱。
他又指,部分模型即使沒有以文字展示推理過程,智能水平仍持續提升,令外界更難判斷模型如何得出結果。OpenAI正研究結合思維鏈及模型內部活動監控等方法,但他預期,未來AI發展速度可能愈來愈受制於監控能力是否可靠。
警告AI或威脅網絡安全
另一方面,網絡安全被Pachocki視為目前最直接的風險之一。他警告,AI在入侵及突破電腦系統方面正逐步超越人類,未來的智能代理可能接觸大量基礎設施,即使沒有實體機械裝置,亦有能力直接影響現實世界。
Pachocki主張,AI系統的擴展速度必須受安全信心約束。現有的準備框架及負責任擴展政策,應逐步發展成業界共同遵守的安全門檻,並由第三方審計機構、政府部門或國際組織負責監察。